​现在的AI视频与其说是"生成”,不如说是”抽卡"。但要在电商场景落地,我们需要的是精准控制,今天分享一套经过实战验证的SOP工作流,实现人物、服装、动作的高度连贯。

那么接下来,按照我的思路和步骤,你也可以做出这样的作品,一起来实操吧~


准备工具

方案一: 可以使用多个平台模型进行生成(下方内容所有提示词皆可套用)。 Nano banana pro (https://gemini.google.com) veo3.1(https://gemini.google.com) 方案二: FlowPix https://www.flowpix.club工作流平台,如下图:


第一步:构建人物“灵魂”

不管是 Nano banana pro 还是 Midjourney,高质量的底图是视频成功的一半。我们首先利用 Gemini 3 Pro 强大的逻辑推理能力,将抽象的需求转化为精准的绘画提示词。 核心参数输入模型: 为了保证人设的稳定性,我们需要先自定义以下标准化参数,将这些参数交给Gemini3pro 以下是我的参数 年龄: 20 - 22 岁。 性别: 女。 人种: 高加索人种(典型的英格兰长相,皮肤透着健康的红润)。 特点: 轮廓清晰,拥有经常运动带来的紧致下颌线。耳朵上排着几个精致的小银环(耳骨钉),展现出一种叛逆的活力。 年龄: 20 - 22 岁。 性别: 女。 人种: 高加索人种(典型的英格兰长相,皮肤透着健康的红润)。 特点: 轮廓清晰,拥有经常运动带来的紧致下颌线。耳朵上排着几个精致的小银环(耳骨钉),展现出一种叛逆的活力。 头发: 亚麻浅金色(Ash Blonde),扎成一个利落的高马尾,或者是一个略显随性的高碎发发髻(Messy Bun)。额前有几缕被汗水或微风拨乱的碎发,显得非常自然。 五官: 眼睛: 清澈的天蓝色,睫毛浓密,眼神中透着自信和一点“不好惹”的酷劲。 鼻子: 笔直且带有轻微的小驼峰,显得英气十足。 唇部: 饱满且涂了透明唇蜜,看起来自然湿润。 穿搭: 上装: 一件连帽卫衣 气质: 自信、充满生命力、阳光但带着一点街头冷淡感。她步履轻盈,看起来像是随时准备去健身房,或是骑着自行车穿梭在伦敦繁忙的街道上。


第二步:产品植入与换装

得到满意的人物底图(图1)后,为了展示我们真实的商品(如视频中的 Nike 卫衣): 局部重绘/换装: 上传你的产品实拍图,直接使用Nano banana pro将人物原本的衣服替换为目标商品。

重点:这一步要确保衣服的材质、Logo(如 Nike 刺绣)、抽绳细节与实物一致。

第三步:绘制关键帧脚本

这是“一镜到底”最核心的步骤。我们要像画分镜一样,生成一组连续的静态图(图1 - 图7)。 图1(起始): 人物看镜头。 图2(咖啡): 人物手持咖啡,看镜头。 图3(展示): 人物低头看衣服,手指指向 Logo 刺绣。 图4(细节): 镜头推近,展示领口和抽绳细节。 图5(面料): 展示袖口紧实度。 图6(互动): 人物拉起帽子准备戴上。

图7(戴帽): 帽子完全戴好,包裹住头部。 技巧: 每一张图都是基于上一张图进行微调,确保人物长相、环境光影严格一致,只改变动作。

第四步:首尾帧“桥接"生成

有了这一组连续的图片,我们不再盲目生成视频,而是使用"首尾帧”: ClipA:设置[图1]为起始帧,[图2]为结束帧生成视频片段。

Prompt:

女孩正在手持拍摄一个UGC风格的TikTok视频,自然地说着话,就像在社交媒体上和亲密朋友聊天一样。她21岁,就像在和朋友八卦一样。肢体语言和面部丰富。阴雨天气。她说:"Honestly, I didn't expect it to be this cold today. Good thing I grabbed this hoodie before heading out for coffee; it's a lifesaver."说话的同时举起右手的咖啡


第五步:剪辑与合成

将生成的ClipA,B,C...按顺序导入轨道。

由于我们是首尾相连生成的,视频片段之间的衔接会非常丝滑,几乎看不出剪辑痕迹,形成"一镜到底”的视觉错觉。

只需要简单拼接即可。

在评论区上传你的作品制作成果,一起来讨论吧!