这几天帮一个做家居用品的客户赶制30秒商品视频,用的正是Wan 3.0。项目名称就叫“Wan 3.0做30秒商品视频,多张图、视频和声音参考怎么分工”。客户给过来的素材相当“丰富”:五张产品实拍图、两段之前活动拍的真人口播视频、三四段随手录的环境音和BGM。乍一看素材越多越好,结果我一开始把所有东西一股脑全塞给Wan 3.0,生成出来的东西成了四不像:产品A的外观,配着视频B的动作,声音节奏和画面卡点完全对不上,整个30秒像是三个互不相识的人拼车坐在一起。后来把所有输入重新梳理,把参考图、参考视频、声音参考各自的职责边界划清楚,整个流程才真正跑顺。
这篇文章就把这套“分工逻辑”完整写出来。不是官方教程,是我自己踩过坑之后的实操总结,给正在用Wan 3.0做电商素材的人一个参考,同时也算是给团队内部留一份可复用的SOP。做商品短视频的运营、剪辑、电商设计,应该都能用得上。30秒不长,但要在30秒里把产品讲清楚、让用户产生购买欲,还要加上AI生成的不确定性,分工这件事比想象中重要得多。
1. 30秒商品视频的底层逻辑与Wan 3.0的定位
1.1 为什么偏偏是30秒
市面上主流电商平台的商品主图视频、信息流投放素材,普遍把时长定在15到30秒。15秒适合单一卖点强推,30秒则多了一个“起承转合”的空间:前5秒抓住注意力,中间15到20秒展示产品核心卖点和场景,最后5秒引导转化。Wan 3.0生成视频时,单次出片长度通常也在几秒到十几秒之间,所以做30秒成片时,往往需要分段生成再拼接,或者利用工具的分镜功能一次规划好。此时如果只有一张参考图,生成出来的内容会非常单薄;但如果同时给了多张图、视频、声音,又会出现“多源打架”的问题。把每个模态的职责定义清楚,就是整个项目的起点。
做30秒内容的难点在于节奏感。用户刷到的是一条竖屏短视频,如果前3秒没有视觉焦点,手指就划走了。Wan 3.0这类生成式工具和传统剪辑软件不同,它无法靠“剪”来解决节奏问题,必须在输入阶段就把信息层次规划好。参考图负责“产品长什么样”,参考视频负责“镜头怎么动”,声音参考负责“情绪节奏怎么走”。三者互不替代,也最好不要越界。
1.2 Wan 3.0的三路参考机制到底改变了什么
过去用传统剪辑工具做商品视频,流程是先拍、后剪、再配乐,素材之间是“拼接关系”。Wan 3.0这类AI视频生成工具则不同,它提供的是“参考图+参考视频+声音参考”的多模态输入能力,目标是让模型理解你想要的画面内容、运动规律和听觉风格,然后在生成时把三股信息融合进同一段视频里。
我第一次用的时候,以为参考视频就是给模型“抄作业”,参考图就是“贴图”,声音参考就是“背景歌”。实际跑过之后才明白,Wan 3.0对三路输入的解读方式是不同维度的。参考图主导的是“一致性”,保证生成出来的物品细节和实物对得上;参考视频主导的是“动态遗传”,决定镜头推移、物体旋转、光影渐变这些时间维度的信息;声音参考主导的是“节奏和氛围”,让模型在生成时尽量让画面的切换频率、情绪调性和音轨匹配。说到底,这是从“线性剪辑”到“并行生成”的转变,输入结构决定了输出质量。
1.3 三种参考的本质区别与协作模型
可以拿做菜打个比方。参考图等于“菜单上的成品图”,让后厨(也就是模型)知道这道菜最终端上来应该长什么样;参考视频是“厨师示范颠勺的视频”,告诉他动作该怎么连续、火候怎么变化;声音参考则是“餐厅的背景音乐”,决定整个用餐体验是快节奏的酒吧风,还是舒缓的下午茶风。菜单、示范、音乐,三者服务的是同一道菜,但作用阶段完全不同。
在实际项目中,这三者的优先级也不是并列的。如果只保一个,我建议优先保参考图,因为商品视频的核心目标是“讲清楚产品”,画面里产品长得不对,后面全是白搭。参考视频优先级第二,它负责让画面不呆板,但前提是不能让运动过程扭曲了产品形态。声音参考优先级可以往后放,尤其是当它和画面发生冲突时,宁可重新找音频,也不要为了迁就声音而牺牲画面的产品可见性。协作模型就一句话:参考图定形,参考视频定动,声音参考定调。
2. 分工方案:参考图、参考视频、声音参考各自负责什么
2.1 参考图:主体一致性是第一优先级
参考图在Wan 3.0里的核心作用是锁住“产品身份”。做保温杯就上传保温杯的正面无遮挡图,做口红就要有口红的正面和膏体特写。这里有一个很多新手容易犯的错误:以为图片越多越好,上传了产品包装图、场景图、模特图、细节图,结果生成出来的产品反而发生畸变。原因是多张参考图如果视角差异过大,模型可能把不同图片里的产品理解成不同物体,然后在生成时出现“缝合感”或主体漂移。
我实测下来,参考图数量控制在2到5张比较合适,且必须满足一个原则:同一视角、同一光线条件下拍摄。比如三张图分别对应正视图、45度侧视图、顶部俯视图,拍的时候光圈、色温、背景都尽量一致。这样模型才能把这些图当成“同一个物体在不同角度的样子”,而不是“三个不同的物体”。我自己习惯把一张“主图”(通常是正面的白底图)放在第一位,后面再放辅助角度图,让模型优先吃透主图的特征。
除了数量,还有一个小技巧:参考图里的背景越干净越好。Wan 3.0不仅会学产品,还会学背景。如果背景是凌乱的办公室台面,生成时背景里就会出现类似纹理的杂物,画面会显得很脏。想控制背景的话,不如直接用白底图做参考,生成后再考虑后期叠加场景图层。
2.2 参考视频:镜头运动与动作逻辑
参考视频负责的是“镜头语言”。同样一个杯子,镜头是静止不动、缓慢推进、还是环绕旋转,给用户的感受完全不同。Wan 3.0可以通过参考视频学到这套运动逻辑,这也是它比单纯图片生成强的地方:你给一段3秒的产品旋转展示视频,模型就能把旋转运动迁移到新生成的片段里,同时保持参考图中的产品外观。
但参考视频选不好,会带来灾难性的后果。我最开始上传的那段真人口播视频,画面中有明显的人物手势和头部动作,模型就把这些动作也学了进去,生成出来的产品视频里,保温杯像被一只无形的手在“扭动”,画面非常诡异。所以选参考视频的原则是:动作目的明确,且只包含你希望成品里出现的运动。想做产品旋转,就选一段产品在转盘上匀速旋转的视频;想做镜头推进,就选一段镜头匀速向物体靠近的素材;想做环绕运镜,就选一段围绕主体移动的镜头。视频里出现人物、动物、手势等非线性元素,越少越好。
另外要注意参考视频的时长和帧率。时长建议在3到5秒,太长模型可能捕捉到多余的动作片段;帧率建议不低于24fps,保证动作轨迹有足够的采样密度。我碰到的另外一个问题是,参考视频的分辨率太低时,模型对运动的抽象会变得模糊,可能把“旋转”理解成“抖动”,所以素材能要高画质就要高画质。
2.3 声音参考:节奏卡点与氛围定调
声音参考是很多人容易忽略的一个输入项。Wan 3.0支持导入音频来做生成时的节奏参考,我在实际操作中发现,它不单单是把音乐当作背景,还会直接影响到画面的切换频率和运动烈度。比如音乐是快鼓点,生成出来的画面切换和镜头运动也会偏快;如果是舒缓的钢琴曲,镜头就会趋于平稳。
做商品视频时,声音参考可以直接上传成片里要用的BGM,也可以上传一段打点音频(比如有明确踩点的节奏音轨)。我用的是后一种思路:先剪辑好30秒的粗剪音频,标出来哪些位置是卖点强调,哪些位置是产品展示,然后把这个音频作为声音参考输入。这样生成出来的画面节奏,和最终要配乐的卡点天然就对齐了,后面合音频时非常省事。
声音参考的边界在于:它决定的是节奏和氛围,不是内容本身。你不可能用它来让模型“说出”某句台词,也别指望它能识别歌名或者歌词语义。另外,有一个小注意点:如果声音参考岁月静好,但参考视频里是快速旋转运镜,模型通常会让画面跟随声音的舒缓节奏慢下来。这时候就要考虑谁让步。我的习惯是节奏优先,因为画面速度后期可以用倍速来调整,而音乐一改,整个氛围就变了。产品视频的BGM选择优先级高于运镜速度,观众对“顺不顺耳”的感觉比对“运镜炫不炫”更敏感。
2.4 三路参考的优先级与冲突处理
三路参考同时存在时,冲突无法完全避免。优先级处理方案可以总结成一个简单的决策树:
- 产品外观与参考图不一致,优先相信参考图。如果参考视频的运镜会导致产品形变,立即更换参考视频,而不是修改参考图。
- 画面运动速度与声音节奏不一致,优先迁就声音。因为画面可以后期调速,音频重新选曲的成本更高。
- 声音情绪与画面内容不匹配,优先保证产品信息清楚。比如声音很欢快但画面里产品是静态摆放,那就说明参考视频缺了运动,需要补一段动态素材,而不是剥掉音乐。
- 多张参考图出现光线不统一,优先相信主图,并减少辅助图数量,避免给模型传递矛盾的光影信息。
这些原则是我跑坏了十几版之后总结出来的。说白了,Wan 3.0生成视频不是“我给它什么它就用什么”,更像是在做一个“选择题”:输入的信息越一致,模型的发挥就越稳定;输入的信息互相打架,模型就会用自己的理解去“折中”,而折中的结果通常都是四不像。
3. 实操流程:从素材整理到成片输出的完整拆解
3.1 前期素材准备:每种参考的具体要求和采集技巧
先说参考图。我的建议是用手机或相机拍一套“产品素颜照”:白底、自然光、三个视角各拍一张,后期统一裁成1:1或4:5,分辨率不低于1920像素。不要用网上下载的带水印的图,也不要用加了很强滤镜的图,模型会把滤镜和产品主体一起学到。拍摄时固定相机位置,只旋转产品,保证三张图的透视关系一致。如果产品太小(比如口红),可以考虑微距镜头,把膏体纹路拍清楚,这样生成出来的特写镜头才不会失真。
再说参考视频。素材就一个目标:干净的单动作素材。拍的时候用三脚架,不要手持,防止多余晃动被模型学走。常见可选动作包括:产品在可旋转底座上匀速转一圈、镜头从远到近匀速推进、镜头围绕产品弧线环绕45度。每个动作单独拍一条,时长3到5秒,背景纯色、光线均匀。拍摄时不要有其他人或物入镜,这样才能保证模型学到的运动是“镜头运动”,而不是“物体运动”。
最后是声音参考。如果已经选好了成片的BGM,可以直接用完整音轨;如果还在挑音乐,建议先用一段节拍器音频或打点节奏做参考。我自己的习惯是先用“节拍参考”,把每个镜头的时间轴卡好之后,再替换成正式BGM。这样生成的画面节奏不会因为临时换音乐而变得松散。用节拍参考的时候,注意拍号要和最终BGM接近,否则后期会非常痛苦。
3.2 30秒脚本分镜表:以一款保温杯为例
拿客户那款保温杯来做示例。30秒的视频,我拆成6个镜头,每个镜头大约5秒,但按内容权重分配时间,用户实际注意力集中在中间卖点上:
| 时间轴 | 镜头内容 | 参考图 | 参考视频 | 声音参考 |
|---|---|---|---|---|
| 0-4s | 保温杯全景白底展示,快速旋转一周 | 主图-正视图 | 匀速旋转视频 | 鼓点渐入 |
| 4-10s | 杯身细节特写,镜头缓慢推进 | 细节图-杯口螺纹 | 镜头推进视频 | 节奏平稳 |
| 10-16s | 使用场景:咖啡倒入杯中,杯盖拧紧 | 场景图+杯盖图 | 倒水动作参考视频 | 高潮前铺垫 |
| 16-22s | 杯盖密封展示,360度环绕运镜 | 俯视图 | 环绕运镜视频 | 节奏收紧 |
| 22-26s | 温度显示/实测效果,特写+轻微推镜 | 功能图 | 轻微推镜视频 | 节奏保持 |
| 26-30s | 产品横移,品牌信息露出,画面渐出 | 主图-侧视图 | 横向平移视频 | 收尾落定 |
这个分镜表的关键在于:每个镜头的参考图只取1到2张,参考视频只取一个动作,声音参考统一用同一段节奏线索。很多新人做不好,就是因为在一个镜头里塞了太多信息,模型负担太重。一个镜头一个动作,生成的成功率会成倍上升。
3.3 生成参数实测与调整
Wan 3.0生成的参数设置,我这边实际跑下来几个关键项大概是这样的:
- 分辨率:建议直接拉到最高(至少1080x1920竖屏,或按平台要求设置)。分辨率低了,后期做二次构图基本没有空间,单靠AI是没法补细节的。
- 帧率:30fps足够。商品视频不需要60fps,反而高帧率会增加生成时长,且对动作瞬间的捕捉会更敏感,容易把参考视频里的抖动放大。
- 单段生成时长:5到8秒比较稳定。之前试过直接生成10秒以上,到后面产品会发生漂移。分段生成后,用剪辑软件拼接,既有可控性,又能规避模型的“长时遗忘”。
- 首尾帧:如果能设置,建议在每段开头放一张参考图作为首帧,结尾放下一段的参考图作为尾帧,这样段与段之间的衔接更自然。
- 运动幅度:控制在中等偏下。对于商品视频来说,产品主体不要做太剧烈的位移,运动主要体现在镜头上。
- 随机种子:同一镜头多生成几次,挑最稳定的版本。跑的时候如果觉得某一段不错,但有点小瑕疵,可以用同一种子微调参数再跑。种子这个东西,耗时不长,耐心多试几个。
运行环境方面,Wan 3.0比较吃显卡显存。我们在工作室用的一块16GB显存的卡,生成5秒1080p的视频,单次要等两到五分钟。建议批量操作时做好时间规划,别等快下班了才开始跑素材。云端方案也可以,但上传下载大视频文件的时间损耗也很明显,这个看个人网络情况。
3.4 三路参考的投放顺序与叠加技巧
投放顺序这件事,网上教程很少提,但实际影响很大。我的做法分三步:
第一步,先只投参考图。选一个镜头,给模型喂参考图,其他输入留空,生成一版“静态基线”,确认产品外观和角度都正确。这一版本如果不对,后面加任何输入都没意义。
第二步,加入参考视频。在参考图不变的前提下,加上该镜头的运动参考,跑一版,确认运动是否正常、产品是否发生形变。此时不要开声音参考,减少干扰维度。
第三步,加入声音参考。前两版都通过后,最后加音频,验证节奏是否匹配,画面是否会跟随音乐发生不必要的调整。如果出现问题,优先调整参考视频,而不是声音。
这个步骤看起来简单,但配合排查时非常高效。一旦画面出问题,你就能知道是哪一层引入的“变量”出了问题。直接全量输入,出了问题都不知道从哪下手。
3.5 后期合成与音频对齐
分段生成的素材最后要进剪辑软件。我在合成阶段踩过一个大坑:以为Wan 3.0参考了声音,生成出来的画面就自带卡点,结果合出来发现每一段的节奏都对,但段落之间没有逻辑衔接。后来我改变思路:分段生成时,每段之间留出0.2秒左右的重叠帧,拼接时用交叉淡化,让转场更顺滑;同时不要让每个镜头都正好卡在音乐重拍上,适当错开半拍,反而更有呼吸感。
音频对齐的时候,我习惯先把声音参考版本的节奏位置标记出来,然后用生成的画面去对齐这些标记。如果某一帧的画面切换比音乐早了几帧,就在剪辑软件里整体平移素材,不要在画面内部调速度,否则会让AI生成的运动变得不自然。整体平移素材是成本最低、效果最稳定的对齐方式。
4. 常见问题与排查技巧实录
4.1 问题速查表
这套流程跑下来,最常遇到的问题就那几类。整理成表格,方便大家遇到问题直接对照。
| 现象 | 可能原因 | 排查方向 | 解决方案 |
|---|---|---|---|
| 产品外观漂移 | 参考图视角不统一或数量过多 | 检查参考图视角是否一致 | 减少辅助图,统一采用同机位素材 |
| 产品形状扭曲 | 参考视频动作幅度过大 | 检查参考视频是否包含剧烈运动 | 换成匀速旋转或缓慢推进的动作 |
| 画面抖动明显 | 参考视频手持拍摄或帧率过低 | 确认拍摄素材是否使用三脚架 | 重新拍摄固定机位素材,或换帧率更高素材 |
| 生成画面和声音节奏不搭 | 声音参考和参考视频节奏冲突 | 判断是运动过快还是声音过快 | 优先保留声音,换运动幅度更小的参考视频 |
| 背景出现无关杂物纹理 | 参考图背景不够干净 | 查看参考图是否有复杂背景 | 换白底图或纯净背景素材 |
| 段落拼接后颜色不统一 | 分段生成时光线条件有变化 | 检查参考图色温是否一致 | 统一参考图白平衡,后期统一调色 |
| 多张参考图“缝合感”明显 | 参考图之间特征差异过大 | 确认是否为同一产品同一光线 | 选择同一批次拍摄的照片 |
4.2 我的常用排查思路与避坑清单
经验法则第一条:一次只改一个变量。如果生成结果出问题,先别急着把所有输入都换掉。保留参考图,去掉参考视频,看问题是否还在;再加回参考视频,去掉声音,一层层排除。这个过程慢,但省心。我大概有80%的问题都出在参考视频上,因为很多人(包括我自己第一次)总低估了参考视频对画面的影响量级。
第二条:参考图的“第一位”很重要。Wan 3.0对多张参考图的权重分配并不是完全平均的,第一张图往往承担了最主要的身份识别作用。所以第一张一定要放产品最正、最清楚、背景最干净那张。如果你放了一张氛围感很强的场景图当第一张,模型可能把氛围当成主角,后续生成出来的画面产品占比就会变小。
第三条:声音参考不是“非要不可”。如果我只需要一个静态产品展示镜头,完全可以把声音参考留空,后期直接配乐。只有需要画面和节奏强绑定的镜头(比如开场快切、卖点强调),才值得让声音参考介入。少给一个输入,就少一个出错的可能。
第四条:多图输入注意“主从关系”。如果你非要同时用多张参考图,建议用后期软件把几张图拼在同一张画布里,然后保证第一张是主图。比如把产品白底图放在画布偏左三分之二的位置,细节图放在右侧小图位置。Wan 3.0对整图的理解会更连贯。这个方法不保证对每个版本都有效,但对于多视角需求比较明确的商品,实际效果比单独传多张图更稳。
还有一个小细节:时间充裕的话,同一组输入多跑几个版本。AI生成有随机性,同一组参数连续跑两次,画面细节也会不同。跑5到8个版本,从中选最稳定、最接近原产品的那一版,比反复调参数更高效。参数调太狠,反而会让产品失去“原汁原味”。
4.3 项目复盘:客户交付后的真实反馈
这个项目的保温杯视频最终交付后,客户的评价是“产品很真实,动作不夸张,节奏舒服”。最大的功臣其实是分工方案:参考图保证了产品“长得很像”,参考视频保证了镜头“动得自然”,声音参考保证了整体“看得不累”。客户说能感觉到产品的质感是真实拍摄的那种,而不是AI生成的“塑料感”。这恰恰说明,只要输入结构清晰,生成式工具完全能做出商业可用的内容。
做AI视频生成,最怕的不是技术不行,而是“什么都想用”。参考图、参考视频、声音参考,每一项都是双刃剑:用好了互相成就,用乱了互相拆台。我的建议是,每次生成前问自己三个问题:这一镜需要锁定的产品外观是哪张图?想要的镜头运动是哪段视频?应该匹配的情绪节奏是哪段声音?三个问题有清晰答案,Wan 3.0才能给你一个清晰的成片。
我在实际制作中最深的体会是:不要高估模型的“理解力”,也不要低估它的“模仿力”。你给它的每一条参考,它都会认真学,甚至是你不希望它学到的背景杂物、手持晃动、画面噪声。所以素材的干净程度,决定了成品的天花板。这套分工方法也许不是Wan 3.0的唯一解法,但对于需要批量产出商品视频的团队来说,它足够稳定、可复用、可交接。下次再做类似项目,我大概率还是会先打开这个SOP,把每个镜头的参考图、参考视频、声音参考先填好,再开始生成。