Picsart 的视频产品负责人聊 Wan3.0 提示词技巧时,我最初以为会听到一堆“魔法参数”或“必背公式”。但读完公开分享后,我最大的感受是:提示词在 Wan3.0 这类视频模型里,根本不是“输入一句描述、等结果”这么简单。它更像是一个导演在开拍前给全组写的分镜说明——你的提示词写得有多清晰,模型交付的画面就有多接近你脑子里的那版。
这不是玄学。从产品团队的角度看,提示词是视频生成工作流里最容易被低估、也最值得投入的一环。因为模型推理能力再强,也需要从你的文本里提取意图;如果你的指令里既有主体、又有运动、还有镜头路径和风格方向,那它们如何排列、如何侧重、如何避免互相干扰,就成了决定成片质量的关键。
这篇文章不会把 Wan3.0 的提示词技巧整理成“十大万能模板”。我更想拆清楚的是:为什么同一个模型,有人写出来的提示词稳定又可控,有人写出来却像开盲盒。以及,如果你真的要用 Wan3.0 跑生产级视频,该怎么把提示词从“碰运气”变成“可复用流程”。
1. 先理解 Wan3.0 读取提示词的方式,而不是急着抄公式
很多人在用 Wan3.0 之前,已经有文生图的提示词习惯。比如写“一只戴帽子的柴犬,坐在咖啡馆窗边,阳光洒进来”,这种描述在图片模型里通常能得到不错的结果。但放在 Wan3.0 这类视频生成模型里,它大概率只会生成一段“静态感很强、动态感很弱”的视频。
原因很简单:视频生成模型要处理的维度比图片多一个时间轴。它不仅要理解画面里有什么,还要理解画面里发生了什么、镜头怎么动、运动节奏如何。这也是 Wan3.0 提示词技巧的核心逻辑——你不是在写静物清单,而是在写动态剧本。
1.1 视频提示词更像导演指令,而不是静态描述
如果把提示词看作指令,那它应该包含几个 W 和一个 H:
- Who:画面主体是谁。
- Where:画面发生在什么环境。
- What:主体正在做什么动作,动作如何变化。
- When:是什么样的时间感,白天、夜晚、黄昏,还是某种年代感。
- How:镜头如何运动,推、拉、摇、移,还是固定机位。
这听起来像基础课,但大多数提示词翻车,恰恰是因为只写了前三项,把“动作变化”和“镜头运动”完全交给模型自由发挥。
Wan3.0 的运动能力和镜头控制能力比较强,但它不会自动替你做导演决策。如果你不写明“镜头缓慢推进”或“跟拍主体侧面”,它通常会选择一个最稳妥的镜头语言——比如固定机位或者轻微晃动。这意味着你拿到手的视频也许不差,但会和你设想的叙事节奏完全不是一回事。
1.2 模型读提示词时,是有“优先级”的
实际落地时,Wan3.0 对提示词不同元素的敏感度并不一样。从产品团队反复测试的经验来看,视频生成模型通常会优先处理“主体是谁”“主体在哪”“主体在动”这三个信息,然后才是光线、风格、镜头运动这些修饰性信息。
这里有一个特别容易踩的坑:把风格词写太长,把运动词写太短。比如“赛博朋克风、霓虹灯光、电影感、胶片颗粒、4K 高清、细节丰富、一个穿雨衣的男人走在雨中”,这种提示词里最核心的动作只有“走在雨中”,但风格限制词占了大部分长度。模型在解析时可能会被风格词带走,导致动作显得僵硬,甚至出现人物左右横跳。
更合理的做法是反过来的:先把主体动作写清楚,再补风格限制。
注意:Wan3.0 的提示词不是“越详细越好”。要详细的是“运动路径”和“动作变化”,而不是堆砌形容词。
2. 把提示词拆成五层结构,才能稳定复用
从 Picsart 视频产品负责人的分享里,我印象最深的一个观点是:不要把提示词当成一行文本,而要当成一个结构化清单。只有结构化,你才能复盘“上一次到底哪句话导致镜头乱飞”,也只有结构化,你才能在不同项目里复用同一套写法。
我结合自己做视频生成项目的经验,把提示词拆成五层结构。这套结构不一定适合所有模型,但用在 Wan3.0 上确实比“想到哪写到哪”稳定很多。
2.1 主体层:用最短的话锁定画面核心
主体层要回答的问题是:画面里最重要的是什么。
如果你希望生成一只穿着宇航服的猫,那“猫”和“宇航服”就是主体层的全部。不要在这里写太多修饰语,更不要急着写环境。
一个实用技巧:主体层的描述控制在 15 个字以内。因为 Wan3.0 需要把主体锁定后才能规划运动;如果主体描述太长、负载体过多,模型很容易把某个次要特征当成主角,然后整个画面就跑偏了。
比如:
错误:一只穿着银色宇航服、戴着透明头盔、背后有蓝色喷气背包的橘猫,脸上带着坚毅的表情,大步走在月球表面,脚下扬起灰尘这个描述的问题不是信息错,而是信息太多。模型可能在“橘猫”“蓝色喷气背包”“坚毅的表情”之间难以取舍,甚至生成一只有背包但没有猫头的怪物。
更稳妥的主体质感写法是:
一只穿着银色宇航服的橘猫,走在月球表面2.2 环境层:给出空间和光线的锚点
环境层不需要面面俱到,只需要给模型几个关键锚点。
比如“月球表面”已经暗示了低重力、灰色地表、黑暗星空,你不需要再写“灰色岩石、环形山、黑暗太空背景”。Wan3.0 对常见场景的常识理解,通常比你想象的更准确。
真正值得写的是光线。光线会直接影响视频的氛围和主体质感。同样是“走在月球表面”,午后强光、蓝灰环境光、背光剪影,出来的结果完全不同。
所以产品团队给出的经验是:环境层只写“空间 + 光线方向”两个要素。
空间:月球表面,远处有蓝色地球 光线:侧面强光,主体边缘有清晰轮廓光2.3 运动层:视频提示词真正的分水岭
运动层是 Wan3.0 提示词技巧里最核心、也最容易被忽略的部分。
很多新手写提示词时,运动描写只有“走”“跑”“跳”这种动词。但视频生成模型真正需要的是“动作如何变化”以及“动作如何完成”。
同样是“猫走在月球表面”,你可以写:
猫缓慢向前走,每一步都溅起月尘,头部微微左右摆动,宇航服因为低重力而显得轻盈这一大段运动描述,比单纯“走在月球表面”要有效得多。因为 Wan3.0 需要从文本里推断运动轨迹、物理反馈和节奏。你给的信息越具体,模型的运动预测就越稳定。
运动层还有一个隐藏收益:当你把动作写细致后,模型会自动减少那些毫无意义的“漂移”“扭曲”“镜头跳变”。因为它的生成空间被你的文本约束住了。
2.4 镜头层:把摄影师的决策权拿回来
镜头层是“用提示词控制 Wan3.0”和“被 Wan3.0 随机控制”之间的分界线。
Wan3.0 支持多种镜头运动的表达,比如推进、拉远、环绕、跟随、手持、俯视、仰视、升降。但注意,同一段视频里不需要写太多种运镜方式。运镜越复杂,模型出错概率越高。
实际测试里,比较稳定的做法是“一个主体动作 + 一段镜头运动”。比如:
镜头从猫的正面缓慢推进,然后随着猫走过画面,镜头改为侧面跟随,最后停在猫的背影上这段描述最明显的特征是:镜头运动和主体动作是绑定在一起的,而不是两个互不相干的指令。如果你只写“镜头缓慢推进”,却不说明镜头跟着谁推进,模型可能会让整条轨道穿过主体,或者推进到一半就停住。
这里有个经验:镜头运动越晚出现,对画面构图的影响越小。所以如果你想强调“画面先是一个全景,然后镜头推近到猫的眼睛”,就把“从全景开始”放在运动层之前。
2.5 风格层:最后再考虑电影感
风格层包括画质、影调、材质、媒介特征,比如“胶片质感”“赛博朋克”“浅景深”“纪录片风格”“灰绿色调”。
这部分在 Wan3.0 提示词里的优先级其实是最低的。不是说风格不重要,而是如果你在主体、运动、镜头都没写清楚的情况下先堆一堆风格词,模型很容易为了满足风格而牺牲物理稳定性。
建议风格层放在提示词最后,而且只保留 2 到 3 个关键限制词。
风格:胶片颗粒,低饱和度,浅景深如果你一次性写“电影级视觉效果、8K 超清、高级质感、王家卫风格、梦幻光效、背景虚化、色彩浓郁”,模型会出现两个问题:
- 风格词之间互相打架,最后生成一种四不像风格。
- 风格词占据了文本权重,导致主体和动作的细节被忽略。
3. 从一句话到稳定提示词的完整流程
有了五层结构之后,写提示词就不再是“灵感创作”,而是“参数填表”。但填表也需要一个可复制的流程,避免你在项目里一上来就写长篇大论,然后失败后不知道从哪改。
我建议先跑通“最小可用提示词”,再逐步叠加。
3.1 最小可用提示词:一句话先把画面立住
所谓最小可用,就是只包含“主体 + 动作 + 环境”的最短提示词,不包含任何风格和镜头描述。
比如你最终想要一个很酷的无人机沙漠镜头,最小可用提示词可以写成:
一架白色无人机在沙漠上空快速飞行,扬起沙尘,镜头跟随这个提示词的作用是验证两件事:
- 主体是否被正确识别。
- 动作和物理规律是否成立。
如果这个阶段已经出现无人机变形、沙尘异常、飞行方向混乱,那就说明问题不在提示词技巧,而可能在模型版本、分辨率设置或者负面提示词上。先解决底层问题,再往上叠加细节。
3.2 分层叠加:每次只加一层变量
最小可用提示词测试通过后,下一步不是直接写成完整长篇,而是按“运动层 → 镜头层 → 风格层”的顺序一层层叠加。
每一层叠加后,都生成一条短视频,对比前后效果。这样做的好处是:当某个环节出现问题,你能立刻定位是谁导致的。
比如你发现主体没问题、动作没问题,但画面看上去像监控摄像头,明显缺乏镜头设计。那你只需要修改镜头层,而不是重新写整条提示词。
3.3 建立自己的小样本提示词库
一个人的记忆是有限的,但提示词库不会。
我平时会建一个表格,记录每次测试的提示词、生成结果、问题点和修改方向。表格字段大致如下:
| 提示词版本 | 主体层 | 运动层 | 镜头层 | 风格层 | 效果评级 | 问题点 |
|---|---|---|---|---|---|---|
| v1 | 无人机飞过沙漠 | 快速飞行 | 无镜头描述 | 无风格 | 中 | 运动方向不稳 |
| v2 | 同左 | 快速直线飞行 | 侧面跟随 | 胶片感 | 良 | 沙尘较少 |
| v3 | 同左 | 快速直线飞行,前段俯冲 | 侧面跟随,逐渐拉远 | 胶片感 | 优 | 可复用 |
这个表不仅能帮你积累经验,还能在项目结项时复盘:到底是模型能力限制了效果,还是提示词功力不到。
4. 最容易翻车的三个误区,以及对应的排查链路
哪怕你理解了五层结构,实际跑 Wan3.0 时还是会遇到各种怪问题。下面三个误区是我见过最多的。
4.1 误区一:把提示词写成“长句作文”
很多人觉得提示词写得越像一段优美文字,模型生成效果越好。但在 Wan3.0 这种视频生成模型里,长句作文反而会稀释核心信息。
比如:
在一个阳光明媚的午后,一只浑身雪白的萨摩耶犬,开心地奔跑在金黄色的麦田里,远处有连绵的群山,天空中飘着白云,整体画面充满诗意和浪漫的乡村氛围这段文字在人类读者看来画面感很强,但模型在解析时,会把它拆成多个语义单元。语义单元越多,每个单元分配到的权重就越低。结果就是:狗可能是对的,麦田可能是对的,但“奔跑”这个动作可能表现得很弱。
更合理的写法是拆成短句,并用逗号或者分号区隔:
一只白色萨摩耶犬在金黄色麦田里奔跑,四肢动作明显,带起尘土,午后阳光,远处有群山,浅景深4.2 误区二:运动词和镜头词互相矛盾
比如你写“主体静止不动,镜头缓慢推进”,模型会困惑:到底是以主体为参照系,还是以镜头为参照系?如果主体真的完全静止,那镜头推进后,画面会显得很不自然。
更实用的是写“主体缓慢转头,镜头顺时针环绕主体半圈”。这样镜头运动和主体运动就有了逻辑关系,模型更容易生成连贯画面。
4.3 误区三:忽略负面提示词的作用
Wan3.0 的负面提示词虽然有,但很多人没有好好用。常见问题包括:画面出现多只手指、文字扭曲、画面闪烁、主体变形、镜头跳变。
负面提示词可以针对性地写:
lowres, bad anatomy, bad hands, missing fingers, blurred, jittery, watermark, text但注意,负面提示词不是越多越好。写得太多反而可能压制正常生成。从经验看,负面提示词里最常用的是这几类:
- 质量问题:模糊、低分辨率、噪点。
- 人体问题:手指错误、肢体畸形、面部扭曲。
- 动态问题:闪烁、抖动、镜头跳动。
- 附加物问题:水印、文字、多余物体。
4.4 排查链路:先定位是哪一层出了问题
当生成结果不符合预期时,我不建议立刻改变全部提示词。正确做法是逐层排查:
- 先看主体:画面里的核心物体是否正确。如果主体都不对,可能是主体层描述不明确,或负面提示词误伤了主体。
- 再看运动:动作是否存在、是否连贯、是否符合物理逻辑。如果动作僵硬,优先优化运动层,而不是加更多风格词。
- 再看镜头:镜头的推拉摇移是否按你的设想走。如果镜头乱来,说明镜头层没有说清楚,或提示词里出现了多个互相独立的镜头指令。
- 再看风格:影调、质感、光线氛围是否符合预期。如果风格不对,检查是否堆了过多语义冲突的风格词。
- 最后看环境:分辨率、采样步数、种子数、负面提示词权重等环境参数是否合理。
这个排查链路和“先改提示词,不行再换模型”的随机式操作完全不同。它逼着你把问题归因到具体层,从而保证每次测试都在积累有效经验。
记住:Wan3.0 提示词不是一次性写出来的,而是一轮轮调出来的。真正稳定的提示词,背后一定有一份失败笔记。
5. 这套提示词技巧适用在哪,不适用在哪
任何一套提示词方法论都有边界。Picsart 视频产品负责人的分享之所以值得参考,也是因为它来自真实生产环境,而不是实验室里的“理论上可行”。
5.1 适合哪些场景
- 你已经有明确的创意脚本或镜头设想,只是需要模型快速产出视频预演。
- 你需要在多个候选提示词之间做对照测试,筛选一条进入正式生成。
- 你需要把同一批提示词复用到不同片段,生成一系列风格统一的短视频。
- 你想用 Wan3.0 做产品宣传片、短视频内容、广告创意预演、动画分镜,而不是把它当作“随机创意生成器”。
这些场景的共同点:你对视频的最终效果有预判,提示词是为了缩小“预期”和“模型输出”之间的距离。
5.2 不适合哪些场景
- 你完全没有画面想法,只希望模型给你一个惊喜。这种方式当然可以用,但不需要复杂的提示词技巧,随便写一句也能得到不错的结果。
- 你需要在视频里精确控制多角色复杂交互、物体物理碰撞、镜头和多个角色之间的复杂走位。这类任务对提示词要求极高,但单纯靠提示词仍然不够,往往需要后期修复或局部重绘。
- 你需要生成超长视频。Wan3.0 输出的时长有一定限制,提示词技巧不能突破模型本身的帧数窗口,它只能优化“单位时间内的画面质量”。
5.3 长期使用还需要补齐的工程能力
从产品团队的经验看,提示词只是 Wan3.0 工作流里的第一环。真正要稳定生产,还要考虑:
- 版本管理:模型版本更新后,提示词效果可能会发生变化,需要重新回归测试。
- 错误定位:什么时候该改提示词,什么时候该改负面词,什么时候该改参数,不能混为一谈。
- 预算控制:视频生成比图片生成贵很多,批量跑提示词测试时,最好先小样本取样,确认方向没问题再放大。
- 素材管理:生成结果要按项目、版本、提示词、参数统一归档,否则一个月后你想复盘某条视频,根本找不到当时用的提示词。
6. 提示词技能,才是视频生成工作流里更持久的护城河
Wan3.0 这类开源视频模型会越来越多,能力也会越来越强。但提示词不会因为模型变强而变得没用,反而会变得更加重要。原因是,模型能力越强,输出空间越大,越需要你用精准的指令来锁定方向。
Picsart 视频产品负责人分享里的一个观点,和我的判断是一致的:提示词不是“咒语”,而是一种结构化的沟通方式。它把一个人脑中的画面意图,翻译成模型可以理解并执行的参数化描述。
从这个角度看,写提示词不是在和工具对话,而是在训练自己的“表达能力”。一个能把提示词写清楚的人,在跟团队沟通创意、写文档、做方案时,往往也能更快地把复杂需求讲明白。这种能力不会随着某个模型的过时而失效。
如果你现在刚开始接触 Wan3.0,我的建议是:不要奔着“最强提示词模板”去,而是先拿一个主题,用五层结构把它写出来,然后做 10 次小样本测试,记录每次变化。当你发现某个修改点稳定地带来了画面改进时,你就真的理解了 Wan3.0 的脾气。那时候,提示词技巧才真正属于你。