MiniMax H3 的提示词到底难在哪?如果你最近在用它生成视频,大概率碰到过这种场景:提示词里明明写了“人物从画面左侧走入,停下,回头,然后突然奔跑”,结果模型生成的画面里,人物从出现到跑开只用了两秒,中间的动作全被吞掉了。更让人崩溃的是“两名成年男性”这种最简单的数量约束,输出画面里却活生生变成了一个人,或者多出一个路人。
这不是个例。文生视频模型的“不听话”问题,比文生图模型严重得多。原因在于视频生成要在时间维度上展开,模型既要理解每一帧里有什么,还要理解这些内容在几秒内以什么顺序发生。你写的一长串描述,模型可能只抓到了其中一部分,而且它更倾向于抓“名词”,忽略“动词”和“顺序”。
这篇文章要解决的不是“背几个万能提示词模板”,而是一个更本质的问题:怎么让 MiniMax H3 稳定听懂你的意思。我会从官方提示词规范里提炼出五个核心维度,基于这五个维度做一个 Prompt Skill——一个可以复用的提示词编译技能包,最后用 A/B 实测的方式,对比自由编写和 Skill 生成两条路径的差距。
判断先行:MiniMax H3 本身的能力并不差,差的是我们喂给它的信息结构。绝大多数“不听话”不是模型听不懂中文,而是提示词里信息打架、顺序混乱、重点被稀释。你需要的不是更多形容词,而是一套稳定的信息架构。
1. 为什么 MiniMax H3 的提示词这么难写
先还原一个典型的生产场景。假设你要做一个 5 秒的动作片段,第一版提示词可能是这样写的:
“一个穿着黑色冲锋衣的男人在雨天的街道上,看起来很酷,他出拳打向另一个穿灰色夹克的男人,动作很快,镜头很震撼。”
这句话在人类看来信息量足够,但模型实际解析时会出现几个问题:
第一,动作焦点太多。这句话里出现了两个人物,两个动作对象,还有“看起来很酷”“镜头很震撼”这类氛围描述。模型在有限的信息预算里,往往会优先渲染画面主体和场景,动作指令被降级处理。等到生成时,核心动作要么被简化,要么被完全忽略。
第二,时序关系没有表达。“他出拳打向另一个男人”是一个单一动作,但视频生成需要的是动作序列:谁先动,另一方如何反应,最后什么结果。没有“先/然后/最后”这类显式的时间标记,模型就只能凭训练数据里的统计习惯自由发挥。
第三,数量约束被环境词稀释。“一个穿着黑色冲锋衣的男人”这个数量信息,前面只有一个“一个”,后面跟着服饰、场景、动作、氛围等大量描述。模型在解码时很可能把“一个”当成不重要的修饰成分丢掉。
第四,镜头指令和动作指令抢位置。“镜头很震撼”不是可执行指令,模型不知道你是要特写、跟拍还是环绕。类似这种抽象评价词,本质上等于没有写镜头。
这四类问题在实际生成中会组合爆发,而且它们之间有很强的相关性。动作焦点太多,时序就会被压缩;时序表达不清,数量就容易错;数量一旦错,整个画面的人物关系就全乱了。所以你会发现,H3 生成的视频经常出现“整体氛围对,细节全错”的结果。
从更深一层看,文生视频模型的提示词解析和文生图模型有本质区别。文生图模型只需要把文字映射到一张静态画面的空间布局,而文生视频模型还要额外处理“时间维度上的状态转移”。这意味着,提示词里每一个动作、每一个位置变化,都要有明确的先后逻辑。你写“两个人打斗”,模型会生成一场打斗;但你写“先见招,再拆招,最后擒拿”,模型才有机会还原你脑子里的那场戏。
2. MiniMax H3 需要什么样的提示词:从官方规范提炼的五个维度
MiniMax H3 是 MiniMax 在视频生成方向上的模型,社区里关注度最高的几个点包括:支持本地部署、有 ComfyUI 整合包、提供 ref2va 全能参考模式、还有类似导演台的功能。从公开的提示词编写规范和社区分享的示例来看,H3 的提示词并不是越长越好,而是必须把信息塞进几个固定维度里。
我把它提炼成五个核心维度。
| 维度 | 核心内容 | 常见误区 |
|---|---|---|
| 主体 Subject | 画面里有什么,数量、外貌、服饰、相对位置 | 只写“一个人”,不写数量和外貌 |
| 动作与行为 Action | 做什么,动作顺序,动作幅度 | 连续写三个以上并列动作,没有先后关系 |
| 镜头与运动 Camera | 景别、机位、镜头运动方式 | 把镜头指令混在动作句里 |
| 环境与光影 Environment | 时间、地点、天气、光线 | 环境放在最后,被模型当成低优先级信息 |
| 风格与氛围 Style | 色彩、类型片风格、画面质感 | 每段换一种风格词,前后不一致 |
这五个维度之外,还有三个隐藏约束,是从官方规范里反复出现的硬性要求中提炼出来的。
第一个是“时序显式化”。所有动作都要用“先…然后…最后…”这类时间标记串起来,不能靠逗号平铺。第二个是“数量显式化”。人物和关键物体的数量必须写在主体字段的开头,比如“两名成年男性”,不能用“几个人”“一群人”代替。第三个是“负面约束独立化”。负面提示不要和正面描述混在一起写,单独放在提示词末尾,用“不要”开头,并且控制在 3 条以内。
再说说 ref2va 全能参考模式。这个模式在社区里的用途很明确:用参考图或参考视频把人物长相、服装、场景风格先锚定下来,然后再用提示词告诉模型“要改变什么”。这时候提示词的结构和纯文生视频不太一样,需要显式区分“保留项”和“改变项”。比如参考图提供了人物长相,提示词里就应该写“保持人物外貌和服装不变”,然后把动作、镜头、环境变化写清楚。如果没有这个区分,模型很容易在参考素材和文字指令之间摇摆,结果就是人物长相变了,或者动作完全没执行。
这一节的结论是:H3 的提示词规范,核心不是教你写得更华丽,而是教你写得更结构化。五个维度是信息容器,三个约束是保证模型不犯低级错误的硬规则,参考模式是稳定性的额外锚点。
3. 什么是 Prompt Skill,为什么它能解决“不听话”问题
提示词领域的 Skill,最早是从 AI 编程助手那边流行起来的。一个 Skill 通常由四部分组成:清单文件描述技能是什么、系统指令定义行为规则、输出模板规定结果格式、示例提供 few-shot 参考。你可以把它理解成一个可以反复调用的“提示词编译单元”。
为什么 Skill 能解决 H3 的“不听话”问题?我用一个类比来解释。
自由编写 H3 提示词,相当于你临时打电话给一个摄影师,口头交代:“拍个城市场景,挺酷的那种,有个男的在打架。”摄影师脑补的画面,大概率跟你脑子里的画面不一样。而使用 Prompt Skill,相当于你给制作组发了一份分镜脚本和制作规范:主体是谁、穿什么、站在哪、动作顺序是什么、镜头怎么运动、什么色调、哪些东西绝对不能出现。后者不是更啰嗦,而是把所有关键决策点都显式化了。
具体到技术层面,Prompt