这次要拆解的是海螺 MiniMax H3 做短剧样片的一套完整工作流。先说明边界:除了视频封面之外,人物设定、分镜生成、音频配音、成片剪辑全部走开源方案。MiniMax H3 负责的是最关键的“视频画面生成”这一环,同时通过 ref2va 全能参考模式解决短剧最容易翻车的场景人脸一致性问题。
整套流程围绕三个核心问题展开:第一,同一个角色在不同分镜里能不能长得一样;第二,分镜之间怎么切换才不突兀;第三,AI 单段生成通常只有几秒到十几秒,怎么把多段内容拼成一部有叙事节奏的短剧样片。这三个问题如果能打通,短剧样片的生产效率会明显不一样。
这篇文章会带你过一遍 MiniMax H3 的本地部署位置认知、场景人脸一致性分镜的提示词模板、ref2va 参考模式的完整使用思路、长时长视频的分段拼接方法,以及批量任务和接口调用的扩展方案。适合正在做短剧、AI 视频内容生产、或者想用开源模型搭一套视频生成工作流的读者。
1. MiniMax H3 核心能力速览
先把关键信息放在前面。MiniMax H3 是视频生成模型,社区内已经有本地部署版本和 ComfyUI 整合包出现,配合短剧类工作流可以做角色统一的视频片段生成。下面的表格是基于当前可获得的公开信息和社区热词整理的速览,实际参数以官方发布为准。
| 能力项 | 说明 |
|---|---|
| 项目定位 | 视频生成模型,可用于短剧样片、分镜制作、角色一致视频生成 |
| 模型规模 | 社区信息指向 33B 量级开源版本,具体参数量以官方发布为准 |
| 开源情况 | 模型开源,可本地部署;短剧工作流除封面外可全开源实现 |
| 核心能力 | 文生视频、图生视频、ref2va 全能参考模式 |
| 场景优势 | 短剧分镜、角色一致性、长时长视频分段拼接 |
| 部署方式 | ComfyUI 工作流加载、整合包一键启动、命令行启动 |
| 硬件门槛 | GPU 优先,显存需按模型和分辨率评估;CPU 可跑但速度较慢 |
| 接口能力 | 可基于 ComfyUI 的 API 做调用,具体以实际方案为准 |
| 批量任务 | 支持工作流批量队列,建议自建输入目录和命名规则 |
| 提示词模板 | 中文分镜、战斗场景、人物一致性提示词模板可复用 |
从材料看,MiniMax H3 在短剧样片方向上的主要优势不是单卡能跑多大分辨率,而是 ref2va 参考模式带来了一个比较明确的用法:让多段分镜共享同一张角色参考图,从根上解决人脸不一致的问题。这个思路对短剧生产非常关键,因为短剧观众对“同一个人在不同镜头里是否还是同一个人”极其敏感。
2. 短剧样片制作:适用场景与合规边界
MiniMax H3 这套工作流适合谁?适合有四类需求的人:
- 短剧创作者:需要快速产出样片验证剧本节奏、人设、场景氛围。
- AI 内容工作室:需要批量生成分镜素材,再交给后期统一剪辑。
- 独立开发者和 ComfyUI 用户:想把视频生成能力接入自己的自动化流程。
- 影视/广告前期团队:用 AI 做概念预览和 pitch 片。
能解决的问题很明确:传统短剧拍摄需要演员、场地、灯光、摄影,成本高,周期长。用 MiniMax H3 加参考图工作流,角色设定图确定之后,每个分镜可以分别生成,再拼接成样片。省掉的是前期拍摄的人力成本,换来的是快速验证故事结构的效率。
但也有不适合的场景,需要提前说清楚:
- 需要极致画质、复杂调度、真实表演细节的正剧,目前 AI 视频生成还不适合直接商用。
- 需要精确到每一帧的物理效果、慢动作、流体模拟,AI 视频生成不稳定。
- 超过几分钟的长篇内容,直接单段生成不现实,必须拆分重组。
- 涉及真实人物肖像、艺人脸、他人声音、版权音乐、原创角色的商业用途,授权问题必须提前确认。
这里必须强调合规边界:如果你要生成带人脸的角色,确保使用的是自己创作的角色图、已获授权的演员肖像,或者纯虚构的 AI 角色。声音克隆和配音素材也要确认来源合法。短剧的剧本、台词、背景音乐、场景元素如果来自他人作品,商用前需要获得授权。本地部署的模型输出的视频内容,发布前要人工复核,确保没有侵权、违规和误导风险。
3. MiniMax H3 本地部署环境准备
在开始之前,建议先检查一遍本机环境。MiniMax H3 的部署通常走 ComfyUI 方案,所以环境准备的核心是 Python + PyTorch + ComfyUI + 模型文件。
3.1 硬件要求
从模型规模和社区讨论看,MiniMax H3 是相对重型的视频生成模型,运行以 GPU 为佳。下面是通用检查清单,具体数值要根据你下载的模型版本和分辨率设置确认:
- 操作系统:Windows 10/11、Ubuntu 20.04 或更高版本
- GPU:NVIDIA 显卡优先,显存越大越稳;6G 以下建议先跑低分辨率测试,是否能流畅运行需实测
- CPU:支持 CPU 推理,但视频生成速度会很慢,只建议用 CPU 做功能验证
- 内存:建议 32G 以上,长视频分段生成和批次任务对内存有要求
- 磁盘:预留 30G 以上空间,模型文件、输出视频、工作流文件都会占空间
3.2 软件依赖
- Python 3.10 或 3.11
- Git
- NVIDIA 显卡驱动,版本需支持你的 CUDA 环境
- PyTorch with CUDA
- ComfyUI 最新版
- ComfyUI 对应 MiniMax H3 的自定义节点
这里有一个很常见的坑:ComfyUI 本体和自定义节点是两个不同的更新节奏。如果你下载的是整合包,一般会帮你配好;如果是手动安装,建议先启动一次原始 ComfyUI,确认能正常打开页面,再安装 MiniMax H3 相关节点。
4. ComfyUI 整合包安装与模型加载
MiniMax H3 目前最方便的使用方式是 ComfyUI 工作流。社区里已经有“ComfyUI MiniMax H3 整合包”出现,整合包的优点是把 Python 环境、依赖、模型放置位置、启动脚本都打包好,对新手更友好。
4.1 通用安装流程
如果你自己手动搭 ComfyUI,可以参考下面这个流程,路径以实际项目为准。
# 克隆 ComfyUI 仓库 git clone https://github.com/comfyanonymous/ComfyUI.git cd ComfyUI # 创建虚拟环境(推荐) python -m venv venv source venv/bin/activate # Windows 下为 venv\Scripts\activate # 安装依赖 pip install -r requirements.txt # 启动服务 python main.py --listen 127.0.0.1 --port 8188启动后浏览器访问http://127.0.0.1:8188,能看到 ComfyUI 的工作流界面就说明基础环境没有问题。
4.2 模型文件放置
MiniMax H3 模型文件通常放在 ComfyUI 的models/checkpoints或models/diffusion_models目录,具体看工作流要求。下载模型后注意核对文件大小,不要只看名称就放进去。如果工作流加载时报文件名不一致,可以修改工作流中的模型名,也可以直接改本地文件名,但要保持后缀一致。
4.3 整合包启动说明
如果你用的是社区整合包,常见的启动方式有两种:
- 双击
启动.bat或run_nvidia_gpu.bat - 命令行执行启动脚本,例如
python main.py
整合包的优点是省去了手动配环境的步骤,缺点是目录结构是固定的,换机器容易找不到模型路径。建议拿到整合包后先打开目录看一遍,确认models、custom_nodes、output三个目录的位置,这对后面修改工作流和输出路径很有帮助。
5. 短剧制作第一步:角色设定图与参考图准备
在 MiniMax H3 短剧工作流里,角色一致性不是靠提示词硬撑的,而是靠一张设计好的参考图。这一步如果参考图质量不行,后面所有分镜都会跟着崩。
5.1 角色设定图规范
参考图需要满足以下条件:
- 面部清晰,不要戴会遮挡五官的装饰
- 光线均匀,不要有强烈阴影
- 构图尽量为正面或 3/4 侧面
- 背景简单,不要有复杂元素干扰
- 角色服装、发型、标志性特征要和剧本设定一致
角色设定图可以用开源绘制工具生成,也可以用 Stable Diffusion 加 LoRA 固定画风。重点是画面里这个角色必须“干净、标准、可参考”,而不是“好看但没法复用”。
5.2 多角度角色参考
短剧分镜会有正脸、侧脸、背面、远景等不同角度。只有一个正脸参考图时,侧脸和背面镜头的一致性风险较大。建议准备 2 到 4 张同一角色的多角度设定图,分镜时按需选择最接近的参考图,而不是所有镜头都用同一张。
5.3 参考图目录设计
建议在项目中建立一个固定的素材目录结构:
short_drama_project/ ├── reference/ │ ├── character_1_front.png │ ├── character_1_side.png │ ├── character_2_front.png │ └── scene_style.png ├── prompts/ │ ├── scene_1_shot_1.txt │ ├── scene_1_shot_2.txt │ └── templates/ ├── output/ │ ├── scene_1/ │ └── scene_2/ └── audio/这种目录结构的好处是批量任务时可以按文件夹批量处理,不用手动区分素材。
6. 场景人脸一致性:ref2va 全能参考模式实战
ref2va 是 MiniMax H3 工作流里出现频率很高的参考模式,也是解决“场景人脸一致性”的核心节点。它的思路是:给模型一张参考图,视频生成过程中模型持续参考这张图中的人物特征,让不同分镜里的角色看起来是同一个人。
6.1 ref2va 模式操作步骤
实际操作时,流程如下:
- 在 ComfyUI 中加载 MiniMax H3 工作流。
- 找到参考图输入节点,接入第 5 步准备好的角色设定图。
- 设置生成模式为 ref2va 或对应的参考模式。
- 在提示词中写明当前分镜的画面内容,同时强调角色特征与参考图一致。
- 生成一个短片段,抽帧检查人脸是否一致。
- 如果人脸有漂移,优先调整参考图清晰度,再检查提示词中是否出现了互相冲突的描述。
6.2 ref2va 模式提示词规范
从社区讨论来看,ref2va 模式对提示词的要求更高,因为它既要从参考图取人物特征,又要理解提示词里的场景、动作和镜头语言。下面给出一个可以复用的中文提示词模板:
[场景地点]:现代都市天台,夜晚,霓虹灯闪烁 [人物特征]:亚洲男性,28岁左右,黑色短发,左眉有一道浅疤,穿深灰色长款风衣,与参考图保持一致 [动作]:站在天台边缘,转身看向镜头,神情由平静转为凝重 [镜头]:中景,缓慢推进,轻微仰拍,浅景深,背景灯光虚化 [氛围]:冷色调,城市夜景,隐约有车辆鸣笛声 [画质]:电影感,35mm胶片质感,细节丰富,8K超清这个模板有几个关键点:
- 人物特征段必须明确写“与参考图保持一致”,这是锁定角色的提示词锚点。
- 动作和情绪可以用“由平静转为凝重”这种过程描述,而不是只写“面无表情”。
- 镜头段要写景别、运镜、光影,这对分镜一致性很有帮助。
- 画质段统一放在末尾,固定风格用。
6.3 单人镜头的验证方法
第一次测试建议只跑一个角色、两个分镜:
- 分镜 A:角色从门口走进来,中景。
- 分镜 B:角色坐下,近景。
分别生成后,用截帧工具把两个片段的角色脸部截出来并排对比。如果五官轮廓、发型、服装细节基本一致,说明 ref2va 参考模式在这个环境里是可用的。
如果出现明显的脸型变化,按优先级排查:
- 参考图清晰度和角度是否合适
- 提示词里是否有多余的角色描述,比如又写了“另一名男子”
- 分辨率是否过低导致人脸细节丢失
- 模型版本和 ref2va 节点版本是否匹配
7. 分镜制作:提示词模板与运镜控制
短剧的分镜和单张 AI 绘画不同,AI 视频生成需要的是“镜头语言”的清晰描述,而不是一句画面描述。同一个场景,运镜方式不同,情绪完全不同。
7.1 分镜提示词模板库
建议把提示词模板分成两类:场景模板和镜头模板。
场景模板负责固定环境和人物特征,可以复用。
[场景]:废弃工厂内部,混凝土墙面,昏暗灯光,铁锈与灰尘 [人物]:一名年轻女性,齐肩短发,穿深色工装夹克,火焰纹身从左手腕延伸到小臂,与参考图保持一致 [光线]:顶光为主,冷色环境光,局部暖色点光源 [氛围]:压抑、紧张、山雨欲来镜头模板负责控制景别、运镜和节奏。
[景别]:远景 → 近景 推进 [运镜]:缓慢推进,镜头轻微晃动,模拟手持摄影 [节奏]:前 2 秒静止,第 3 秒开始推进 [转场]:结束后淡出至黑场实际使用时把场景模板和镜头模板拼接,再补上当前分镜的动作描述,就构成一条完整的分镜提示词。
7.2 战斗场景提示词模板
“MiniMax H3 AI 超燃战斗打斗提示词中文提示词模板”是热词中出现过的方向。战斗场景比普通对话场景复杂,因为要同时描述双方动作、速度、碰撞和镜头节奏。这里给一个通用模板:
[双方角色]:角色A,黑色劲装,手持短刃,与参考图保持一致;角色B,灰色长袍,空手格斗,与参考图保持一致 [动作]:角色A从左前方斜劈,角色B侧身闪避后反击,拳风带起地面尘土 [镜头]:中景快速横移,镜头跟随角色A,最后定格在角色B反击的瞬间 [速度]:动作快速,带残影效果,击打瞬间有短暂停顿表现冲击感 [氛围]:尘土飞扬,冷色调环境,刀刃反光冷白 [画质]:电影动作片质感,高速摄影,细节锐利战斗场景的提示词核心是“动作链 + 速度变化 + 镜头跟随”。如果只写“两人打斗”,生成结果很容易变成两个角色原地挥舞。
7.3 分镜列表实践
短剧样片建议先列一个分镜表,再逐条生成。下面是一个示例分镜表:
| 镜号 | 场景 | 景别 | 运镜 | 人物动作 | 时长 | 参考图 |
|---|---|---|---|---|---|---|
| 1 | 城市天台 | 远景→中景 | 推进 | 角色A俯瞰城市 | 4s | 角色A正面 |
| 2 | 城市天台 | 近景 | 固定 | 角色A转身看镜头 | 3s | 角色A侧面 |
| 3 | 废弃工厂 | 中景 | 手持晃动 | 角色B从阴影走出 | 5s | 角色B正面 |
| 4 | 废弃工厂 | 全景 | 横移 | 双方对峙 | 6s | 角色A+B |
7.4 运镜控制的经验
AI 视频生成的运镜控制有一定随机性。比较稳妥的做法是:
- 先用一个分镜测试运镜描述是否生效。
- 如果模型对运镜描述不敏感,优先减少运镜的复杂度,改为“固定镜头”或“缓慢推进”。
- 对镜头运动要求高的场景,可以生成后通过视频剪辑软件二次加运动曲线,而不是完全依赖模型。
- 分镜切换处建议预留 0.3 到 0.5 秒的缓冲镜头,方便后期拼接。
8. 长时长视频拼接:多段式短剧工作流
短剧样片通常不止一个镜头。AI 视频单段生成时长有限,长时长视频要靠多段拼接。MiniMax H3 在长视频把控上的核心思路是:用一致性参考图保证角色统一,用分镜表保证节奏统一,用拼接规则保证叙事统一。
8.1 分段生成策略
把短剧按“场次”拆分,每场次内部再按“镜头”拆分。每段生成 3 到 6 秒,生成多段后拼接。
流程如下:
- 写文字剧本,按场景切换切成段落。
- 每个段落抽象出 3 到 6 个关键镜头。
- 为每个镜头写提示词,格式按第 7 节的模板。
- 用 ref2va 参考模式逐个生成。
- 对生成结果抽帧检查人物一致性和画面质量。
- 用 ffmpeg 或剪辑工具把通过检查的片段拼接。
- 添加转场、音效、背景音乐和字幕。
8.2 拼接规则
拼接时的几个经验:
- 相邻镜头尽量在亮度、色调上保持一致。如果前一个镜头是冷色调,下一个镜头突然变暖,观众会明显感到跳变。
- 转场不要堆效果。AI 视频本身镜头切换就很快,使用淡入淡出、黑场、叠化这类基础转场最安全。
- 人物位置和朝向要连贯。分镜表里要标注角色的朝向,例如“面向镜头左侧”,避免上一秒面朝左,下一秒面朝右。
- 音频是关键。加入配音和背景音乐后,很多画面生硬的问题会被掩盖。
8.3 长视频音画同步
这里提供一个简单方案:先生成视频画面,再单独生成配音,最后用剪辑软件对轨。短剧样片的配音可以用开源 TTS 生成,也可以用真人录制。音画对齐的方法:
- 以画面中的人物口型和动作节奏为基准。
- 把配音分成短句,每句对应一个镜头。
- 使用剪辑软件的音轨对齐功能,手动微调 0.1 秒级别的时间差。
9. 批量任务与队列设计
短剧样片不是只做一两个镜头,而是几十个镜头的批量生产。MiniMax H3 如果走 ComfyUI 工作流,批量任务主要通过 ComfyUI 的队列机制或 API 接口实现。
9.1 批量任务的基础思路
批量任务有两种常用方式:
- 在 ComfyUI 工作流界面里手动排队:切换输入图片或提示词,点击“运行”,模型一次处理一个任务。
- 通过 API 接口提交任务:用 Python 脚本把不同分镜的提示词和参考图组合成任务队列,逐个发送到 ComfyUI 服务。
第二种方式更适合做流水线,因为可以记录日志、处理失败重试、控制并发。
9.2 Python 调用 ComfyUI API 示例
下面是一个通用模板。ComfyUI 的 API 格式本质上是把你保存的workflow转成 API 格式的 JSON,具体字段以你保存的工作流为准。
import requests import json # ComfyUI 服务地址 server_addr = "http://127.0.0.1:8188" # 读取工作流 JSON # 注意:这里需要导出的 API 格式 JSON,不是在 ComfyUI 中保存的 UI 格式 with open("mini_max_h3_api.json", "r", encoding="utf-8") as f: workflow = json.load(f) # 提交任务到队列 response = requests.post(f"{server_addr}/prompt", json={"prompt": workflow}) if response.status_code == 200: print("任务提交成功") task_id = response.json().get("prompt_id") print("任务ID:", task_id) else: print("任务提交失败", response.status_code, response.text)9.3 批量目录与命名规则
批量任务最容易出问题的地方是输出文件覆盖。建议每个分镜独立输出目录,并在提示词中把当前分镜编号写入输出文件名,或者通过脚本在输出后立即重命名。
import requests import time def submit_batch(tasks, server_addr="http://127.0.0.1:8188"): for idx, task in enumerate(tasks): try: resp = requests.post(f"{server_addr}/prompt", json={"prompt": task}, timeout=30) if resp.status_code == 200: print(f"任务 {idx} 提交成功") else: print(f"任务 {idx} 提交失败: {resp.status_code}") except Exception as e: print(f"任务 {idx} 出现异常: {e}") time.sleep(1)9.4 失败重试建议
AI 视频生成存在随机性,部分镜头会崩坏,这是正常现象。合理的方式是:
- 每次生成后自动检测输出文件是否存在且体积大于阈值。
- 对失败任务重试 2 到 3 次,如果仍失败则记录日志,人工排查提示词或参考图。
- 避免对同一个死循环重试无限次,浪费 GPU 资源。
10. 资源占用与性能观察
10.1 显存占用观察方法
显存占用是 MiniMax H3 本地部署最需要关注的点。可以用 nvidia-smi 实时查看:
watch -n 1 nvidia-smiWindows 下可以直接打开任务管理器,性能页签里选择 GPU,查看“专用 GPU 内存”。
显存占用需要以实际模型版本和推理参数为准。不同的分辨率、步数、批量大小、是否使用 ref2va 参考模式,显存占用差异很大。建议先跑一个低分辨率小步数的测试片段,观察显存峰值,再逐步调高。
10.2 CPU 推理与 GPU 推理的差异
CPU 推理不是不行,但视频生成本身计算量大,CPU 推理速度会明显慢于 GPU。如果你只有 CPU 环境,建议不要直接跑多镜头长视频,而是先做单镜头功能验证。AMD CPU 能否稳定支撑本地部署,需要看 PyTorch 后端对 CPU 指令集的支持和具体项目依赖,比较稳妥的判断是先跑一个小模型验证环境。
10.3 降低显存占用的手段
- 降低分辨率:从 480p 或 720p 开始,确认效果后再升到 1080p。
- 减少步数:20 步到 30 步先试,步数越高显存和耗时越大。
- 单批次只生成一个视频,不要同时排多个高分辨率任务。
- 关闭不需要的预览节点和后处理节点。
- 使用 ref2va 模式时,参考图分辨率不要过大,先压缩到 512 或 768。
10.4 端口冲突和进程残留
ComfyUI 默认端口是 8188,如果被占用:
# 换端口启动,实际端口按你的环境调整 python main.py --listen 127.0.0.1 --port 8189出现“端口被占用”时,先检查是否有残留的 Python 进程。Windows 下可以用资源管理器结束 Python 进程,或使用命令行查找占用端口的进程。
10.5 性能观察清单
建议每次跑完一个测试集,记录以下字段,方便比较参数变化对效果的影响:
| 字段 | 记录内容 |
|---|---|
| 分辨率 | 生成视频的宽高 |
| 步数 | 采样步数 |
| 模型版本 | MiniMax H3 的具体版本号 |
| 参考图 | 使用的角色参考图文件 |
| 提示词长度 | 提示词的字符数 |
| 显存峰值 | nvidia-smi 记录的最大显存 |
| 单段耗时 | 从提交到输出的总耗时 |
| 是否成功 | 成功/失败 |
| 失败原因 | 显存不足、超时、输出为空等 |
11. 常见问题与排查方法
以下排查表基于 ComfyUI 部署 MiniMax H3 的常见问题整理,具体现象以你本机会话为准。
| 问题现象 | 可能原因 | 排查方式 | 解决方案 |
|---|---|---|---|
| 启动后页面打不开 | 端口被占用或服务未启动 | 检查日志和端口监听状态 | 更换端口或重启服务 |
| 模型加载失败 | 模型文件未放对目录或文件损坏 | 检查模型目录,核对文件大小 | 重新下载或修正工作流中的模型名 |
| 生成视频速度极慢 | 使用 CPU 推理或 GPU 未启用 | 查看日志中的设备信息 | 安装匹配的 PyTorch CUDA 版本 |
| 生成结果画面模糊 | 分辨率过低或步数不足 | 提高分辨率或步数,比较输出 | 测试不同的分辨率/步数组合 |
| 人脸出现漂移 | 参考图不清晰或提示词冲突 | 抽帧对比角色特征 | 换高清参考图,精简提示词 |
| 多镜头角色不一致 | ref2va 模式未启用或参考图不一致 | 检查工作流节点连接 | 统一使用同一组参考图 |
| 生成过程中显存不足 | 分辨率/步数设定过高 | 查看 nvidia-smi 显存峰值 | 降低分辨率或单批次任务数 |
| 输出视频为空文件 | 推理中断或参数不合法 | 检查日志和输出文件大小 | 重置参数,重新提交任务 |
| API 调用返回 400 | 工作流 JSON 格式不被接受 | 在 ComfyUI 中导出合法 API 格式 | 使用正确的 API 格式 JSON |
| 批量任务在某一镜卡住 | 单次生成失败后任务阻塞 | 查看队列状态和日志 | 脚本增加超时和重试机制 |
| 端口被占用 | 上次服务未正常退出 | 查看端口占用进程 | 结束残留进程或更换端口 |
12. 最佳实践与合规建议
12.1 工程化建议
- 第一次先跑最小可运行配置:低分辨率、少步数、一个镜头、一张参考图。全流程跑通后再扩展。
- 保留一套“最小可运行工作流”备份,参数乱了随时回滚。
- 模型文件、输入素材、输出结果分目录管理,不要全堆在一个文件夹。
- 批量任务必须加日志和失败重试,否则 GPU 卡住都不知道是哪个镜头出了问题。
- 接口服务要限制访问范围,尤其不要直接把 ComfyUI 服务暴露到公网,建议监听 127.0.0.1 并配合防火墙。
- 参考图、输出视频、提示词版本之间建立对应关系,方便回溯“这个结果是用哪组参数跑的”。
- 生成结果不要直接发布,先过一遍人工复核,检查人脸、文字、场景是否出错。
12.2 合规边界
- 使用 MiniMax H3 生成视频前,确认模型使用条款允许你的应用场景。
- 涉及人脸的视频,确保角色为虚构形象,或已获得肖像授权。
- 涉及声音克隆和配音素材,确认音色来源合法。
- 涉及版权音乐、电影片段、明星形象,不能无授权使用。
- 短剧剧本和台词如果是改编自他人作品,需获得授权并注明来源。
- 商用前先确认模型输出内容的权利范围和发布平台规则。
13. 总结与下一步
MiniMax H3 这套短剧工作流最值得尝试的点是 ref2va 参考模式带来的人脸一致性能力,它让“多镜头共用一张角色脸”从提示词玄学变成了可操作的工作流。
最先应该验证的是:准备一张高清角色参考图,只跑两个分镜,一个中景一个近景,用 ref2va 模式生成,抽帧对比人脸。这个测试成本最低,却能直接决定这套工作流适不适合你的项目。
最容易踩的坑是第一遍就追求高分辨率长视频,结果显存爆掉、输出不稳定、人脸翻车。正确顺序是:小参数验证流程,再逐步调高分辨率和镜头数。
后续可以扩展的方向包括:接入开源 TTS 做自动配音,用 ffmpeg 做批量转场和字幕压制,把每个分镜的输出接入剪辑软件统一调色,甚至构建一个从剧本到分镜到成片的半自动流水线。MiniMax H3 只是一个环节,但把它的参考模式、提示词模板和批量任务用顺了,短剧样片的生产链路就会清晰很多。建议收藏备用,动手跑一组小样片验证效果。