做AI短剧这段时间,我最大的感受是:卡住大家的从来不是某一个AI工具不会用,而是没有一个能把故事从文字变成片子的完整工作流。刷到别人用AI做出能一口气追十几集的短剧,自己也跟着生成了一堆零碎片段,拼在一起却讲不成一个完整故事——这种事我见过太多次。问题出在你缺的不是视频生成能力,而是一条从故事梗概到可审片成片的6步工作流。这篇文章就把我跑通的完整流程拆开讲,适合一个人或小团队想稳定量产AI短剧的朋友。
1. 动笔前先想清楚:这套工作流为什么是6步
1.1 AI短剧不是“AI视频拼盘”,而是压缩后的影视工业流水线
真人短剧剧组里有编剧、导演、美术、演员、摄影、录音、剪辑这些岗位,每个岗位各司其职。AI短剧的本质,是把这些岗位全部压缩成一个人加一堆AI工具,但岗位之间的先后关系和依赖逻辑并没有消失。你跳过了剧本直接去生成画面,等于让AI摄影师在没有剧本、没有分镜、没有演员表的情况下瞎拍,出来的素材当然不可能拼成故事。
我最初犯的错就在这:先花大量时间生成角色图、场景图,看到好看的画面就保存下来,结果等到真要剪片子时才发现,剧本没定,角色关系不清,生成的素材根本接不上。后来老老实实按影视工业的逻辑重排流程,废片率立刻降了下来。
1.2 六步流程的关系图:上一步输出是下一步输入
这套工作流我固定为六个阶段:剧本结构、分镜脚本、角色设定、图生视频、声音设计、剪辑审片。每一步的输出都是下一步的输入,顺序基本不能乱。
剧本阶段输出的是“场次卡”,告诉你每一场戏发生在哪、角色在做什么、要传达什么信息。分镜阶段把场次卡拆成“镜头清单”,包含景别、运镜、画面内容。镜头清单决定你需要画哪些角色、哪些场景。角色设定阶段生成“角色参考图”,这批图直接作为后续图生视频的首帧。图生视频产出“动态素材”,配音、音效和剪辑全都要等这些素材到手才能做最终对白对齐和节奏调整。
声音设计比较特殊,它可以和视频生成并行推进,尤其是草稿配音,越早做越好。但成品音频必须等剪辑节奏确定后再精修,否则音画很难对齐。理解了这个依赖关系,你就明白为什么不要一上来就打开视频生成工具。
1.3 我做项目时踩过的流程混乱的坑
印象最深的一次,是剧本还没定稿就让设计出角色图,结果剧本改了,角色从28岁职场女强人改成24岁大学生,前面生成的三十多张角色图、场景图、道具图全部作废。回头想,浪费的不只是生成时间,还有确认这些图时投入的精力。从那以后我给自己定了规矩:剧本不冻结,绝不碰角色设定;分镜不冻结,绝不开视频生成流程。
这套6步工作流真正解决的就是这个问题,它让你每一步都有一个明确的交付物,交付物验收通过才进入下一步。后面几节我会把每一步的具体做法、工具选型、参数建议和容易踩的坑全部写出来。
2. 第1步:把故事梗概变成可执行的剧本结构
2.1 不要让AI自由发挥写完整剧本,先让它写“场次卡”
很多人一上来就让AI“写一个80集短剧剧本”,结果AI生成的全是废话对白和大段心理描写,根本没法拍。我的做法是让AI先写场次卡。场次卡是介于分集大纲和完整剧本之间的中间产物,它把每一场戏的地点、时间、角色、动作、对白、画面重点固定下来。
我用一段固定提示词模板,输入故事梗概后让AI输出场次卡。模板核心字段包括:场次编号、内外景、日/夜、出场角色、剧情动作、对白要点、画面重点、情绪基调。这样AI不会放飞自我,产出的内容也方便后续分镜脚本直接引用。
实际操作时,我会同时给AI输入题材类型、目标平台、单集时长、总集数。比如最近做的都市逆袭题材,我给的约束是:单集90秒,第一集前5秒必须出现冲突钩子,每集3到5场戏,每场戏只推进一个信息点。这些约束直接决定场次卡能不能用。
2.2 场次卡长什么样:给你一份可直接抄的示例
拿一个最简单的例子:故事梗概是“外卖员陈默意外发现自己能听到别人内心想法,第一次使用能力时听到了小区业主的阴谋”。我让AI按短剧节奏输出第一集场次卡,大体会长成下面这样:
| 场次 | 环境 | 时间 | 角色 | 剧情动作 | 对白要点 | 画面重点 |
|---|---|---|---|---|---|---|
| 1 | 老破小出租屋 | 日 | 陈默 | 被闹钟吵醒,手机弹出催单通知 | “又超时了,这个月要被扣光了” | 出租屋杂乱环境,手机屏幕特写 |
| 2 | 街道/电动车 | 日 | 陈默、路人 | 骑车穿行,突然听到路人心里骂自己 | 无对白,内心OS:“这声音是怎么回事?” | 陈默震惊表情,车流虚化 |
| 3 | 高档小区门口 | 日 | 陈默、保安、业主 | 被保安拦住,业主内心声音传出 | 保安:“外卖不能进。” 业主OS:“这送外卖的怎么这么碍眼” | 人物对峙构图,小区大门纵深 |
| 4 | 小区内/电梯 | 日 | 陈默、神秘人 | 进电梯听到神秘人内心计划 | 神秘人OS:“今晚必须把文件销毁” | 电梯金属反光,神秘人背影 |
看到没,场次卡不追求文学性,追求的是“可执行性”。每场戏只有一个核心目的,对白只需写要点,画面重点直接给视频生成阶段指方向。这才是AI能接住的东西。
2.3 短剧节奏控制:一集3到5场戏,前5秒必须有钩子
短剧和长剧最大的区别在节奏。长剧可以慢热,短剧不行。一集90秒到3分钟,观众手指滑动瞬间就决定要不要继续看。所以我在写场次卡时会给AI加一条硬规则:第一场戏必须在中性场景里抛出悬念、冲突或反转,不允许出现“阳光明媚,女主角在咖啡厅看书”这种慢性开场。
场次数量也要控制。3到5场戏是安全区间,再多就会因为场景切换太频繁导致AI生成素材成本暴增。很多AI短剧看起来节奏乱,本质上就是场次卡里塞了太多信息。记住一个原则:一场戏只做一件事,要么推进冲突,要么交付转折,要么塑造人物。
2.4 用扣子(Coze)把这步沉淀成可复用工作流
如果只做一集,每次复制提示词无所谓。但要做一二十集以上,我强烈建议直接把剧本阶段做成工作流。我最常用的是扣子(Coze),流程不复杂:创建一个Agent或工作流,输入变量是故事梗概、总集数、单集时长、题材类型,中间接一个大模型节点,让它按固定JSON格式输出分集场次卡,最后用代码节点把输出清洗成结构化数据。
这样做的价值不只是省事。AI生成结果天然不稳定,如果每次都手工复制提示词,十次可能输出十种格式。一旦格式不稳定,后面分镜、角色设定、素材管理全部要跟着乱。用工作流固定输出格式之后,每一集的剧本文件长得都一样,后续步骤才能批量处理。同样的思路在Dify里也能实现,工具本身不重要,重要的是把“格式化输出”这个要求固化下来。
3. 第2步:分镜脚本——让AI理解“镜头语言”
3.1 分镜表是给“AI摄影机”的指令书
场次卡解决的是“这一场讲什么”,分镜脚本解决的是“这一个镜头怎么拍”。到了这一步,你要开始像导演一样思考:这个镜头用全景还是特写?镜头是固定还是缓慢推近?角色在画面里的位置关系是什么?
AI视频生成模型对镜头运动的理解能力参差不齐,但它们有一个共同点:极其依赖画面描述。你把分镜描述写成“她眼神中闪过一丝复杂的情绪”,模型根本不知道该怎么画。你要写成“近景,人物眼神看向画面右侧,光线从左侧打来,背景虚化,表情由平静转为微笑”,它才能生成出接近你想要的东西。
3.2 分镜表模板:直接从场次卡批量生成
我会让AI按下面的表格输出分镜表:镜头号、景别、运镜、时长、画面内容描述、对白/OS、情绪基调。输入上一阶段的场次卡,再加一句“每个镜头只描述一个明确动作,画面描述必须包含主体人物、位置、动作、光线”。
| 镜头号 | 景别 | 运镜 | 时长 | 画面内容 | 对白/OS | 情绪 |
|---|---|---|---|---|---|---|
| 1-1 | 特写 | 固定 | 2s | 手机屏幕弹出配送超时警告,手指点击屏幕 | 无 | 焦虑 |
| 1-2 | 中景 | 缓慢拉远 | 3s | 陈默从床上坐起,凌乱房间作为背景 | “又超时了” | 烦躁 |
| 1-3 | 全景 | 固定 | 2s | 陈默骑电动车穿行街道,车流虚化 | 内心OS:“这声音是怎么回事?” | 震惊 |
这里要注意,单条镜头时长控制在2到5秒之间。AI图生视频通常一次生成5秒或10秒片段,拿回来后再在剪辑里裁短。分镜时长不一定要精确到帧,但要给后期留出调整空间。
3.3 文学化描述是分镜的大忌,要翻译成“可参数化画面”
我踩过最大的坑是分镜描述写得太文艺。AI模型不是你肚子里的蛔虫,理解不了“眼神中闪过一丝复杂情绪”这种话。后来我把所有分镜描述统一成一套“视觉语言模板”:主体、位置、动作、光线、背景、镜头运动。比如把“他们相遇在黄昏的街头”改成“全景,男女主角分别从画面左右走向中心,傍晚暖光,街边店铺灯光亮起,镜头固定”。同样的信息量,后者被视频模型解析的成功率高出几条街。
3.4 用关键帧图把分镜可视化,为图生视频铺路
分镜表定稿后,还要再做一步:把关键镜头生成静态关键帧图。一集15到20个镜头,不一定每个都要生成关键帧,但涉及角色出场、场景切换、情绪转折的镜头必须有。用什么工具都行,ComfyUI、Midjourney、即梦的图片生成都能干这件事。关键帧图就是第4步图生视频的首帧输入,相当于给AI视频模型一张“剧照”,让它照着剧照动起来。
这一步做好,视频生成阶段会轻松很多。否则你只能靠文字让模型凭空想象画面,出来的构图和光线全凭运气。
4. 第3步:角色一致性方案——AI短剧的生死线
4.1 为什么你的短剧“一集一个脸”
AI短剧最劝退观众的问题就是角色不稳定:第一集是圆脸女主,第二集变成瓜子脸,第三集直接换了个人种。原因是纯文生视频时,模型每次都是根据文字重新想象一张脸,你写得再详细也很难稳定复现。这也是AI短剧和AI漫剧最大的区别,漫剧因为画风本身夸张,人脸崩坏没那么显眼,但真人向短剧只要脸一变,观众立刻出戏。
角色一致性不是“要不要做”的问题,而是“做到什么程度”的问题。我一般把它分成三个档位,根据项目预算和周期选择。
4.2 三档一致性方案,选哪种取决于项目档期
第一档是提示词锚定,成本最低。具体做法是把角色外貌特征写成一串固定标签,比如“28岁亚洲女性,黑长直,空气刘海,深棕色眼睛,穿米色风衣,佩戴银色耳钉”,每次生成时都原封不动放进提示词里。这个方案问题也明显:不同模型、不同seed下,脸型依然会漂移。只适合要求不高的漫剧或背景角色。
第二档是垫图/参考图,也是我最推荐个人创作者使用的方案。在可灵、即梦这类图生视频工具中,直接把角色设定图上传为首帧或参考图,模型会尽量延续首帧的人物长相和场景。操作上要注意:设定图必须是正脸清晰、光线正常、构图留有运动空间的图,最好同时准备正面、侧面、半身动态三张,方便不同镜头调用。
第三档是训练角色LoRA,效果最强但成本最高。在ComfyUI里用同一角色20到50张不同角度、不同表情的图片训练出一个专属LoRA模型,之后每次生成都调用,人物长相能保持得非常稳定。很多批量做AI短剧、AI漫剧的团队走的就是这条路,训练一个主要角色LoRA只花一次成本,后面几十集都能持续复用。网上很多“图生图工作流”和“漫剧工作流”分享,核心也就围绕这个能力展开。
4.3 怎么生成一张“好用”的角色设定图
很多人角色图生成得好看,但拿去做图生视频时总翻车,问题出在“好看”不等于“好用”。我建议按这套标准生成角色设定图:服装固定、发型固定、背景简单、人物占画面主体的60%以上、光线柔和且正面主光。提示词模板大概是:
“28岁亚洲女性,黑色长直发,空气刘海,深棕色眼睛,米色风衣内搭白色衬衫,银色耳钉,直视镜头,正脸,半身肖像,室内棚拍光,浅灰色背景,摄影风格,8k,细节丰富”
生成后从中挑一张最稳定的:面部轮廓明显、五官特征清晰、没有多余配饰干扰。这里有个技巧,角色长相越“有特点”越容易被模型锁定,比如明显的痣、眼镜、特殊发色。清一色的“建模脸”反而最容易在生成过程中被改得面目全非。
4.4 一致性翻车现场的补救办法
即使做了角色参考图,实际生成时仍可能出现服装变化、发型飘移、年龄忽大忽小的问题。我的处理原则是:不要妄想让AI角色像真人演员一样演完整部剧,而是给角色设计“固定视觉符号”。比如角色永远穿同一件米色风衣、永远保持同一种发色和发型,把这个作为角色设定的一部分写进提示词。换装戏要拍,就先在角色原图基础上再生成穿新衣服的设定图,而不是直接改提示词让模型自由发挥。
另一个实用思路是尽量减少多角色同框镜头。AI在多角色场景中很容易把两个角色的脸搞混,或者生成出“融合脸”。我拍对话镜头时,通常用单人近景交替剪辑来完成,既安全又有节奏感。
5. 第4步:图生视频——从静帧到动态素材的产出流水线
5.1 为什么主力要用“图生视频”,而不是“文生视频”
如果你的预算和算力有限,强烈建议把80%的镜头都用图生视频来做。区别很简单:文生视频是让AI从一张白纸开始画,画面随机性极大;图生视频是拿第3步生成的关键帧图作为起点,让AI在已有画面基础上“动起来”,角色、场景、构图、光线全部被锁死,剩下的只是动作和镜头运动。
文生视频也不是完全没用,我一般用它来生成空镜、转场、雨雪特效这类不要求角色一致性的画面。凡是涉及主角正面镜头的,一律走图生视频。
5.2 主流工具与参数设置参考
目前可灵、即梦、Vidu、海螺等国内平台都有稳定的图生视频能力,习惯用ComfyUI做本地生成的也可以接入相关模型。不同工具的侧重点略有差别,我把自己的使用经验整理成下表:
| 工具 | 特点 | 适合的镜头 | 注意点 |
|---|---|---|---|
| 可灵 | 运动幅度控制细,面部稳定性好 | 角色正面特写、对话镜头 | 单次生成时长短,需多次抽卡 |
| 即梦 | 风格化强,画面质感好 | 氛围空镜、情绪渲染 | 对复杂运动支持一般 |
| Vidu | 生成速度快,批量效率高 | 批量素材、测试镜头 | 面部长相容易轻微漂移 |
| 海螺 | 动态表现自然 | 走路、奔跑、身体动作 | 需要更长的缓冲时间 |
| ComfyUI本地流 | 可控性最高,可套工作流 | 批量生成、角色固定 | 需要显卡,依赖环境要配好 |
参数方面,我习惯把单镜头时长设为5秒或10秒,运动幅度选“中低”。原因很简单:AI生成的视频,动作幅度越大,崩坏概率越高。短剧节奏不需要大量复杂运动,多数时候人物轻微动作加镜头缓慢推拉就够了,反而更有电影感。
5.3 图生视频提示词怎么写才能减少废片
图生视频的提示词和分镜描述不一样,它不需要再描述人物长相和场景材质,这些首帧图已经决定了。提示词里只要写三件事:动态变化、镜头运动、情绪氛围。比如关键帧是“陈默在电梯里的背影”,提示词可以写“镜头缓慢从人物背影拉远,电梯门即将关闭,环境顶光忽明忽暗,人物头微微低垂,整体氛围压抑紧张”。
负面提示词更不能省。固定写“变形、多手指、五官扭曲、画面闪烁、运动模糊”这些通用负面词,能明显提高出片率。遇到工具不支持负面提示词时,就在正面提示词里加“自然动作、稳定构图”。
5.4 抽卡管理和素材命名规范,决定后期剪辑效率
图生视频本质是概率生成,即使参数再对,也不能保证每一条都能用。我的抽卡原则是:重要镜头生成3到4个候选版本,从中挑一条动作自然、脸部不崩的;普通镜头生成1到2个版本就收手。给每个镜头设一个“最多抽4次”的硬上限,防止陷入“再抽一次可能就完美了”的无限漩涡。
素材命名是整个流程里最容易被忽略却最能节省时间的环节。我的命名规则是:项目名_集数_场次_镜头号_景别_版本。比如“chenmo_S01E03_SC02_L04_CU_v2”。没有这套命名,等到剪片时面对几百个长得几乎一样的视频文件,光是找素材就能让人崩溃。
6. 第5步:声音设计——配音、音乐与音效的一次合成策略
6.1 声音不是后期加上的点缀,而是节奏骨架
最初做AI短剧时我也是把声音放在最后,视频剪完才配音,结果发现画面节奏乱七八糟。后来我调整了顺序:剧本定稿后就先用草稿配音卡一遍节奏。方法很简单,拿分镜表里的对白文本,用剪映的文本朗读功能合成一版粗糙的demo音轨,然后照着这版音轨去定视频片段的长短和顺序。
这个反向操作让视频剪辑有了参照系,因为观众对“声音节奏”比画面对节奏更敏感。视频生成再慢,也不影响你先把声音骨架搭好。
6.2 角色音色固定和情绪标注,比音色本身更关键
TTS工具选择很多,剪映、魔音工坊、火山引擎都可以;如果想定制音色,本地可以用GPT-SoVITS训练。但工具不重要,真正重要的是给每个角色配置“唯一音色”,并全程保持不变。第二集开始另换一个配音,哪怕声音更好听,观众都会立刻出戏。
对白文本也不要直接扔给TTS。我会先做情绪标注,比如“(压低声音、愤怒)你到底想干什么?”、“(迟疑、小声)我好像能听到你心里的话”。TTS引擎虽然是机器,但给它明确的情绪提示和标点符号,它会明显更接近真人语气。这个细节直接决定配音听起来是“广播腔”还是“角色”。
6.3 用“三层声音”结构做混音,短剧质感立刻提升
一段合格的AI短剧声音应该有三层:对白层、音乐层、音效层。对白层是主体,音乐层提供情绪推力,音效层负责建立空间感。
很多AI短剧听起来“很空”,就是缺了音效层。脚步声、电梯提示音、手机震动、街道环境底噪,这些细小声音加上去后,画面会觉得真实很多。我的经验是在剪辑软件里拉两条音频轨:一条音乐轨,一条音效轨。音乐轨用剪映自带的音乐库或素材库按情绪段分类,悬念段用低频紧张音色,冲突段用鼓点节奏,温情段用钢琴或弦乐。音效轨按分镜表在对应时间点放提示音和环境音。
音量平衡也有参考值:对白主轨控制在-12dB左右,音乐轨在-20dB以下,音效根据类型灵活调整。简单说就是“对白永远清晰,音乐永远不抢戏,音效点到为止”。
6.4 声音和画面不同步的处理策略
AI生成视频里角色口型很难完全对上TTS音频,处理办法不是硬修口型,而是从分镜阶段就规避。关键一条:少给角色正脸大段说话的镜头。短剧对话可以采用多景别切换、对话双方交替近景、配合动作/空镜插入的方式来剪辑。声音是连续的角色说话,画面在多个机位间切换,观众根本不会察觉口型对不上。这就是“声画不同步”最实用的解法。
7. 第6步:粗剪、审片与成片交付——别让AI废片浪费你的时间
7.1 粗剪不是简单拼接,而是“二次导演”
所有素材生成完毕后,把视频片段按分镜表顺序拖进时间线,这只是开始。AI生成素材最大的问题是“动作冗余”,比如角色说完台词后还有一段无意义的发呆、转头、眨眼,这些都要在粗剪时切掉。短剧单镜头在成品中最舒服的长度是2到4秒,超过4秒除非是氛围空镜,否则很容易显得拖沓。
粗剪还有个任务是把同一镜头的好版本拼接起来。有时一条素材的前半段好,后半段脸崩了;另一条正相反。我会在两条素材间做一次硬切或叠化,把各自的“高光区”拼成一个完整镜头。这招救回了我大量废片。
7.2 审片清单:所谓“可审片成片”到底要检查什么
我做审片时会按下面这份清单逐项过,全部通过才叫“可审片成片”:
| 检查项 | 标准 |
|---|---|
| 角色一致性 | 同一角色所有镜头脸型、发型、服装一致 |
| 画面稳定 | 无明显抖动、闪烁、墙体变形 |
| 音画同步 | 对白、音效与画面动作时间点匹配 |
| 字幕准确 | 无错别字,断句合理,不遮挡人脸 |
| 节奏 | 每30秒至少有一个小钩子,前5秒有冲突悬念 |
| 小屏观感 | 在手机上检查亮度、字幕大小、音量平衡 |
这里特别强调一下“手机小屏检查”。很多AI生成视频在电脑上看很惊艳,一放到手机上就发现亮度过高、字体太小、画面显得乱。短剧主要观看场景就是手机竖屏,所以审片时必须导出到手机上过一遍。
7.3 导出参数与字幕交付规范
成片导出我一般选1080P、30fps或25fps的MP4(H.264编码),竖屏分辨率1080x1920。字幕尽量用可编辑的srt文件生成后再进剪辑软件重新排版,不要把字幕烧死在画面上,不然后面想改字都改不了。字幕位置要避开手机刘海区和手势区,底部留出安全边距。
封面也不要马虎。我用角色关键帧图做底图,配上每集标题,保持整个系列的封面风格统一。观众刷到推荐页时,封面和标题决定了点击率,这是免费流量入口。
7.4 把整条流程沉淀成可复制的“模板资产”
做完前两集后,我就意识到:AI短剧想规模化,不能每集都从零开始,而是要把流程沉淀成模板。角色设定卡、场景描述库、分镜表结构、TTS音色库、音乐情绪分类、剪辑工程模板,这些全部标准化。之后新开一集,只需要替换故事梗概、生成对应的关键帧图,剩下的流程都是在既有模板上填充。
更进一步,剧本结构化、分镜生成这些环节可以直接用扣子、ComfyUI的工作流功能固化下来。热搜里大家都在搜“工作流”“AI短剧”“漫剧工作流”,本质原因就是这个:AI能力已经溢出,缺的是把能力串起来的稳定流水线。谁先把流水线跑通,谁就能低成本复制一季又一季的内容。
最后分享一点个人体会:第一次跑这套流程时,别贪多,先拿一个1分钟样片验证全部环节。我见过太多人上来就干20集,结果第三集发现角色设定不合理,前面全部返工。先用一集把所有坑踩一遍,再批量铺开,这才是AI短剧生产最稳的节奏。