大家好,我是专注于AI应用实战的技术博主。最近,AI短剧、漫剧的创作热潮席卷而来,许多开发者、内容创作者都想抓住这波流量红利,但往往卡在从“想法”到“成品”的落地环节。剧本怎么写?AI资产怎么生成?提示词(Prompt)如何设计才能稳定出片?网上的资料要么过于零散,要么只讲理论,缺乏一套可闭环执行的实操方案。
本文将为你彻底拆解利用AI工具链制作“小甜剧”的全流程。我们将从最基础的剧本结构开始,一步步走过角色与场景资产生成、分镜提示词设计,直到最终视频合成。文章不仅包含完整的操作步骤和可复制的代码/提示词模板,更会深入讲解每个环节的“为什么”,帮你避开新手常见的坑。无论你是想入门AI内容创作的开发者,还是寻求效率提升的短视频创作者,都能从零开始,跟着本文做出你的第一个AI爆款小甜剧Demo。
1. 背景与核心概念:什么是AI小甜剧?
在深入实战之前,我们有必要厘清几个核心概念,这能帮助我们在后续步骤中做出更明智的技术选型和内容规划。
AI小甜剧,通常指利用人工智能技术辅助或完全生成的一种短篇视频内容,其核心特点是:
- 时长简短:通常在1-3分钟,符合短视频平台的传播特性。
- 剧情高甜:聚焦男女主角之间的甜蜜互动、误会与和解,情感浓度高,节奏明快。
- AI生成:剧中的人物形象、场景、甚至部分台词和表演,由AI文生图、图生视频等工具生成。
它的生产链条融合了传统编剧、AI绘画、AI视频生成等多个领域。对于技术开发者而言,这是一个绝佳的“AI应用落地”场景,你能在其中实践提示词工程、多模态模型调用、工作流自动化等一系列技能。
核心工具链与概念区分:
- 文生图模型:如 Stable Diffusion、Midjourney、DALL-E 3。负责根据文本描述生成高质量的静态图片,用于创建角色定妆照、场景图。
- 图生视频模型:如 Runway Gen-2、Pika Labs、Stable Video Diffusion。负责将静态图片转化为动态视频片段,是让角色“动起来”的关键。
- 提示词工程:这不是简单的“关键词堆砌”,而是一门通过结构化、精细化的语言描述,精准控制AI模型输出结果的技术。它是连接人类创意与AI能力的桥梁。
- 工作流:指将剧本拆解为分镜,为每个分镜生成对应图片,再将图片串联并生成视频的自动化或半自动化过程。
理解了这些,我们就知道,制作AI小甜剧并非依赖某个单一“魔法按钮”,而是需要一套组合拳。接下来,我们从源头——剧本开始。
2. 环境准备与工具选型
工欲善其事,必先利其器。由于AI视频生成领域工具迭代极快,本文不会绑定某个特定版本软件,而是提供工具类型选择和通用的配置思路。你可以根据自身硬件条件和访问权限灵活搭配。
2.1 硬件与基础环境
- 操作系统:Windows 10/11, macOS 或 Linux 均可。部分工具对平台有特定要求,需注意。
- 显卡:强烈推荐使用NVIDIA显卡。本地运行Stable Diffusion等模型需要较大的显存(建议8GB以上,如RTX 3060 12G、RTX 4070等)。显存越大,生成图片的速度越快、分辨率越高。
- 存储空间:准备至少50GB的可用硬盘空间,用于安装工具、模型和存储生成的图片、视频素材。
- 网络环境:部分在线工具(如某些AI视频生成平台)需要稳定的网络连接。
2.2 核心软件工具选型
我们将工具链分为“本地部署”和“在线服务”两类,你可以混合使用。
| 环节 | 本地部署方案 | 在线服务方案 | 说明 |
|---|---|---|---|
| 文生图 | Stable Diffusion WebUI | Midjourney, Leonardo.ai | SD WebUI免费、开源、定制性强,但需本地硬件。在线服务简单易用,有生成次数限制。 |
| 图生视频 | Stable Video Diffusion | Runway ML, Pika Labs, Haiper | 本地SVD仍处早期,效果和稳定性不及成熟的在线服务。Runway和Pika是目前主流选择。 |
| 视频剪辑 | DaVinci Resolve, Premiere Pro | Clipchamp, Canva | 用于将AI生成的视频片段、配音、字幕进行最终合成。达芬奇有免费版,功能强大。 |
| 配音 | Edge浏览器“大声朗读” | ElevenLabs, Microsoft Azure TTS | 利用Edge TTS可免费获得高质量中文配音。ElevenLabs的语音情感更丰富但付费。 |
本文实战将以“Stable Diffusion WebUI + Runway ML + DaVinci Resolve + Edge TTS”这套混合方案为例,因为它兼顾了成本、效果和学习价值。SD WebUI用于生成高质量、风格统一的角色与场景;Runway用于获得目前最稳定的视频动态化效果;达芬奇用于专业级合成;Edge TTS解决配音问题。
2.3 Stable Diffusion WebUI 基础配置
如果你选择本地部署方案,这是最关键的一步。
- 安装:建议使用一键安装包,如
sd-webui-aki或Stable Diffusion整合包,它们集成了Python、Git和基础环境,避免繁琐配置。 - 下载模型:安装完成后,需要下载大模型和LoRA模型。
- 大模型:决定整体画风。推荐用于真人风格的
ChilloutMix、MajicMix,或用于动漫风格的AnythingV5。 - LoRA模型:用于固定角色特征。你可以在C站(Civitai)上搜索“Korean Doll”、“Chinese Beauty”等关键词,下载喜欢的角色LoRA。
- 大模型:决定整体画风。推荐用于真人风格的
- 放置模型:将下载的
.safetensors格式的大模型文件放入stable-diffusion-webui/models/Stable-diffusion目录;将LoRA模型放入stable-diffusion-webui/models/Lora目录。 - 启动:运行
webui-user.bat(Windows) 启动程序,在浏览器中打开http://127.0.0.1:7860即可访问。
3. 从零开始:创作你的小甜剧剧本
AI生成不是魔法,它需要清晰、结构化的输入。一个优秀的微型剧本是成功的一半。
3.1 小甜剧剧本核心结构
一个1-2分钟的小甜剧,可以采用经典的“起-承-转-合”四段式:
- 起(相遇/开场,0-30秒):介绍场景和人物关系,制造初始吸引力。例如:“图书馆里,女生不小心撞到男生,书散落一地。”
- 承(互动/发展,30-60秒):关系推进,甜蜜互动或微小误会。例如:“男生帮她捡书,发现两人选修同一门课,相约一起复习。”
- 转(转折/危机,60-90秒):一个小矛盾或误会,制造情感波动。例如:“女生看到男生和另一个女生说笑,心生误会,黯然离开。”
- 合(和解/高甜,90-120秒):误会解除,关系升华,留下甜蜜结尾。例如:“男生追来解释那是他表妹,并送上精心准备的礼物,两人相视而笑。”
3.2 剧本格式与要素
为方便后续拆解为AI分镜,请用以下格式撰写剧本:
剧名:咖啡店的偶然 时长:120秒 风格:现代都市、温暖、日系滤镜 核心梗概:社恐插画师与阳光咖啡师因一杯画错的咖啡拉花而结缘。 【角色设定】 1. 林薇(女主):25岁,自由插画师,性格内向安静,喜欢在角落观察人群。 2. 陈阳(男主):27岁,咖啡店店主,开朗细心,热爱咖啡艺术。 【分镜列表】 SCENE 01 时长:25秒 场景:城市街角咖啡店,室内,午后阳光透过窗户 画面:林薇坐在靠窗位置,专注地在平板电脑上绘画。陈阳在吧台后忙碌。 动作:林薇抬手示意点单,陈阳点头微笑。 台词:(林薇)“一杯拿铁,谢谢。”(陈阳)“好的,请稍等。” SCENE 02 时长:30秒 场景:咖啡店吧台 画面:陈阳正在制作拉花,特写咖啡杯。 动作:陈阳不小心将拉花做成了一个小兔子的形状(而林薇画的是小猫)。 台词:(陈阳自语)“啊,走神了...” ... (后续分镜依此类推)关键点:每一个SCENE都应描述场景、人物、动作和镜头感觉,这直接对应了文生图提示词的编写。
4. 核心技能:提示词工程深度拆解
提示词是操控AI的“咒语”。编写优秀的提示词,需要遵循一定的结构和技巧。
4.1 文生图提示词通用公式
一个高效的提示词通常包含以下几个部分,按优先级排列:
[画面质量词] + [主体描述] + [细节修饰] + [场景环境] + [构图光影] + [风格参考]- 画面质量词:放在最前面,强调画质。如
masterpiece, best quality, ultra-detailed, 8k。 - 主体描述:谁,在干什么,穿着什么。要具体。如
a beautiful Chinese young woman (林薇), long black hair, wearing a beige sweater, drawing on a tablet, smiling softly。 - 细节修饰:五官、表情、神态。如
detailed eyes, delicate nose, blush on cheeks。 - 场景环境:在哪里。如
in a cozy coffee shop, afternoon sunlight, wooden table, cup of coffee on table。 - 构图光影:镜头语言。如
medium shot, from side view, cinematic lighting, soft shadows。 - 风格参考:想要的整体感觉。如
Studio Ghibli style, warm color palette, film grain。
负面提示词同样重要,用于排除不想要的元素:
(worst quality, low quality:1.4), deformed, blurry, bad anatomy, disfigured, poorly drawn face, mutation, mutated, extra limb, ugly, poorly drawn hands, missing limb, floating limbs, disconnected limbs, malformed hands, out of focus, long neck, long body, text, watermark, signature4.2 小甜剧专属提示词模板
结合小甜剧特点,我们可以提炼出一些固定模块。
模板一:角色定妆照提示词用于生成统一风格的角色正面照,方便后续多角度、多表情复用。
正向提示词: (masterpiece, best quality, ultra-detailed, 8k), 1girl, (character name:林薇), beautiful detailed eyes, delicate face, long black hair, (wearing a beige knit sweater:1.2), looking at viewer, gentle smile, soft blush, pure white background, studio lighting, sharp focus, <lora:koreanDollLikeness_v10:0.6>, Negative prompt: (worst quality, low quality:1.4), background, nude, (bra:1.2), (panties:1.2), Steps: 25, Sampler: DPM++ 2M Karras, CFG scale: 7, Seed: [固定一个种子], Size: 512x768关键解析:
1girl:明确主体数量。(character name:林薇):括号和权重1.2强调这是角色名,辅助AI识别。pure white background:纯白背景便于后期抠图合成。<lora:koreanDollLikeness_v10:0.6>:调用LoRA模型,0.6是强度权重,可调整。- 固定种子:生成满意图片后,固定种子值,可以微调其他参数(如换衣服)而保持脸部一致。
模板二:双人互动场景提示词
正向提示词: (masterpiece, best quality, ultra-detailed), two people, a handsome Chinese young man (陈阳) and a beautiful Chinese young woman (林薇) sitting at a coffee shop table, the man is handing a cup of coffee to the woman, she is looking at the coffee with a surprised and happy expression, medium shot, over the shoulder view from behind the man, in a cozy modern coffee shop, large window, sunlight streaming in, bokeh lights, warm atmosphere, film still, cinematic, shallow depth of field, <lora:koreanDollLikeness_v10:0.5>, Negative prompt: ...(同上) Steps: 30, Sampler: Euler a, CFG scale: 7.5, Size: 768x512 (横构图)关键解析:
two people:明确人物数量。- 关系描述:
handing a cup of coffee to the woman描述具体互动动作。 - 镜头语言:
over the shoulder view(过肩镜头)是影视剧常用构图,能增强代入感。 - 构图比例:根据场景需要选择竖屏(
512x768)或横屏(768x512)。
4.3 使用图生视频提示词
当你在Runway ML或Pika中将静态图片生成视频时,也需要提示词来指导运动。
Runway Gen-2 提示词示例:
Image Prompt: [上传生成的咖啡店场景图] Text Prompt: The girl looks at the coffee cup, then looks up at the boy and smiles softly. The boy nods slightly. The sunlight slowly moves across the table. Cinematic, smooth motion, subtle camera pan.核心要点:
- 描述动态:重点描述你想看到的动作变化(
looks at... then looks up... smiles)和镜头运动(subtle camera pan)。 - 保持简单:图生视频的文本提示词应简洁,侧重于驱动已存在画面中的元素动起来,而非添加新元素。
- 运动修饰:使用
smooth motion,slow motion,cinematic等词提升视频质感。
5. 完整实战:制作《咖啡店的偶然》第一幕
现在,我们将理论付诸实践,完成剧本中第一个场景(SCENE 01)的完整AI制作流程。
5.1 第一步:生成角色与场景资产
根据剧本,我们需要:1. 女主林薇的定妆照;2. 咖啡店室内场景图;3. 男主陈阳的定妆照。
操作1:在SD WebUI中生成女主林薇
- 将4.2节中的角色定妆照提示词模板复制到SD WebUI的正面提示词框。
- 负面提示词使用通用模板。
- 选择你下载的真人风格大模型(如
chilloutmix_NiPrunedFp32Fix.safetensors)。 - 在“Lora”标签页,选择你下载的韩国风LoRA模型,并设置权重为0.6。
- 点击“生成”。如果对结果不满意,可以调整“种子”为随机,微调提示词(如将
gentle smile改为neutral expression),或调整CFG Scale(7-10之间)。 - 生成一张满意的正面照后,记录下使用的种子数。
操作2:生成咖啡店场景
正向提示词: (masterpiece, best quality, ultra-detailed, 8k), interior of a cozy and modern coffee shop, afternoon, sunlight streaming through a large window, light and shadow, wooden floor, comfortable armchairs, small round tables, one table near the window with a cup of coffee and a tablet on it, bookshelf in background, plants, warm lighting, wide shot, empty, no people, clean and tidy, film still, cinematic, Negative prompt: ...(加入 people, human, crowd) Steps: 28, Sampler: DPM++ 2M Karras, CFG scale: 8, Size: 768x512生成一张空场景图,用于后续合成或作为图生视频的背景。
操作3:生成男主陈阳方法同女主,修改提示词中的角色描述:1boy, (character name:陈阳), handsome Chinese young man, short black hair, wearing a white barista apron over a casual shirt, friendly smile...
5.2 第二步:生成分镜静态图
现在生成SCENE 01的完整画面:“林薇坐在靠窗位置画画,陈阳在吧台后忙碌”。
我们需要一个双人同框的画面。这里有两种方法:
- 方法A(直接生成):使用类似4.2模板二的提示词,但描述更具体:“a girl sitting by the window drawing on a tablet, a male barista standing behind the counter in the background”。这种方法对模型构图能力要求高,可能需要多次抽卡。
- 方法B(AI绘图+后期合成):这是更可控的方法。分别生成:
- 林薇坐在窗边画画的单人图(使用固定好的女主脸+新姿势)。
- 陈阳在吧台忙碌的单人图(使用固定好的男主脸+新姿势)。
- 利用Photoshop或GIMP等软件,将抠出的人物图层合成到之前生成的空场景图中。
方法B详解:生成固定角色的新姿势这需要用到“角色复用”技巧。在SD WebUI中:
- 将生成好的林薇定妆照拖拽到“图生图”标签页的图片区域。
- 在提示词中描述新姿势和场景:
(masterpiece...), 1girl, (林薇), sitting by a window, holding a tablet with a stylus, looking down at the tablet, drawing, focused expression, in a coffee shop... - 关键设置:
- 重绘幅度:设置为
0.4-0.6。太低没变化,太高脸会崩。 - ControlNet:开启一个ControlNet单元,将同一张定妆照再次拖入,预处理器选
openpose或depth,模型对应选择control_v11p_sd15_openpose或control_v11f1p_sd15_depth。这能更好地保持人物体型和姿势结构。 - 种子:可以固定,也可以随机。
- 重绘幅度:设置为
- 点击生成,直到得到一张姿势符合要求且脸部特征稳定的图片。
5.3 第三步:静态图转视频
将上一步得到的分镜静态图(无论是直接生成的还是合成的)导入Runway Gen-2。
- 访问Runway ML官网,进入Gen-2工具。
- 上传你的静态图。
- 在文本提示词框中输入动作描述,例如:
The girl's hand moves slightly as she draws on the tablet. The barista wipes the counter in the background. Gentle camera zoom in.(描述要基于你的画面内容)。 - 选择视频时长(通常3-4秒对应一个分镜)。
- 点击生成。你可以多次生成,选择动态最自然的一版。
- 下载生成的短视频片段(MP4格式)。
重复此过程,为剧本中的每一个关键分镜生成视频片段。
5.4 第四步:视频剪辑、配音与合成
将所有AI生成的视频片段、配音、字幕在DaVinci Resolve中合成。
- 导入素材:将视频片段、背景音乐、音效导入媒体池。
- 粗剪:在时间线上按剧本顺序排列视频片段。
- 配音:
- 将剧本台词整理成文本。
- 使用Edge浏览器“大声朗读”功能(选择优质中文语音,如“云希”),录制每一句台词为音频文件。
- 将配音音频拖到时间线的对应位置。
- 字幕:在达芬奇的“字幕”工作区,根据配音添加字幕。可以统一字体、大小和位置。
- 调色与转场:为所有片段应用一个统一的“电影感”或“日系小清新”调色LUT。在片段之间添加简单的交叉溶解转场。
- 背景音乐:添加合适的轻柔背景音乐,在调音台中调整配音和背景音乐的音量平衡,确保人声清晰。
- 导出:选择H.264格式,分辨率1080p,帧率25或30,导出成片。
6. 常见问题与排查思路
在AI创作过程中,你一定会遇到各种问题。下表汇总了高频问题及解决方案:
| 问题现象 | 可能原因 | 排查与解决思路 |
|---|---|---|
| 生成的人物脸部崩坏 | 1. 提示词描述冲突。 2. CFG Scale过高或过低。 3. 采样步数不足。 4. 模型本身问题。 | 1. 检查提示词,避免“微笑”与“张嘴”等冲突描述。 2. 将CFG Scale调整到7-9之间。 3. 增加采样步数至25-30。 4. 尝试更换不同的大模型或LoRA模型。 |
| 角色特征无法固定 | 1. LoRA权重太低或太高。 2. 提示词中角色描述权重不够。 3. 图生图时重绘幅度太大。 | 1. 调整LoRA权重(通常0.5-0.8)。 2. 用括号和权重强调角色名,如 (林薇:1.3)。3. 降低图生图的重绘幅度至0.5以下,并配合ControlNet。 |
| 生成的视频动态诡异 | 1. 图生视频提示词描述的运动过于复杂。 2. 原始图片构图不适合运动。 3. 模型本身限制。 | 1. 简化提示词,只描述1-2个简单的动作(如“微微转头”、“轻轻眨眼”)。 2. 选择主体突出、背景相对简单的图片进行生成。 3. 尝试Runway的不同运动强度(Motion Brush)或换用Pika Labs。 |
| 多人物同框时相互污染 | 1. 模型难以理解复杂空间关系。 2. 提示词描述不清。 | 1. 采用“分别生成,后期合成”的方案,这是最稳妥的。 2. 如果必须直出,使用更详细的方位描述,如 on the left, a girl... on the right, a boy...,并启用Compositional Layout等高级控制插件。 |
| 画面中出现不想要的元素 | 负面提示词不够强力或具体。 | 在负面提示词中明确加入该元素的描述,如ugly, extra fingers, more than 5 fingers, bad hands。对于场景,可以加入text, watermark, signature, logo。 |
7. 最佳实践与进阶工程建议
当你掌握了基础流程后,以下建议能帮助你提升效率、稳定性和作品质量。
7.1 工作流优化:建立你的资产库
- 角色库:为每个主要角色生成一套“表情包”和“姿势集”(正面、侧面、微笑、惊讶等),并统一命名归档(如
林薇_正面微笑.png)。这能极大提升后续分镜制作效率。 - 场景库:根据剧本类型,预先生成一批常用场景(咖啡店、图书馆、公园、客厅等)的空镜,并标注风格和光照条件。
- 提示词库:将验证过好用的提示词片段(如高质量前缀、特定风格后缀、负面提示词)保存成文本文件或SD WebUI的“风格”模板。
7.2 提示词工程进阶技巧
- 权重控制:使用
()增加权重(默认1.1倍),[]降低权重(默认0.9倍),(word:1.5)精确设定权重。例如(crystal clear eyes:1.3)。 - 交替渲染:使用
[A|B]语法,让AI在A和B概念之间混合,可以产生有趣效果,如[sunlight|moonlight]可能产生黄昏感。 - 分步渲染:使用
BREAK指令或一些扩展插件,可以指定在生成的某些步骤后侧重某些提示词,用于控制构图和细节的生成顺序。
7.3 视频制作的专业化技巧
- 镜头语言:在生成分镜图时,有意识地设计镜头。特写(表达情感)、中景(描述动作)、全景(展现环境)交替使用,能让视频更有节奏感。
- 运动设计:在图生视频步骤,不要只让人物动。可以描述“镜头缓慢推进”、“背景灯光闪烁”、“树叶微微摇动”等环境微动,增加画面呼吸感。
- 音画同步:剪辑时,让动作的转折点(如抬头、递东西)与配音的重音或背景音乐的节拍点对齐,能极大增强观感。
7.4 合法合规与版权意识
- 人物肖像:避免生成与真实明星高度相似的脸部,用于商业项目时尤其要注意。
- 背景元素:注意生成的场景中是否包含可能侵权的品牌Logo、特定建筑外观。
- 音乐音效:使用无版权或已购买版权的背景音乐和音效。许多平台提供免费的创作共用音乐。
- 平台规则:了解你计划发布视频的平台(如抖音、B站、YouTube)对于AI生成内容的标注要求。
制作AI小甜剧是一个创意与技术结合的过程。它没有唯一的标准答案,核心在于不断实验、迭代和优化你的工作流。从模仿一个简单的场景开始,逐步尝试更复杂的剧情和镜头。当你成功产出第一个完整的短片时,你会发现,最大的收获不仅是掌握了一套工具,更是获得了一种用AI表达故事的新能力。这套方法论同样适用于其他类型的短剧、产品介绍、概念演示等领域。