AI 视频提示词写不出电影感,问题通常不在“形容词不够多”,而在“提示词没有结构”。很多人的提示词长这样:一只很酷的狼,在森林里奔跑,帅爆了,超高清,8K,电影感。视频模型收到以后,只能随机发挥,画面漂移、景别混乱、质感像壁纸,就是因为你没告诉它“镜头怎么动、主体怎么演、光是什么方向”。这次我们来看一套更实用的写法:先写镜头,再写风格。把镜头语言当成提示词的骨架,把风格描述当成质感外衣,AI 视频出现电影感的概率会明显提升。
这篇文章不讨论具体某个视频模型参数,也不做横向跑分,只解决一个问题:AI 视频提示词怎么写,才能稳定出现电影感。文章会拆解提示词结构、给出镜头层和风格层的词汇工具箱、带示例模板,并提供一个本地批量生成提示词的脚本思路。适合正在折腾 Sora、可灵、即梦、Runway、Vidu、Luma 一类文生视频或图生视频工具的读者。
1. 核心能力速览
| 能力项 | 说明 |
|---|---|
| 适用任务 | 文生视频、图生视频提示词编写 |
| 核心思路 | 先写镜头层,再写风格层 |
| 镜头层要素 | 景别、运镜、主体动作、时间推进 |
| 风格层要素 | 画面质感、色彩倾向、光影、电影语言 |
| 输出形式 | 段落式提示词 / 分字段提示词 / JSON 结构化提示词 |
| 批量能力 | 可通过脚本批量组合镜头与风格模板 |
| 硬件要求 | 无额外要求,提示词编写可在任意电脑完成 |
| 适合人群 | AI 视频创作者、短剧制作、广告分镜、Vlog 包装 |
这套方法的重点不是让提示词变长,而是让提示词具备“导演思维”。视频模型看的是文字里的动作序列和空间关系,你给它清晰的镜头推进路径,它生成的画面就不会东一榔头西一棒子。
2. 为什么“先写镜头,再写风格”更合理
AI 视频模型和 AI 绘图模型不同。AI 绘图是一张静态图,你写一堆风格词,它可以直接渲染到画面上。AI 视频是多帧序列,模型要做两件事:先确定“这一帧里的人/物在什么位置、下一步怎么动”,再确定“每个像素以什么质感呈现”。如果你只给风格不给镜头,模型只会填充一些看起来很漂亮的随机动画,但没有叙事逻辑。
从生成原理看,视频模型对文本的理解会偏向“动词”和“空间关系”。比如:
- “镜头慢慢推进”会被理解为镜头焦段或距离变化。
- “人物从画面左侧走入镜头”会被理解为空间运动。
- “雨滴砸在地面溅起水花”会被理解为物理交互。
这些都属于镜头层的信息,负责决定画面里发生了什么。
风格层负责什么呢?负责告诉模型“用什么胶片、什么色调、什么光质来渲染这些画面”。比如:
- 35mm 胶片颗粒
- 青橙色调
- 黄昏逆光
- 浅景深
如果提示词里全是风格词,没有一个动作和镜头词,生成结果大概率是“漂亮的空镜”,无法形成电影感叙事。所以,正确顺序是:先让模型知道画面怎么运动,再告诉它画面长什么样。这个顺序放在提示词里的物理位置,也最好是镜头信息在前、风格信息在后。一方面是符合主流的视频模型提示词解析逻辑,另一方面也方便你维护和复用。
3. AI 视频提示词的标准结构
把一条提示词拆成“七要素”,比较适合初学电影感提示词的人理解和记忆。
| 要素 | 作用 | 示例 |
|---|---|---|
| 1. 景别 | 定义画面主体大小 | 远景、中景、近景、特写 |
| 2. 运镜 | 定义镜头运动方式 | 推、拉、摇、移、跟、环绕 |
| 3. 主体 | 定义画面中的人物/物体 | 穿风衣的男人、机械手臂、旧火车 |
| 4. 动作 | 定义主体的运动状态 | 回头、奔跑、眨眼、拾起物体 |
| 5. 环境 | 定义空间和时间 | 雨夜街道、废弃工厂、黄昏沙漠 |
| 6. 氛围 | 定义情绪基调 | 压抑、孤独、神秘、紧张 |
| 7. 风格 | 定义纹理、色调、光影 | 胶片感、青橙调、逆光、浅景深 |
段落式提示词则是把这些要素按顺序组合成一个自然语句。示例结构如下:
[景别],[运镜]。主体是[主体描述],正在[动作描述],场景位于[环境描述],整体氛围[氛围描述]。画面风格[风格描述],[质感/光线/色彩补充]。举一个具体例子:
中景,镜头缓慢向前推进。主体是一个穿深色风衣的中年男人,他站在雨夜的街灯下,低头点烟,烟气上升。画面整体氛围孤独、压抑。电影风格,35mm 胶片质感,青橙色调,雨水反光,浅景深,背景路灯虚化。这条提示词里,前两句是镜头层,后面是主体动作层,最后才是风格层。模型生成的画面会更稳,因为它知道先模拟镜头推进,再渲染雨夜和胶片质感。
4. 镜头层词汇工具箱
镜头层是视频提示词的核心骨架。下面把常用词汇按功能分组,方便直接抄用。
4.1 景别
| 景别 | 英文参考 | 适合表达的内容 |
|---|---|---|
| 远景 | wide shot | 大环境、人物渺小感、史诗感 |
| 全景 | full shot | 完整人物与部分环境 |
| 中景 | medium shot | 对话、动作交流 |
| 近景 | close-up shot | 情绪、表情、细节 |
| 特写 | extreme close-up | 眼神、道具、纹理冲击 |
写提示词时,最好写明“从什么景别开始,到什么景别结束”。这实际上是给模型一个推轨设计方案。
4.2 运镜
运镜直接影响画面运动感。常见写法:
| 中文关键词 | 英文参考 | 使用建议 |
|---|---|---|
| 推近 | push in / dolly in | 强调情绪、聚焦细节 |
| 拉远 | pull back / dolly out | 揭示环境、放大孤独感 |
| 横摇 | pan left / pan right | 展示空间关系 |
| 俯仰 | tilt up / tilt down | 改变视角权力关系 |
| 跟随 | tracking shot | 跟随主体运动,强化沉浸感 |
| 环绕 | orbit / 360 degree | 强调空间和主体关系 |
| 手持 | handheld | 增加纪录感和紧张感 |
| 稳定器 | gimbal smooth | 画面顺滑、商业感强 |
需要注意:不要在一个提示词里堆太多运镜方式。模型经常无法区分“先推后拉”和“同时推拉”。一般情况下一个视频片段只写一种主运镜,如果需要变化,可以拆成两段生成再剪辑。
4.3 主体动作
主体动作是模型判断“物理运动是否合理”的关键。写动作时尽量写连续的小动作,而不是一个抽象的大词。比如:
- 不要只写“她很悲伤”,可以写“她转过头,眼眶微红,嘴唇动了动,没有发出声音”。
- 不要只写“汽车开过来”,可以写“汽车从画面右侧滑入,轮胎碾过积水,溅起水花,最后停在镜头前”。
- 不要只写“爆炸”,可以写“远处建筑发生爆炸,冲击波推动尘土向镜头方向扩散,玻璃碎片飞溅”。
动作描述越具体,模型越容易生成真实的运动轨迹。这也是“电影感”和“PPT 感”的核心区别。
4.4 时间与氛围
同一个画面,放在白天和放在黄昏,情绪完全不同。环境与时间词要提前写:
凌晨薄雾、正午烈日、黄昏逆光、午夜街灯、阴天、暴雨前、灰尘弥漫的午后、雪后的清晨氛围词可以紧跟在环境词后面,比如“氛围压抑”“气氛紧张”“情绪孤独”“画面安静”。
5. 风格层词汇工具箱
镜头层负责“动线”,风格层负责“质感”。风格层不要只写一个“电影感”,因为模型对这个词的响应太泛了。更好的做法是拆成质感、色彩、光影、镜头语言四个维度。
5.1 画面质感
质感描写告诉模型“像什么介质拍摄的”。常见选项:
- 35mm 胶片颗粒感
- 8mm 复古录像带质感
- IMAX 级高分辨率干净画面
- 黑白胶片
- 过期胶片褪色
- 柔焦滤镜
- 拉丝光晕
不同项目适合不同质感。复古题材用胶片颗粒和柔焦会更像电影,现代纯产品展示用干净高分辨率更合适。
5.2 色彩倾向
色彩是电影感最容易被感知的部分。可以在层级里写:
- 青橙色调,阴影偏青,高光偏橙
- 低饱和绿色,营造阴郁压抑氛围
- 暖黄与暗棕,复古怀旧
- 红黑对比,强冲突
- 莫兰迪色系,柔和安静
- 霓虹紫蓝色,赛博朋克
写色彩时最好给出“主色调 + 分布方式”,比如“画面以青色和洋红色为主,霓虹灯在背景中形成光斑”。
5.3 光影
光影是很多人写提示词容易忽略的维度。同样一个中景,顺光和逆光的情绪截然不同。光影词包括:
| 光影类型 | 中文关键词 | 英文参考 |
|---|---|---|
| 逆光剪影 | 逆光剪影,轮廓光 | backlit silhouette |
| 侧光 | 伦勃朗侧光,脸部半明半暗 | Rembrandt lighting |
| 黄昏暖光 | 低角度阳光,长阴影 | golden hour |
| 冷光 | 蓝色月光,冷色调阴影 | cold moonlight |
| 人造光 | 霓虹灯、路灯、车灯补光 | neon / streetlight |
| 体积光 | 丁达尔效应,灰尘中透射光束 | volumetric light |
提示词写法示例:
逆光角度,轮廓光勾勒出人物的头发边缘,前景处于暗部,背景有一排暖黄色路灯形成光斑。5.4 电影语言补充
想让提示词更有“电影感”,可以加入一些后期和导演层面的语言:
浅景深、背景虚化、景深过渡、广角畸变、长焦压缩感、慢动作、时间切片、手持跟拍感、24fps 电影帧率、宽银幕比例这些词不一定会被所有视频模型精确识别,但能帮助模型在概率上倾向生成更像电影的构图和光影。
6. 实战示例:从镜头到风格完整提示词
下面给出几个不同场景的完整示例。每个示例都按“镜头层 + 风格层”顺序排列,可以直接复制到你的视频模型里试。
6.1 雨夜都市追逐
全景,手持镜头跟随,轻微晃动。主体是一个穿黑色卫衣的年轻人,在雨夜狭窄巷子里奔跑,脚踩积水,水花四溅。他回头看了一眼身后,表情紧张,继续加速。场景位于潮湿的老旧都市街区,墙面有涂鸦,霓虹灯牌闪烁。画面氛围紧张、压迫。风格层,35mm 胶片质感,青橙色调,蓝绿色冷光为主,霓虹灯在湿地面产生彩色反射,浅景深,24fps 电影感。要点:运镜是“手持跟随”,动作是“奔跑 + 回头看”,风格是“胶片 + 青橙 + 霓虹反射”,结构与原则一致。
6.2 孤独旅行者
远景,缓慢拉远。主体是一个孤独的旅行者,背着旧帆布包,站在荒漠公路中间,看着远处的地平线。风扬起尘土和衣角,他抬手压了压帽檐。周围只有一条灰色公路和无尽沙漠,天色渐暗,云层厚重。氛围孤独、空旷、沉默。风格层,低饱和土黄色调,黄昏逆光,长阴影,35mm 胶片颗粒,空气透视明显,画面带有纪录片质感。要点:拉远镜头揭示环境,动作保持简单克制,风格强调低饱和和颗粒感。
6.3 科幻机械舱内
中景,镜头缓慢环绕。主体是一个白色机械维修机器人,站在飞船舱室中央,机械臂正在更换损坏的光学面板,蓝色电弧像电流一样在接口处闪烁。场景背景是金属舱壁、管线、全息投影面板。光线以冷蓝色为主,投影面板发出淡橙色补充光。氛围冷静、精密。风格层,干净的科幻片质感,高对比度金属反光,浅景深,广角略帶畸变,低照度环境下暗部细节清晰,24fps 电影感。要点:动作是“机械臂更换面板 + 电弧闪烁”,空间信息丰富,风格偏科幻商业片。
6.4 提示词模板化写法
如果经常要写相似场景,可以把提示词做成模板:
{景别},{运镜}。主体是{主体描述},正在{动作描述},位置在{环境描述}。画面氛围{氛围描述}。风格层,{质感},{色彩},{光影},{景深/画幅补充}。把变量替换成具体内容即可。这个模板的好处是稳定、可复用,适合批量生产不同场景提示词。
7. 不同 AI 视频工具的提示词风格差异
不同视频模型对提示词的解析方式差异很大。这里不针对单一工具跑分,只讲通用观察,实际效果需要以你当前使用的模型为准。
| 工具类型 | 常见提示词习惯 | 建议 |
|---|---|---|
| 中文视频模型 | 中文关键词识别较好,支持自然语言长句 | 直接使用段落式中文提示词 |
| 英文视频模型 | 对英文短语和电影术语响应更稳定 | 段落里保留少量英文电影词汇 |
| 图生视频模型 | 图片已经决定了主体和环境,提示词不要重复描述背景 | 重点写运镜、动作、光影变化 |
| 兼顾首尾帧模型 | 提示词要对应首帧和尾帧的状态变化 | 写清楚“开始时……结束时……” |
图生视频是电影感提示词最容易发挥的场景。因为画面主体已经被图片锁定了,提示词里再写“一个穿风衣的男人”反而可能产生冲突。更好的方式是只写镜头运动和变化,比如:
镜头从近景缓缓拉远,男人站在楼顶边缘,风衣被风吹起,背景城市灯光逐渐从虚化变清晰,画面色调从冷蓝转为昏黄。这等于把提示词重心全部放在“变化”上,符合视频模型的工作方式。
8. 用脚本批量生成电影感提示词
写提示词不一定要一条一条手动写。如果你用 CSV 或 JSON 维护素材,完全可以用少量代码批量生成组合。下面是一个本地脚本思路,用 Python 把镜头信息和风格信息做笛卡尔积,输出多条提示词。
import json import itertools # 镜头层配置 shots = [ {"scene": "中景", "camera": "镜头缓慢向前推进", "subject": "穿深色风衣的中年男人", "action": "他站在雨夜的街灯下,低头点烟,烟气上升"}, {"scene": "远景", "camera": "镜头缓慢拉远", "subject": "孤独的旅行者", "action": "他背着旧帆布包,站在荒漠公路中间,看着远处地平线"}, ] # 风格层配置 styles = [ "35mm 胶片质感,青橙色调,雨水反光,浅景深,背景路灯虚化", "低饱和土黄色调,黄昏逆光,长阴影,35mm 胶片颗粒,纪录片质感", ] # 环境层配置 envs = [ "场景位于潮湿的老旧都市街区,墙面有涂鸦,霓虹灯牌闪烁", "场景位于无尽沙漠,天色渐暗,云层厚重", ] results = [] for shot, style, env in itertools.product(shots, styles, envs): prompt = f"{shot['scene']},{shot['camera']}。主体是{shot['subject']},正在{shot['action']}。{env}。风格层,{style}。" results.append({"prompt": prompt, "shot": shot["scene"]}) with open("prompts.json", "w", encoding="utf-8") as f: json.dump(results, f, ensure_ascii=False, indent=2) print(f"已生成 {len(results)} 条提示词")这个脚本生成的是 JSON 文件,你可以把每条 prompt 复制到视频模型里测试,也可以再接一个队列脚本,配合模型 API 做批量生成。脚本本身不依赖任何特殊库,Python 3.8 以上即可运行。
如果你用的是某个视频模型的 API 服务,批量提示词可以进一步封装成请求参数:
import requests import json # 这里以通用 form 示例展示,实际接口地址和参数以你使用的平台为准 api_url = "https://your-video-api.example.com/generate" headers = {"Authorization": "Bearer YOUR_TOKEN"} with open("prompts.json", "r", encoding="utf-8") as f: prompts = json.load(f) for item in prompts: payload = { "prompt": item["prompt"], "negative_prompt": "low quality, blurry, bad anatomy", "duration": 5, "resolution": "720p", } response = requests.post(api_url, headers=headers, json=payload, timeout=30) print(response.status_code)注意,这只是通用封装思路,实际接口名称、鉴权方式和返回结构都必须按你用的平台调整。
9. 提示词验证与调参
写完提示词以后,不要急着堆下一批。先跑 1 到 2 条,确认下面几个维度再批量。
第一看镜头是否执行。模型是否真的出现了“推进”“拉远”“环绕”这些运动?如果画面纹丝不动,可能是运镜词被风格词淹没了,需要把运镜词提前,或者减少风格词数量。
第二看主体是否一致。多帧生成里,人物脸部、衣服颜色、物体形状有没有漂移?漂移严重时,可以把主体描述写得更具体,包括颜色、服装、位置、姿态。比如不要写“一个男人”,要写“一个穿深灰色呢子大衣、戴黑色围巾、头发花白的老人”。
第三看光影是否符合预期。电影感很依赖光,生成结果如果是灰蒙蒙一片,可以在风格层里加强光源方向词,例如“黄昏逆光,人物边缘有明显的暖色轮廓光”。
第四看是否出现硬件或平台限制导致的时长缩短。很多视频模型默认生成 5 秒片段,如果你提示词里写了大段情节,模型可能来不及展开。建议一个片段只写一个动作闭环,不要超过两个动作。
验证时可以建立一张记录表,把提示词、生成结果、镜头反馈、问题原因记录下来,方便后续迭代。
10. 常见问题与排查方法
| 问题现象 | 可能原因 | 排查方式 | 解决思路 |
|---|---|---|---|
| 画面没有动感 | 运镜词缺失或太靠后 | 检查提示词前两句是否在写动作和运镜 | 把“镜头缓慢推进”“手持跟随”等词提前 |
| 主体漂移 | 主体描述不具体 | 查看每帧主体外形是否一致 | 增加主体颜色、服装、位置细节 |
| 风格像壁纸 | 只有风格词没有镜头词 | 检查提示词是否全是“电影感、高级感” | 补充景别、运镜、主体动作 |
| 色彩混乱 | 颜色词堆砌 | 检查同时出现的高饱和色数量 | 只保留主色调和辅助色,减少无关颜色 |
| 生成时长太短 | 动作闭环过多 | 检查一段里是否塞了多个动作 | 一个片段只保留一个主要动作 |
| 图生视频主体被修改 | 提示词重复描述主体 | 检查提示词里是否重新描述了图片内容 | 图生视频只写运镜、动作、光影变化 |
| 接口批量任务部分失败 | 无重试机制或参数超限 | 查看失败请求的错误信息 | 增加重试逻辑,降低单次请求参数复杂度 |
| 生成结果随机性太强 | 随机种子变化 | 检查平台是否支持固定 seed | 固定 seed 后对比调参效果 |
排查时先定位是“镜头层问题”还是“风格层问题”。画面不电影感,多数时候不是风格词不够,而是镜头执行太弱。
11. 最佳实践与使用建议
11.1 先把镜头层写成完整句
不要只写“推近”两个字。写“镜头从全景缓慢推近到面部特写,焦点从环境过渡到人物眼睛”,模型才有足够信息模拟运镜过程。运动描述尽量包含起点、轨迹和终点。
11.2 风格词控制在两组以内
一组风格词的典型结构是“质感 + 色彩 + 光影”。比如“35mm 胶片颗粒,青橙色调,黄昏逆光”。如果再往上叠加“赛博朋克”“梦幻”“高级感”,很容易互相干扰。更稳妥的做法是确定一个主风格,再加一个辅助元素。千万不要在一条提示词里写“赛博朋克中国风复古科幻赛博朋克”。
11.3 给长视频拆片段
长视频不要指望一条提示词生成全程。建议先拆成 3 到 5 个镜头片段,每个片段单独生成,再剪辑拼接。每个片段只需要一个镜头语言和一段动作闭环,生成稳定性和可控性都会更高。
11.4 建立自己的提示词素材库
用 Excel 或 Notion 维护一份提示词库,字段包括场景、景别、运镜、主体、环境、风格、平台、实测效果、问题记录。时间越长,复用的模板越多,写提示词的速度会快很多。
11.5 注意素材版权与合规使用
写提示词时,不要直接模仿或复制特定导演的个人签名风格用于商业宣传,也不要使用可能涉及名人人脸、商标标识或未授权素材的描述。生成结果可能和真实人物、品牌或受版权保护内容高度相似,公开发布前必须确认已经获得相应授权。涉及真人肖像、真实地点、声音克隆的场景,必须先取得授权,并且只在合规测试环境中验证。批量生成和接口调用时,还要设置访问控制,避免接口被别人滥用。
12. 总结
AI 视频提示词出现电影感,不靠高级感这种虚词,靠的是结构和顺序。先写镜头层,让模型知道画面怎么推进、主体怎么运动;再写风格层,让模型把质感、色调、光影铺在画面上。镜头层决定画面像不像视频,风格层决定画面像不像电影。两者缺一不可,顺序错了也容易翻车。
建议收藏备用,下次写 AI 视频提示词时,先按“景别 + 运镜 + 主体动作 + 环境氛围 + 风格质感”拆一遍,再填入具体内容。第一轮大概率能明显减少“画面不动”“主体乱飞”“质感像 PPT 壁纸”这三大问题。