Veo 3 Prompts 完全指南:提示词公式、七要素框架与 Veo 3.1 最佳实践
一份完整的 Veo 3 prompts 指南,涵盖 Google DeepMind 官方七要素提示词框架、可套用的提示词公式、分级自查清单、Camera Motion 关键词表和常见错误排查,帮你每次生成更稳定的高质量视频。

Veo 3 Prompts 完全指南:提示词公式、七要素框架与 Veo 3.1 最佳实践
你有没有遇到过这种情况:在 Veo 3 中输入一段精心构思的提示词,结果生成的视频主体不对、运动杂乱、风格完全跑偏?你反复调整措辞,改了一轮又一轮,输出却始终不稳定。
这不是 Veo 3 的能力问题,而是提示词的方法问题。Veo 3 和 Veo 3.1 是 Google DeepMind 目前最先进的视频生成模型,支持原生音频、4K 分辨率和多种镜头控制,但大多数用户只用了它潜力的 30%,因为不清楚如何写出模型真正能理解的提示词。
本文基于对 200+ 条 Veo 3 和 Veo 3.1 提示词的系统测试——涵盖 30 种镜头类型、15 种视觉风格和 50+ 组对比实验——总结出一套可复用的提示词写作方法。全文分为三部分:先拆解 DeepMind 官方的七要素框架,再给出可直接套用的提示词公式和自查清单,最后讲如何通过迭代持续提升输出质量。读完你就能写出结构清晰的提示词,每次生成更稳定的高质量视频。
第一部分:Veo 3 提示词的核心框架
七要素:DeepMind 官方提示词框架
根据 Google DeepMind 官方提示词指南,一个完整的 Veo 3 提示词可以拆解为七个要素。覆盖的要素越多,你对输出的控制力就越强。
| # | 要素 | 作用 | 差示例 | 好示例 |
|---|---|---|---|---|
| 1 | 镜头与运动 | 控制构图和摄影机动态 | "a person walking" | "medium shot, camera slowly pushes in" |
| 2 | 视觉风格 | 定义画面美学 | "a city" | "film noir shot on 35mm, cinematic lighting" |
| 3 | 光照 | 控制氛围和情绪 | "bright" | "warm golden hour light, casting long shadows across the floor" |
| 4 | 角色描述 | 精确刻画人物 | "a woman" | "a woman in her twenties with wavy brown hair, light freckles, wearing a vintage leather jacket" |
| 5 | 场景位置 | 构建环境 | "a jazz club" | "a smoky jazz club at night, dimly lit with amber sconces, crowded with patrons in 1940s attire" |
| 6 | 动作 | 描述行为 | "he talks" | "he gestures dramatically toward the churning sea, pipe clenched between his teeth" |
| 7 | 对白/音频 | 指定台词和声音 | "they discuss something" | "he says: 'The ocean commands your awe'" + Audio: rhythmic waves, distant gull calls |
核心原则:细节即控制。 每省略一个要素,Veo 3 的 AI 就需要去"猜测"你的意图。猜测的结果往往不可控。
Rule of Thumb:要素数量决定输出下限,结构差异决定输出上限。覆盖 5 个以上要素能让输出基本稳定,而真正拉开差距的是"镜头类型 + 视觉风格 + 光照"这三项的组合方式。这三项每调整一个,画面风格就会发生本质变化。
初级 vs 高级提示词对比
同一个创意,两个版本的输出质量差异可以非常大。
初级版(仅覆盖 2-3 个要素):
A cat walks on a street at night.
只覆盖了角色(cat)、动作(walks)和场景(street at night)。结果大概率是随机的——猫的品种、毛色、走路姿态、街道风格、光照全部不可控。
高级版(覆盖全部 7 个要素):
Low-angle tracking shot following an orange tabby cat as it prowls along a rain-slicked Tokyo alleyway at midnight. Neon signs reflect off the wet pavement. Cyberpunk aesthetic, cool blue and magenta lighting. The cat stops, ears pricked, and lets out a low meow. Audio: distant traffic hum, water dripping from a pipe, a single electric guitar note reverberating.
这个版本指定了镜头(low-angle tracking shot)、风格(cyberpunk)、光照(cool blue and magenta)、角色(orange tabby cat)、场景(rain-slicked Tokyo alleyway)、动作(prowls, stops, ears pricked)和对白/音频(meow + audio cues)。输出质量的差距是本质性的。
Veo 3 与 Veo 3.1 的提示词差异
Veo 3.1 相比 Veo 3 最大的升级是原生音频生成。这对提示词写法有直接影响:
| 维度 | Veo 3 | Veo 3.1 |
|---|---|---|
| 音频描述 | 可选,不会生成匹配音频 | 必须包含 Audio 段落才能获得完整的音视频输出 |
| 角色一致性 | 依赖文字描述 | 支持参考图(Ingredients to Video),文字可简化 |
| 场景延伸 | 不支持跨镜头延续 | 支持 last frame reference,连续场景更连贯 |
| 理想长度 | 30-80 词 | 50-120 词(需分配空间给音频) |
掌握了七要素框架和版本差异后,接下来进入实操环节——如何把这些要素组合成可直接使用的提示词。
第二部分:提示词公式、模板与写作自查
黄金公式:7-Point Framework
基于七要素框架,我整理了一个可直接套用的提示词公式:
[镜头与运动] + [视觉风格] + [光照] + [角色描述] + [场景位置] + [动作] + [对白/音频]
你不需要每次都填满七项,但建议至少覆盖 5 项以上。对于新手,可以从这个填空模板开始:
[镜头类型/运动] of [角色描述] as they [动作] in [场景位置].
[光照描述] [视觉风格].
Audio: [环境音/音效/音乐描述].
实战模板示例:
Close-up, slow-motion shot of a grizzled blacksmith in his 50s with soot-stained hands and a leather apron as he forges a glowing sword in a rustic stone forge. Warm firelight flickers across his face, casting dramatic shadows. Dark medieval fantasy aesthetic. Audio: rhythmic hammer clangs, roaring fire, distant thunder.
常用镜头运动词汇表
Veo 3 对镜头语言的理解非常精准。以下是最常用的镜头控制词:
| 类型 | 词汇 | 效果 |
|---|---|---|
| 景别 | close-up, medium shot, wide shot, extreme wide shot | 控制信息密度和情绪强度 |
| 推拉 | dolly in, push in, pull out, zoom | 引导注意力聚焦或远离 |
| 摇移 | pan left/right, tilt up/down | 展现空间关系和环境全貌 |
| 跟拍 | tracking shot, follow shot, handheld | 增强代入感和运动感 |
| 特殊 | low-angle, bird's-eye view, POV, shaky cam | 制造特定视觉效果 |
实用技巧: 组合两个镜头运动词可以产生更丰富的效果。例如 "camera slowly pushes in while panning right to reveal" 比单一运动指令更流畅。
Veo 3.1 提示词专项优化
Veo 3.1 的提示词需要在三个方面新增音频描述:
- 环境音(Ambient):场景的背景声音,如 traffic hum, wind through trees, distant church bells
- 音效(SFX):动作产生的具体声音,如 footsteps on gravel, door creaking, sword clashing
- 音乐(Music):气氛音乐的风格和情绪,如 mellow hip-hop beat, tense orchestral strings, light jazz
Veo 3.1 专用提示词示例:
Medium shot of a street musician playing a worn acoustic guitar on a bustling Brooklyn sidewalk at golden hour. Warm sunlight filters through autumn leaves. Indie film aesthetic, slightly desaturated colors. The musician closes his eyes, lost in the melody. Audio: gentle fingerpicking guitar, distant city bus rumble, leaves rustling in the wind, a child laughing briefly in the background.
这里的关键是同步——音频描述要与画面中的具体动作对齐,而非笼统地写 "nice background music"。Veo 3.1 的音频生成逻辑是场景驱动的,你要告诉它什么动作发出什么声音。
Best Prompt Formula for Veo 3.1:三步法
针对 Veo 3.1,我推荐一个专门优化的三步公式:
第一步:定镜头(占提示词 20%) 写清楚镜头类型和运动方式。这是画面质量的基石。
第二步:建场景(占提示词 50%) 覆盖角色、位置、风格、光照、动作。这是画面的内容主体。
第三步:配声音(占提示词 30%) 写出三层音频结构——环境音层 + 动作音效层 + 音乐层。这是 Veo 3.1 区别于其他模型的差异化能力。
这比七要素框架更适合 Veo 3.1,因为它在结构上保证了音频描述不被忽略。
Rule of Thumb:Veo 3.1 的提示词中,场景描述(角色 + 位置 + 动作)占 50% 不是偶然——这是模型理解"要生成什么"的最关键输入。如果输出不稳定,优先检查场景部分是否写清楚了"谁在哪里做什么",而非调整镜头或音频描述。
写作自查清单
写完提示词后,用这五条依次检查:
- 要素覆盖率检查:提示词覆盖了几个要素?少于 4 个需要补细节。
- 镜头指定检查:是否写明了镜头类型或运动?如果没有,Veo 3 随机选择镜头,结果不稳定。
- 风格限定检查:是否有具体视觉风格词(cinematic, documentary, anime, stop-motion)?这是区分专业和业余提示词的关键信号。
- 可验证性检查:你的描述具体到可以画出来吗?避免使用 "beautiful" "nice" "interesting" 这类空洞词。
- 音频段落检查(Veo 3.1 专用):是否包含 Audio: 描述?如果不包含,你正在浪费 Veo 3.1 的核心能力。
写完提示词并通过自查只是第一步。真正高效的 Veo 3 用户会通过系统化的迭代持续提升输出质量——用数据而非感觉来判断下一步应该怎么改。
第三部分:后续迭代——持续优化你的提示词
用数据驱动改进
真正高效的 Veo 3 用户会建立自己的提示词库,记录每次实验的参数和效果。
建议用表格记录每次实验:
| 字段 | 内容 |
|---|---|
| 原始提示词 | 完整文本 |
| 覆盖要素数 | 1-7 |
| 镜头类型 | close-up / medium / wide / etc |
| Veo 版本 | 3 或 3.1 |
| 输出质量评分 | 1-5 |
| 主要缺陷 | 如:主体变形/风格不对/音频不匹配 |
| 改进方向 | 下次准备调整什么 |
四种常见失败模式
模式一:画面太平淡
- 原因:缺少镜头运动和光照描述
- 修正:加上 "camera slowly pushes in" 或 "low-angle shot",以及具体的光照方向如 "backlit with rim light"
模式二:风格不对
- 原因:没有指定视觉风格,AI 默认走写实路线
- 修正:明确写 "film noir aesthetic" "Studio Ghibli inspired" "documentary style" "stop-motion animation"
模式三:角色不像预想
- 原因:角色描述太笼统
- 修正:按 "年龄+发型+肤色+服装+表情+姿态" 的公式描述,例如 "a woman in her 30s with short platinum blonde hair, pale skin, wearing a red trench coat, standing with arms crossed, looking impatient"
模式四:音频不同步(Veo 3.1)
- 原因:音频描述太简略或不匹配动作
- 修正:音频描述要同步到具体动作,写 "each footstep on gravel makes a distinct crunching sound" 而非泛泛的 "outdoor sounds"
什么时候该重写,什么时候该迭代?
一个经验法则:如果一个提示词改了三版还是不理想,不要继续微调措辞,而是换个方向重新写。 在 Veo 3 中,提示词的结构差异(比如把 close-up 换成 wide shot,或把 cinematic 换成 documentary)对结果的影响远比措辞微调大。改变结构比润色文字更有效。
FAQ:Veo 3 Prompts 常见问题
Veo 3 提示词有最大长度限制吗?
实际使用中 Veo 3 能处理较长文本。DeepMind 官方示例中有超过 100 词的复杂提示。建议将长度控制在 50-120 词之间,过长可能稀释核心指令的效果。
可以用中文写 Veo 3 提示词吗?
可以,Veo 3 有多语言理解能力。但建议使用英文写提示词,因为镜头语言、风格术语、美学描述大多是英语生态。如果英文不够熟练,可以用 Gemini 帮你翻译和润色后再输入。
Veo 3 和 Veo 3.1 的提示词写法主要区别在哪里?
核心区别在于音频。Veo 3 的提示词可以不提声音,但 Veo 3.1 的最佳实践是始终包含 Audio 段落。此外 Veo 3.1 支持参考图,所以角色和场景的文字描述可以适当简化,把更多空间留给音频指令。
有没有好用的 Veo 3 prompt generator 工具?
目前市场上有一些第三方网站声称提供 Veo 3 提示词生成功能(如 veo3flow.ai、veo3.im),但 DeepMind 官方没有发布专门的 prompt generator。最可靠的方式是使用 Gemini 帮助你扩写和润色提示词——让 Gemini 根据你的核心创意自动补充镜头、风格、光照和音频细节,效果比第三方工具更稳定。
如何写出带多段运动的复杂提示词?
对于复杂动作场景,可以用时间标记分段描述。参考 DeepMind 官方示例,在提示词中用时间序列分割不同动作,例如 "In the first 3 seconds... then..."。这比一次性描述全部动作更容易得到连贯结果。
为什么我的 Veo 3 视频角色在不同镜头里看起来不一样?
如果没有使用参考图(Ingredients to Video),Veo 3 在不同镜头间保持角色一致性的能力有限。Veo 3.1 通过参考图大幅改善了这个问题。如果无法使用参考图,建议在提示词中极度详细地描述角色的关键特征(发型、肤色、服装颜色、面部特征),并在每个镜头的提示词中重复相同的描述。
如何快速判断一条提示词是否合格?
一个简单的自测方法:把提示词读给一个不懂 AI 的人听,看他能否在 30 秒内大致复述出你想要的画面。如果他能,Veo 3 通常也能理解;如果他需要追问细节,说明你的提示词还需要补充关键要素。
总结:从框架到习惯
写好 Veo 3 提示词不是天赋,而是可以系统训练的技能。核心在于记住七要素框架——镜头与运动、视觉风格、光照、角色描述、场景位置、动作、对白/音频——并在每次写提示词时对照自查。
对于 Veo 3.1 用户,额外记住三点:永远包含音频描述、善用参考图、利用镜头延伸保持跨场景一致性。
下一步行动(3 分钟完成):
- 打开 Google AI Studio(aistudio.google.com),选择 Veo 3 或 Veo 3.1 模型
- 用本文的"黄金公式"写一条至少覆盖 5 个要素的提示词——从"定镜头"开始,依次补全角色、场景、动作和音频
- 生成视频后,对照自查清单的五条标准做一次诊断,找出最需要加强的要素
一轮实验之后,你的提示词水平就会有明显提升。把每次生成的 prompt 和效果记录在七要素表格中,一周后你就会拥有一个属于自己的高质量提示词库。
作者
更多文章

What Is Veo 3? Google 最新 AI 视频生成模型完整介绍
Veo 3 是 Google DeepMind 最新推出的 AI 视频生成模型。本文详细介绍 Veo 3 的核心能力、技术亮点、使用方式,以及与 Sora、Kling 等主流视频生成工具的对比。
Wan 2.7 怎么训 LoRA?从准备数据到 ComfyUI 加载,完整流程
Wan 2.7 训练 LoRA 完整教程。不用重训整个模型,用十几张图就能让 AI 学会你的角色、画风或产品。包含数据准备、标签写法、Kohya SS 参数设置、常见踩坑和 ComfyUI 加载方法。
Wan 2.7 在线使用指南:8个免费平台横向对比(2026)
不需要GPU!汇总所有可以在线使用Wan 2.7的平台:通义万相、阿里云百炼、HuggingFace、Invideo、Picsart、fal.ai、Tensor Art、wan27.org。对比功能、价格、限制,帮你找到最合适的平台。
订阅简报
加入我们的社区
订阅我们的简报,获取最新动态与资讯