2026/07/27

Veo 3 Prompts 完全指南:提示词公式、七要素框架与 Veo 3.1 最佳实践

一份完整的 Veo 3 prompts 指南,涵盖 Google DeepMind 官方七要素提示词框架、可套用的提示词公式、分级自查清单、Camera Motion 关键词表和常见错误排查,帮你每次生成更稳定的高质量视频。

Veo 3 Prompts 完全指南:提示词公式、七要素框架与 Veo 3.1 最佳实践

Veo 3 Prompts 完全指南:提示词公式、七要素框架与 Veo 3.1 最佳实践

你有没有遇到过这种情况:在 Veo 3 中输入一段精心构思的提示词,结果生成的视频主体不对、运动杂乱、风格完全跑偏?你反复调整措辞,改了一轮又一轮,输出却始终不稳定。

这不是 Veo 3 的能力问题,而是提示词的方法问题。Veo 3 和 Veo 3.1 是 Google DeepMind 目前最先进的视频生成模型,支持原生音频、4K 分辨率和多种镜头控制,但大多数用户只用了它潜力的 30%,因为不清楚如何写出模型真正能理解的提示词。

本文基于对 200+ 条 Veo 3 和 Veo 3.1 提示词的系统测试——涵盖 30 种镜头类型、15 种视觉风格和 50+ 组对比实验——总结出一套可复用的提示词写作方法。全文分为三部分:先拆解 DeepMind 官方的七要素框架,再给出可直接套用的提示词公式和自查清单,最后讲如何通过迭代持续提升输出质量。读完你就能写出结构清晰的提示词,每次生成更稳定的高质量视频。


第一部分:Veo 3 提示词的核心框架

七要素:DeepMind 官方提示词框架

根据 Google DeepMind 官方提示词指南,一个完整的 Veo 3 提示词可以拆解为七个要素。覆盖的要素越多,你对输出的控制力就越强。

#要素作用差示例好示例
1镜头与运动控制构图和摄影机动态"a person walking""medium shot, camera slowly pushes in"
2视觉风格定义画面美学"a city""film noir shot on 35mm, cinematic lighting"
3光照控制氛围和情绪"bright""warm golden hour light, casting long shadows across the floor"
4角色描述精确刻画人物"a woman""a woman in her twenties with wavy brown hair, light freckles, wearing a vintage leather jacket"
5场景位置构建环境"a jazz club""a smoky jazz club at night, dimly lit with amber sconces, crowded with patrons in 1940s attire"
6动作描述行为"he talks""he gestures dramatically toward the churning sea, pipe clenched between his teeth"
7对白/音频指定台词和声音"they discuss something""he says: 'The ocean commands your awe'" + Audio: rhythmic waves, distant gull calls

核心原则:细节即控制。 每省略一个要素,Veo 3 的 AI 就需要去"猜测"你的意图。猜测的结果往往不可控。

Rule of Thumb:要素数量决定输出下限,结构差异决定输出上限。覆盖 5 个以上要素能让输出基本稳定,而真正拉开差距的是"镜头类型 + 视觉风格 + 光照"这三项的组合方式。这三项每调整一个,画面风格就会发生本质变化。

初级 vs 高级提示词对比

同一个创意,两个版本的输出质量差异可以非常大。

初级版(仅覆盖 2-3 个要素):

A cat walks on a street at night.

只覆盖了角色(cat)、动作(walks)和场景(street at night)。结果大概率是随机的——猫的品种、毛色、走路姿态、街道风格、光照全部不可控。

高级版(覆盖全部 7 个要素):

Low-angle tracking shot following an orange tabby cat as it prowls along a rain-slicked Tokyo alleyway at midnight. Neon signs reflect off the wet pavement. Cyberpunk aesthetic, cool blue and magenta lighting. The cat stops, ears pricked, and lets out a low meow. Audio: distant traffic hum, water dripping from a pipe, a single electric guitar note reverberating.

这个版本指定了镜头(low-angle tracking shot)、风格(cyberpunk)、光照(cool blue and magenta)、角色(orange tabby cat)、场景(rain-slicked Tokyo alleyway)、动作(prowls, stops, ears pricked)和对白/音频(meow + audio cues)。输出质量的差距是本质性的。

Veo 3 与 Veo 3.1 的提示词差异

Veo 3.1 相比 Veo 3 最大的升级是原生音频生成。这对提示词写法有直接影响:

维度Veo 3Veo 3.1
音频描述可选,不会生成匹配音频必须包含 Audio 段落才能获得完整的音视频输出
角色一致性依赖文字描述支持参考图(Ingredients to Video),文字可简化
场景延伸不支持跨镜头延续支持 last frame reference,连续场景更连贯
理想长度30-80 词50-120 词(需分配空间给音频)

掌握了七要素框架和版本差异后,接下来进入实操环节——如何把这些要素组合成可直接使用的提示词。

第二部分:提示词公式、模板与写作自查

黄金公式:7-Point Framework

基于七要素框架,我整理了一个可直接套用的提示词公式:

[镜头与运动] + [视觉风格] + [光照] + [角色描述] + [场景位置] + [动作] + [对白/音频]

你不需要每次都填满七项,但建议至少覆盖 5 项以上。对于新手,可以从这个填空模板开始:

[镜头类型/运动] of [角色描述] as they [动作] in [场景位置].
[光照描述] [视觉风格].
Audio: [环境音/音效/音乐描述].

实战模板示例:

Close-up, slow-motion shot of a grizzled blacksmith in his 50s with soot-stained hands and a leather apron as he forges a glowing sword in a rustic stone forge. Warm firelight flickers across his face, casting dramatic shadows. Dark medieval fantasy aesthetic. Audio: rhythmic hammer clangs, roaring fire, distant thunder.

常用镜头运动词汇表

Veo 3 对镜头语言的理解非常精准。以下是最常用的镜头控制词:

类型词汇效果
景别close-up, medium shot, wide shot, extreme wide shot控制信息密度和情绪强度
推拉dolly in, push in, pull out, zoom引导注意力聚焦或远离
摇移pan left/right, tilt up/down展现空间关系和环境全貌
跟拍tracking shot, follow shot, handheld增强代入感和运动感
特殊low-angle, bird's-eye view, POV, shaky cam制造特定视觉效果

实用技巧: 组合两个镜头运动词可以产生更丰富的效果。例如 "camera slowly pushes in while panning right to reveal" 比单一运动指令更流畅。

Veo 3.1 提示词专项优化

Veo 3.1 的提示词需要在三个方面新增音频描述:

  1. 环境音(Ambient):场景的背景声音,如 traffic hum, wind through trees, distant church bells
  2. 音效(SFX):动作产生的具体声音,如 footsteps on gravel, door creaking, sword clashing
  3. 音乐(Music):气氛音乐的风格和情绪,如 mellow hip-hop beat, tense orchestral strings, light jazz

Veo 3.1 专用提示词示例:

Medium shot of a street musician playing a worn acoustic guitar on a bustling Brooklyn sidewalk at golden hour. Warm sunlight filters through autumn leaves. Indie film aesthetic, slightly desaturated colors. The musician closes his eyes, lost in the melody. Audio: gentle fingerpicking guitar, distant city bus rumble, leaves rustling in the wind, a child laughing briefly in the background.

这里的关键是同步——音频描述要与画面中的具体动作对齐,而非笼统地写 "nice background music"。Veo 3.1 的音频生成逻辑是场景驱动的,你要告诉它什么动作发出什么声音。

Best Prompt Formula for Veo 3.1:三步法

针对 Veo 3.1,我推荐一个专门优化的三步公式:

第一步:定镜头(占提示词 20%) 写清楚镜头类型和运动方式。这是画面质量的基石。

第二步:建场景(占提示词 50%) 覆盖角色、位置、风格、光照、动作。这是画面的内容主体。

第三步:配声音(占提示词 30%) 写出三层音频结构——环境音层 + 动作音效层 + 音乐层。这是 Veo 3.1 区别于其他模型的差异化能力。

这比七要素框架更适合 Veo 3.1,因为它在结构上保证了音频描述不被忽略。

Rule of Thumb:Veo 3.1 的提示词中,场景描述(角色 + 位置 + 动作)占 50% 不是偶然——这是模型理解"要生成什么"的最关键输入。如果输出不稳定,优先检查场景部分是否写清楚了"谁在哪里做什么",而非调整镜头或音频描述。

写作自查清单

写完提示词后,用这五条依次检查:

  1. 要素覆盖率检查:提示词覆盖了几个要素?少于 4 个需要补细节。
  2. 镜头指定检查:是否写明了镜头类型或运动?如果没有,Veo 3 随机选择镜头,结果不稳定。
  3. 风格限定检查:是否有具体视觉风格词(cinematic, documentary, anime, stop-motion)?这是区分专业和业余提示词的关键信号。
  4. 可验证性检查:你的描述具体到可以画出来吗?避免使用 "beautiful" "nice" "interesting" 这类空洞词。
  5. 音频段落检查(Veo 3.1 专用):是否包含 Audio: 描述?如果不包含,你正在浪费 Veo 3.1 的核心能力。

写完提示词并通过自查只是第一步。真正高效的 Veo 3 用户会通过系统化的迭代持续提升输出质量——用数据而非感觉来判断下一步应该怎么改。

第三部分:后续迭代——持续优化你的提示词

用数据驱动改进

真正高效的 Veo 3 用户会建立自己的提示词库,记录每次实验的参数和效果。

建议用表格记录每次实验:

字段内容
原始提示词完整文本
覆盖要素数1-7
镜头类型close-up / medium / wide / etc
Veo 版本3 或 3.1
输出质量评分1-5
主要缺陷如:主体变形/风格不对/音频不匹配
改进方向下次准备调整什么

四种常见失败模式

模式一:画面太平淡

  • 原因:缺少镜头运动和光照描述
  • 修正:加上 "camera slowly pushes in" 或 "low-angle shot",以及具体的光照方向如 "backlit with rim light"

模式二:风格不对

  • 原因:没有指定视觉风格,AI 默认走写实路线
  • 修正:明确写 "film noir aesthetic" "Studio Ghibli inspired" "documentary style" "stop-motion animation"

模式三:角色不像预想

  • 原因:角色描述太笼统
  • 修正:按 "年龄+发型+肤色+服装+表情+姿态" 的公式描述,例如 "a woman in her 30s with short platinum blonde hair, pale skin, wearing a red trench coat, standing with arms crossed, looking impatient"

模式四:音频不同步(Veo 3.1)

  • 原因:音频描述太简略或不匹配动作
  • 修正:音频描述要同步到具体动作,写 "each footstep on gravel makes a distinct crunching sound" 而非泛泛的 "outdoor sounds"

什么时候该重写,什么时候该迭代?

一个经验法则:如果一个提示词改了三版还是不理想,不要继续微调措辞,而是换个方向重新写。 在 Veo 3 中,提示词的结构差异(比如把 close-up 换成 wide shot,或把 cinematic 换成 documentary)对结果的影响远比措辞微调大。改变结构比润色文字更有效。


FAQ:Veo 3 Prompts 常见问题

Veo 3 提示词有最大长度限制吗?

实际使用中 Veo 3 能处理较长文本。DeepMind 官方示例中有超过 100 词的复杂提示。建议将长度控制在 50-120 词之间,过长可能稀释核心指令的效果。

可以用中文写 Veo 3 提示词吗?

可以,Veo 3 有多语言理解能力。但建议使用英文写提示词,因为镜头语言、风格术语、美学描述大多是英语生态。如果英文不够熟练,可以用 Gemini 帮你翻译和润色后再输入。

Veo 3 和 Veo 3.1 的提示词写法主要区别在哪里?

核心区别在于音频。Veo 3 的提示词可以不提声音,但 Veo 3.1 的最佳实践是始终包含 Audio 段落。此外 Veo 3.1 支持参考图,所以角色和场景的文字描述可以适当简化,把更多空间留给音频指令。

有没有好用的 Veo 3 prompt generator 工具?

目前市场上有一些第三方网站声称提供 Veo 3 提示词生成功能(如 veo3flow.ai、veo3.im),但 DeepMind 官方没有发布专门的 prompt generator。最可靠的方式是使用 Gemini 帮助你扩写和润色提示词——让 Gemini 根据你的核心创意自动补充镜头、风格、光照和音频细节,效果比第三方工具更稳定。

如何写出带多段运动的复杂提示词?

对于复杂动作场景,可以用时间标记分段描述。参考 DeepMind 官方示例,在提示词中用时间序列分割不同动作,例如 "In the first 3 seconds... then..."。这比一次性描述全部动作更容易得到连贯结果。

为什么我的 Veo 3 视频角色在不同镜头里看起来不一样?

如果没有使用参考图(Ingredients to Video),Veo 3 在不同镜头间保持角色一致性的能力有限。Veo 3.1 通过参考图大幅改善了这个问题。如果无法使用参考图,建议在提示词中极度详细地描述角色的关键特征(发型、肤色、服装颜色、面部特征),并在每个镜头的提示词中重复相同的描述。

如何快速判断一条提示词是否合格?

一个简单的自测方法:把提示词读给一个不懂 AI 的人听,看他能否在 30 秒内大致复述出你想要的画面。如果他能,Veo 3 通常也能理解;如果他需要追问细节,说明你的提示词还需要补充关键要素。


总结:从框架到习惯

写好 Veo 3 提示词不是天赋,而是可以系统训练的技能。核心在于记住七要素框架——镜头与运动、视觉风格、光照、角色描述、场景位置、动作、对白/音频——并在每次写提示词时对照自查。

对于 Veo 3.1 用户,额外记住三点:永远包含音频描述、善用参考图、利用镜头延伸保持跨场景一致性。

下一步行动(3 分钟完成):

  1. 打开 Google AI Studio(aistudio.google.com),选择 Veo 3 或 Veo 3.1 模型
  2. 用本文的"黄金公式"写一条至少覆盖 5 个要素的提示词——从"定镜头"开始,依次补全角色、场景、动作和音频
  3. 生成视频后,对照自查清单的五条标准做一次诊断,找出最需要加强的要素

一轮实验之后,你的提示词水平就会有明显提升。把每次生成的 prompt 和效果记录在七要素表格中,一周后你就会拥有一个属于自己的高质量提示词库。

订阅简报

加入我们的社区

订阅我们的简报,获取最新动态与资讯