GEMINI OMNI PROMPTS

实用指南

Gemini Omni 提示词怎么写

一份实用指南:哪些写法管用,哪些会出问题,哪些最好别碰。内容依据 DeepMind 官方提示词指南,以及 PixVerse、Atlas Cloud、Chrome Unboxed 的社区实测和 Medium 上的 《Gemini Omni 提示词实战手册》。

近 30 天有哪些变化

按日期列出发布以来的每一项重要变化,有新情况就会更新。

来源等级:🟢 Google / DeepMind 官方 · 🟡 可信的上手实测 / 新闻报道 · 🔴 未经证实

谁能用 Gemini Omni Flash,要花多少钱

订阅档位(I/O 2026 调整后)

档位月费Omni 相关权益
Google AI Plus$7.99可在 Gemini 应用和 Google Flow 中使用 Omni Flash
Google AI Pro$19.99配额更高;单次提示词有上限(5 月 28 日更新后)
新 Ultra(创作者档)$99.99用量为 Pro 的 5 倍,20TB 存储空间,附赠 YouTube Premium
原有 Ultra$200(原价 $250)用量为 Pro 的 20 倍,12,500 AI 积分,含 Project Genie / Mariner
免费途径$0YouTube Shorts 和 YouTube Create App(18 岁以上,有一定限制)

来源:Google One AI 订阅博客 🟢

每次生成消耗多少积分(官方尚未公布)

Google 还没有公布 Omni Flash 在 Google Flow 里每次生成要消耗多少积分。截至 2026-05-29,能参考的信息有这些:

实际建议:生成结果不满意时,直接重新生成,别去编辑。编辑更费积分,而且改出来的画面常常和原片看不出区别。

在哪里用

基本公式

大多数好用的 Gemini Omni 提示词都是这个结构:

[Subject] + [Action] + [Setting] + [Camera] + [Lighting] + [Style]

示例:"A red panda chef tossing pizza dough, in a cozy mountain kitchen, low-angle close-up, warm tungsten light, Pixar-style 3D animation"。

这和 Sora、Veo 提示词的底子是一样的,不过 Omni 多了两样大多数模型没有的东西:

开头第一句的写法

第一句就把时长、画幅和类型这三样定下来:

Create a [duration]-second [aspect-ratio] [genre] video in one continuous shot.

原因:Omni 会把 “one continuous shot”(一镜到底)理解为“不切镜头”,也会遵守开头指定的时长和画幅。这些要求直接写进提示词,比放在元数据里更管用。

Omni 能听懂的镜头术语

根据 DeepMind 的提示词指南,下面这些词 Omni 都能明确识别:

运镜动词

画面风格参考

时长怎么选

用途最佳时长画幅
氛围 / 电影感8–10 秒16:9 或 2.39:1
产品主视觉6–8 秒1:1 或 16:9
Reels / TikTok / Shorts5–7 秒9:16
慢动作冲击镜头5–6 秒1:1 或 16:9
延时摄影10 秒(上限)16:9
Avatar 口播10 秒(上限)16:9 或 9:16

Gemini Omni Flash 硬性上限:单个片段最长 10 秒。来源:TechCrunch 发布报道。

用 “Keep X identical” 锁住不变的部分

使用对话式编辑(Omni 的招牌功能)时,每一轮追加指令都要明确列出哪些东西保持不变。写法:

[Change instruction]. Keep [X, Y, Z] exactly the same.

不加这句锁定,你只想改一个元素,Omni 却可能把整个场景的风格都换掉——对话式编辑最要紧的一致性也就没了。(出自 Atlas Cloud 的上手实测)

触发句式(做特效用)

这是 Omni 最拿手的写法之一,Google 自家那几段刷屏的演示(镜面手臂变形、气泡雕塑、折纸船)用的都是它:

[Base scene]. When [specific trigger action], [specific transformation]. Keep [list] identical.

示例:"A woman reaches toward a mirror. When her fingertips touch the glass, make the mirror ripple like liquid and her arm turn to reflective mirror material. Keep the parlor and lighting identical."

“提示词被拦了”:先分清是哪个故障

发布以来,大家嘴里的“Gemini Omni 拦了我的提示词”,其实说的是两个完全不同的故障。把两者混为一谈,是眼下社区里最常见的误会。

故障 A:政策误判(截至 2026-05-29 仍未解决)

Omni 会拒绝明显无害的提示词(例如 “Cat walks between rabbits” 和 “Change the background to night”),只给出“无法生成该视频”或“违反政策”之类的笼统提示,声称触犯了其实并不存在的规则。从 2026-05-19 起就有大量反馈。Google 副总裁 Josh Woodward 公开承认了这个问题,表示 Google 正在调查,并在收集受影响的案例。截至目前,仍未宣布修复;用户还在 Google AI 开发者论坛 🟡 上贴出新的案例。想弄清哪些是真正的政策限制、哪些是这个故障,请看我们的故障 A 详解。

故障 B:配额计数错误(2026-05-28 已修复)

这个和政策误判无关,是个计费故障:生成失败的请求(包括因故障 A 而失败的)照样会扣配额。2026-05-28,Woodward 宣布:

来源:9to5Google 🟡

怎么判断遇到的是哪一个

已知局限(得实话实说)

DeepMind 自己的模型卡就把下面这些明确列为 “已知局限” 🟢——所以碰到时,不是提示词没写好,而是到了模型能力的边界。

文字渲染

画面里的任何文字——标签、招牌、字幕、品牌标志——都会失真。提示词里别要求叠加文字。PixVerse 的上手实测证实了这一点。

手部动作

手里拿着东西、打手语、打字——这类手部精细动作容易走样。能不拍到手就尽量构图避开,拍到的话就得接受一些瑕疵。

多镜头角色一致性

根据 Atlas Cloud 的多轮编辑评测,在 4 个以上镜头中,Omni 的角色一致性只有 3/5 分。搭配参考图使用 @character_name 效果最好,但第 4 个镜头之后的走样只能接受。

复杂动作

根据 digit.in 的测试,复杂动作(跳舞、体操、演奏乐器)比静态镜头更容易出现 AI 瑕疵。简单动作(走路、站立、说话)效果最好。

提示词超过 50 个英文单词

根据 Seaart 的分析,超过约 50 个单词的提示词会分散重点、拉低生成质量。要写得具体,但要简洁。

这些别做

Avatar 功能的硬性规定

来源:Google Gemini Avatar 帮助页面。

参考来源


最后更新:2026-05-29。Google 每次有变动,我们都会重新核实每一条说法并更新本页。发现错误或过时的内容?告诉我们——每封邮件我们都会看。