Gemini Omni 1.1 Flash 视频控制怎么用:场景扩展、首尾帧过渡、4K 输出
Gemini Omni 1.1 Flash 新控制能力拆解:场景如何从 10 秒延到 40 秒、首尾帧无缝过渡、360p 草稿到 4K 成片的省钱流程,以及短视频创作者必须知道的限制与提示词写法。

Google 在 2026 年 8 月 27 日发布的 Gemini Omni 1.1 Flash 更新,把 Omni Flash 视频模型从"生成一段片段"推向了更接近"导播工具"的位置。其中三项新控制能力与短视频创作直接相关:场景扩展,让一条 10 秒的片子以 10 秒为步长最长延到 40 秒;首尾帧插值,在两张关键帧之间生成连贯的一镜到底,替代生硬的跳剪;以及 4K 输出,让成片清晰度达到制作标准——中间那些注定要废掉的尝试,交给便宜的 360p 草稿。
这篇指南按照短视频创作者的真实使用方式拆解每一项控制:它能做什么、提示词怎么写、有哪些不提前规划就会踩的坑。先说清楚一件事:这批能力主要随 Google 的开发者渠道(Gemini API 和 Google AI Studio)发布,但创作者不写代码也能用。完整的创作与编辑流程通过 Google Flow 面向付费 Google AI 订阅用户开放——不过各端覆盖并不一致(比如 Gemini App 目前只开放场景扩展)。下面的创作流程不需要写代码;文中的提示词写法来自 Google 官方文档,在对应能力开放的入口都适用。
要点速览
- 场景扩展:Omni 1.1 会分析片子的最后 10 秒作为上下文(旧版本只看最后 1 秒),然后按 10 秒一步追加,累计最长 40 秒。
- 首尾帧:给模型一张起始图和一张结束图,它会在两者之间生成一镜到底——首尾用同一张图,就能得到无缝循环。
- 便宜草稿、精致成片:先用 360p 出预览(比 720p 最快快 60%,成本约三分之一),选定后用 1080p 或 4K 重新生成成片。
- 提前绕开限制:扩展只能在片尾追加、上传的输入视频必须不超过 10 秒,欧洲经济区/瑞士/英国的用户目前不能扩展自己上传的视频。
- 竖屏是一等公民:9:16 与 16:9 同为受支持的宽高比,TikTok、Reels、Shorts 的画幅不需要任何变通。
Gemini Omni 1.1 Flash 到底更新了什么
Gemini Omni 1.1 Flash(Google 目录中的型号是 gemini-omni-1.1-flash)是 Google 快速多模态视频模型的最新版本。它默认生成带音轨的视频,接受文本、图片和视频输入,并支持对话式编辑——你描述要改什么,而不用从零重写提示词。
Google 官方文档把 Omni Flash 定位为视频生成的默认选择,场景扩展和末帧控制是它的招牌能力;Veo 3.1 则继续承担原生音频、逐帧控制那一档。对创作者来说,实际结论是:Omni 1.1 是迭代快、带连续性控制的那一档,不是对其他模型的全面替代。
1.1 版本的具体新增:场景扩展的上下文更深(从 1 秒提升到 10 秒)、关键帧插值、360p 草稿、1080p/4K 输出,以及视频参考(最多三段、每段最长 3 秒,模型用它保持人物和风格的相似性——参考视频里的音频会被忽略)。
控制一:把一场戏从 10 秒延到 40 秒

它能做什么。 场景扩展会从片子停下的地方继续往下生成。Omni 1.1 读取最后 10 秒的故事、运动、人物和音频作为上下文——相比旧版只锚定最后 1 秒是大跨越——每一步生成约 3–10 秒的延续内容。你以 10 秒为步长不断追加,直到触到 40 秒的累计上限。注意:模型会重编辑输入结尾的几帧让接缝不可见,所以源片最后几秒要当作"可被调整"的部分来规划。
创作者怎么操作。 在 Gemini App 里,场景扩展对 Google AI Plus、Pro 和 Ultra 订阅用户开放——生成或上传一段片子,让模型继续它。在 Google Flow 里,同样层级的订阅用户可以用 Omni 1.1 的完整创作与编辑流程。如果你走 Gemini API(AI Studio),扩展通过引用上一次生成结果或上传片段(最长 10 秒)加提示词来完成。
提示词写法。 扩展提示词要像导播笔记。Google 官方文档给出的形态是:
Continue the scene. The camera pulls back to reveal the whole
market street. The music continues into the chorus. No dialogue.
官方文档里有两条规则值得记住。第一,把音频写进提示——你不说"音乐继续"或"对白停止",模型就自己决定。第二,如果你用"3 秒后切到新场景"这类节拍,时钟是从扩展段的开头重新计数的,不是从整条视频的开头。
要注意的坑。 扩展只能在片尾追加——不能在中间插一场戏,也不能加新开头。用作扩展输入的上传视频必须不超过 10 秒;对上传片段的扩展无法新增角色对白(多轮扩展模型自己生成的片段则支持语音)。另外,欧洲经济区、瑞士和英国的用户目前不能扩展上传的视频——扩展模型生成的视频在所有可用地区都可以。
控制二:用首尾帧过渡替代跳剪

它能做什么。 给模型起始帧和结束帧,描述过渡方式,Omni 1.1 就会生成两者之间连贯的一镜。Google 发布公告里的演示覆盖了甩镜转场、环绕运镜和推拉变焦——正是短视频里通常只能靠硬切或扭曲特效糊弄过去的那几招。
提示词写法。 在暴露媒体角色的工具里,用标记指明哪张图是哪个关键帧:
<FIRST_FRAME> <LAST_FRAME>
A fast whip-pan transition as the camera swings from the kitchen
to the rooftop party. One continuous shot, no jump cuts.
官方文档还记录了一个值得抄走的循环技巧:首帧和尾帧提交同一张图,模型生成的片段结尾就回到了开头——干净的循环素材,适合背景视觉、直播垫片,或那种让人舒适的回旋效果。
它在创作者工作流里的位置。 首尾帧过渡解决的是"AI 片段 A 硬接 AI 片段 B"的问题。先用任意图像工具(Nano Banana 就行)把钩子时刻和回报时刻各生成一张静帧,再让 1.1 Flash 把两者之间的旅程动画化。成片看起来是一个完整的镜头语言,而不是两段别针别起来的素材。
控制三:360p 出草稿,4K 交成片
Omni 1.1 的分辨率档位是 360p → 720p(默认)→ 1080p → 4K,聪明的做法是两端都用。先用 360p 打草稿:Google 公告称 360p 预览比 720p 最快快 60%、成本约三分之一——这意味着你可以测四个版本的镜头,而不是盲押一个。草稿的运动和构图过关后,把胜出者用 1080p 或 4K 重新生成为成片。
对按 API 付费的开发者,Google 定价页给出的是:标准价格下 720p 视频约每秒 0.10 美元(按每百万视频输出 token 17.50 美元、每秒视频 5,792 token 计)。一条 40 秒的扩展成片每次完整迭代要花几美元——草稿阶段这是真实成本,这正是 360p 草稿通道存在的理由。在 Flow 或 Gemini App 里创作的用户消耗的是订阅计划的额度,可用内容因套餐档位和地区而异。
一个面向专业交付的提示:每条生成视频都带不可见的 SynthID 水印——观众看不见,但可以被程序检测。如果客户工作需要披露 AI 来源,这个水印站在你这边;无论如何,知道它存在。
三项控制通用的提示词模式
来自 Google 提示指南的这几条规则,无论生成、扩展还是过渡都适用:
- 要一个镜头就明说。 默认情况下模型会尝试编排多镜头叙事。"in a single uninterrupted scene""one continuous shot""no scene cuts"这类短语能把它按住,只拍一条。
- 显式指挥音频。"Contains calm background music""high-energy electronic beat",或者干脆"no dialogue"——模型默认生成音轨,不描述就是赌。
- 时间节拍少用、用对。 自然语言("after 3 seconds, a woman enters")和时间码语法(
[0-3s] walking, [3-6s] she turns)都有效。记住扩展时钟规则:零秒是扩展段的开头。 - 在提示词里内联排除项。 没有独立的负面提示词字段——把否定写进提示词:"no dialogue, no extra sound effects, no text overlays"。
- 画面文字逐字写明。 只要你定义了确切文字,模型能把字渲染清楚——字幕、招牌梗、场景内的产品标签都用得上。
动手之前要先知道的限制
| 限制 | 对你的实际影响 |
|---|---|
| 宽高比:16:9、9:16 | 竖屏短视频原生支持;不支持 1:1 方形。 |
| 扩展累计上限 40 秒 | 从基础片段以 10 秒为步长追加;每步新增约 3–10 秒内容。 |
| 扩展只能在片尾追加 | 不能中间插戏、不能加新开头——故事结构只能向前生长。 |
| 上传输入 ≤ 10 秒 | 更长的上传要先剪短再扩展(多轮扩展模型生成的片段除外)。 |
| 上传片段的扩展不能新增对白 | 只能静默延续,除非片段链从模型生成开始。 |
| 欧洲经济区 / 瑞士 / 英国 | 不能扩展上传的视频;扩展模型生成的视频不受影响。 |
| 英语优先 | 英语完整支持;其他语言可用但官方未做评估。 |
| 安全过滤 + SynthID | 提示与成片经过分地区安全过滤;所有输出带不可见来源水印。 |
每项控制在哪里能用

Google Flow 的模型阵容包含用于视频创作与编辑的 Gemini Omni。来源:labs.google/fx/tools/flow,访问于 2026 年 8 月 30 日。
| 入口 | 你能得到什么 | 谁可以用 |
|---|---|---|
| Google Flow | 完整的 Omni 1.1 创作与编辑流程,这些控制能力的创作者主入口 | Google AI Plus / Pro / Ultra 订阅用户;功能因套餐、平台和地区而异 |
| Gemini App | 对 Gemini 内创作视频的场景扩展 | Google AI Plus / Pro / Ultra 订阅用户 |
| Google AI Studio / Gemini API | 全部控制能力,包括 4K 输出和视频参考 | 付费档开发者(已正式发布,无免费档) |
Google 点名的 Adobe Firefly、Figma Weave、GMI Cloud 和 Runway 已经把 Omni Flash 跑在生产环境里——这说明即使你永远不碰 API,模型层也正在快速进入主流创作工具。
这对短视频创作者意味着什么
10 秒天花板是过去把 AI 片段锁在"段子"体量里的结构性限制:讲一个梗够长,讲一个故事不够。40 秒的跑道加上感知上下文的扩展,意味着一条生成链可以撑起铺垫、转折和回报。首尾帧插值则处理另一个破绽——片段之间的跳剪——用生成连接镜头的方式替代剪辑遮掩。而 360p 草稿 → 4K 成片的循环,让迭代便宜下来,成片却不将就。
诚实的提醒:这是一篇基于官方文档的拆解,模型发布才几天,把文中提示词当作起点去改编,而不是保证成功的配方——成片质量因场景而异,生成时长也取决于时长、分辨率和负载。第一次做扩展题材时,给计划里多留一轮迭代时间。
如果你的目标是水果系短视频——西瓜 ASMR、跳舞草莓这一类在 AI 工具手里反复爆火的题材——而且不想逐镜头研究提示词,那正是我们自己的 AI Fruit 视频生成器所在的位置:模板化生成,接入 Veo 3.1、Seedance 2.0 等模型,为水果趋势调校。我们也写过用初代 Gemini Omni 生成水果视频的专门指南,以及一篇 Gemini Omni 与 AI Fruit 的正面对比,帮你判断通用模型和专用工具哪个更适合你。