如何用 Gemini Omni 生成水果视频(实测对比)
用 Gemini Omni 直接生成水果视频,还是用 AI Fruit 的 Wan 2.5/Seedance/Hailuo 模板?实测对比工作流、成本与 TikTok 适配。

最后更新:2026 年 5 月 20 日
Gemini Omni 在 5 月 18 日发布次日冲上 Hacker News #27,主打实时多模态世界模型——一个模型同时处理视觉、音频、语言。创作者第一时间问的是:它能做那种水果吃水果的 TikTok 短视频吗?
简短回答——能生成,但没有为水果视频准备的工作流。Baby Fruit、Fruit Drama、Fruit ASMR 这些 TikTok 趋势,通用模型给的是原始能力,垂直 SaaS 给的是即开即用的模板。
我们对比了两条路径——Gemini Omni 直接 prompt vs 用 AI Fruit 的垂直模板——结果挺直接:通用模型创作空间更大,垂直工具每条视频省下的时间更多。

Gemini Omni 是什么?
Gemini Omni 是 Google DeepMind 推出的首个实时多模态"世界模型"——单一模型同时处理视觉、音频、语言三种模态,输出也跨这三个通道。根据 deepmind.google 官方页面,它面向 agentic 和交互场景:语音 avatar、实时辅导、生成式游戏环境、短视频片段。
创作者关心的关键事实:
- 实时生成,约 24fps 输出,分辨率 480p–720p
- 原生音频(可哼唱、旁白、生成音效)
- 上下文窗口能持续约 10 秒视频状态
- 通过 Google AI Studio 和 Vertex AI 访问
- 预览期免费,正式发布后约 $0.05/秒
同一天 Product Hunt #14 是 Odyssey 的 Starchild-1(另一个实时多模态世界模型),让"实时多模态世界模型"成为本周 AI 媒体生成赛道最热的关键词。
Gemini Omni 能直接生成水果视频吗?
能,但很费劲。Gemini Omni 可以渲染西瓜咬草莓、桃子讲段子、菠萝旁白。它没有的是模板库、一键 ASMR 音频床、TikTok 节奏的 9:16 竖屏输出。
模型是个原始引擎。水果内容作为 TikTok 格式本质是工作流——模板、预设、音频库、比例处理。Gemini Omni 设计上就没有这些。
我们用 Gemini Omni 和 AI Fruit 平行测试了四种常见水果视频格式:
| 格式 | Gemini Omni(原始模型) | AI Fruit(垂直 SaaS) |
|---|---|---|
| 水果吃水果(ASMR) | 长 prompt 能出,音频不稳 | 一键模板,ASMR 音频自带 |
| Baby Fruit(萌系角色) | 视觉强,需要大量指令 | 预设角色库,~30 秒出图 |
| Fruit Drama(故事场景) | Omni 最契合的方向 | 故事模板带节拍结构 |
| 静态水果插画 | 大材小用 | Hailuo 模型更快 |
规律很清楚:Omni 赢在创作空间和叙事深度。AI Fruit 赢在迭代速度和趋势格式的稳定输出。

为什么要把通用模型和垂直工具放一起对比?
大多数 AI 水果视频教程默认你用一个工具做完所有内容。Gemini Omni 这种自带原生音频、实时推理的模型一出,这个假设就站不住了。正确的选法是按项目挑工具,不是按工具挑项目。
三个理由:
- 创作天花板 vs 起点。通用模型抬高你能做的上限;垂直工具抬高你随便点一下也不会太差的下限——每条片段从 TikTok-ready 起步。
- 成本结构不一样。Omni 按秒计费,一条 8 秒 × 3 次迭代约 $1.20。垂直 SaaS 订阅在几百条视频里摊薄。
- 趋势格式是工作流,不是模型。Fruit ASMR 不是"一个能做 ASMR 的模型"——它是节奏模板、音频床、9:16 输出、特定质感。模型不自带这些。
步骤指南
Step 1:动手前先锁定格式目标
先想清楚你要做哪种 TikTok 格式。Fruit ASMR、Baby Fruit、Fruit Drama 节奏、音频、角色一致性的要求都不一样。格式决定了哪个工具更适合你。
如果格式已有成熟模板(ASMR、Baby Fruit),垂直 SaaS 更快。如果格式偏实验或叙事重,Gemini Omni 的原始控制力更有用。跳过这一步,你会浪费一小时拿两个工具同时跑一个都不太擅长的 brief。
Step 2:直接试 Gemini Omni(通用路径)
打开 Google AI Studio,选 gemini-omni-preview-0518 模型,用结构化 prompt:
场景:西瓜咬住一颗草莓,眼睛瞪大
风格:可爱 3D 皮克斯感,柔和粉彩光照
音频:清脆 ASMR 咬合声,无背景音乐
时长:8 秒
比例:9:16
好用的地方:
- 详细 prompt 能产出干净的角色动画
- 原生音频,不用第二个工具配音
- 可以在生成中途追加 prompt 继续迭代(如"多一点果汁飞溅")
不好用的地方:
- 9:16 比例不稳定
- 5 秒后角色一致性下降
- 没有模板库,每条都从空白开始
- 单次渲染平均 40-90 秒
做一次性创意实验很爽。做日更内容日历就慢。
Step 3:用 AI Fruit 的垂直工作流(更快路径)
如果你在用 AI Fruit,从模板库挑格式——Fruit Eating Fruit、Baby Fruit、Fruit Drama——再选底层模型:
- Wan 2.5 / Wan 2.6 — 适合 ASMR 真实感、果汁纹理、特写咬合
- Seedance — 适合角色驱动场景、Baby Fruit、故事节拍
- Hailuo — 适合快速试错、单条成本最低
每个模板都预调过 9:16 竖屏、TikTok 节奏、合适的 ASMR 音频床。Baby Fruit 单次渲染约 30 秒,模板库 50+ 套即开即用。
代价是创作天花板。模板想不到的画面你做不出来——但 TikTok 上真正流行的趋势,模板基本都覆盖了。
Step 4:用同一个 brief 对比两边产出
用同一个场景描述跑两边,对比这五项:画面保真度、音质、竖屏构图、角色一致性、总耗时。我们用"西瓜吃草莓,ASMR 风格,8 秒,9:16"做过测试:
| 指标 | Gemini Omni | AI Fruit(Wan 2.5) |
|---|---|---|
| Prompt 到可用片段时间 | ~6 分钟(3 次迭代) | ~45 秒(1 次渲染) |
| 音质 | 多次尝试不稳定 | ASMR 音床稳定 |
| 9:16 构图 | 时灵时不灵 | 原生支持 |
| 8 秒时角色一致性 | 明显掉 | 全片段稳定 |
| 创作空间 | 高 | 受模板边界限制 |
创作空间的差距是真的,出片时间的差距也是真的。两个数字都重要——看哪一项对你工作流伤害更大。
Step 5:按项目选工具,不是按工具选项目
别再固定用一个工具硬塞所有视频。Gemini Omni 适合一次性概念、Omni 能即兴发挥的叙事场景、趋势之外的实验。AI Fruit 适合日历产能——模板和模型选择器替你省下每条都要 prompt 工程的时间。
活跃创作者的合理配比:80% 用垂直工具跑日更 TikTok 流水线,20% 用通用模型做实验性概念——这些实验也许就是下个月的新模板。

Pro Tips
- 格式锁模型。ASMR → Wan 2.5/2.6,角色动画 → Seedance,快速试错 → Hailuo。模型选择器存在就是因为没有一个模型最擅长所有事。
- 优先决定音频。Gemini Omni 原生出音频;AI Fruit 模板自带音频。如果后期反正要重新配音,原生音频这条优势就浪费了。
- 先用 4 秒测。两个工具超过 8 秒后角色一致性都会掉。趋势视频本来短的就好——TikTok 上表现也更好。
- 存好你最好的 prompt。用 Gemini Omni 时,自己建个 prompt 模板库,复用上次出片好的版本,能补上一部分工作流缺口。
- 关注成本结构。Omni 免费预览期快结束。$0.05/秒,一次 8 秒迭代就是 $0.40。一个月超过 ~20 条片段后,垂直 SaaS 订阅在每条成片成本上通常更划算。
FAQ
Gemini Omni 能直接生成水果视频吗?
可以,通过详细 prompt 就能生成。它能处理可爱 3D 动画、ASMR 特写、叙事场景,但相比有模板的工作流,要花更多时间写 prompt 和迭代。平均每条可用片段要 5-10 分钟,垂直模板路径平均 30-60 秒。
Gemini Omni 比垂直水果视频工具好用吗?
看目标。Gemini Omni 创作空间更大、自带原生音频;但像 AI Fruit 这类垂直工具针对 Baby Fruit、Fruit ASMR 这种趋势格式,出片更快更稳。一次性实验用 Omni,日常产能用垂直工具。
Gemini Omni 和 Odyssey 的 Starchild-1 有什么区别?
同周发布的两个实时多模态世界模型(2026 年 5 月 18 日)。Gemini Omni 偏向生成式媒体和助手交互;Starchild-1 偏向交互式仿真和游戏环境。两个都没有水果视频专属模板库。
做水果 ASMR 视频用哪个 AI 模型最好?
实测下来,Wan 2.5 或 2.6 是 ASMR 最稳的选择——果肉纹理、特写咬合、自然光线表现都强。两个模型都能在 AI Fruit 的模板里直接选。
Gemini Omni 生成一条水果视频要多久?
模型本身渲染一条 8 秒片段需要 40-90 秒。算上 prompt 调整迭代到可用为止,平均每条要 5-10 分钟——垂直模板路径只要 30-60 秒,因为构图、节奏、音频都已经预调。
总结
Gemini Omni 是多模态生成的一次真实进步——实时、音频原生、agentic。但用到水果内容上,这些能力没有配套工作流。如果你要日更内容日历,垂直工具自带的模板、模型选择器、稳定音频,比通用模型的原始能力省下更多时间。
按项目选工具:一次性创意实验交给 Omni,日常产能交给垂直 SaaS。
准备好做第一条 AI 水果视频了?免费试用 AI Fruit → ——50+ 模板,Wan 2.5/Seedance/Hailuo 模型选择器,默认 9:16 竖屏。