返回博客

Grok Imagine Video 1.5 智能体:9 月 5 日上新了什么,以及怎么上手

xAI 的 Grok Imagine Video 1.5 智能体以 Image 2.0 为底座,主打多镜头叙事。本文梳理 6 月以来的变化、API 定价,以及两条立刻能上手的路径。

更新于 AI Fruit 团队
Grok Imagine Video 1.5 智能体:9 月 5 日上新了什么,以及怎么上手

2026 年 9 月 5 日,xAI 宣布 Grok Imagine Video 1.5 智能体正式可用。它运行在 xAI 最新的 Image 2.0 模型之上,按 xAI 的说法带来了更高的画质、更强的叙事能力,以及短视频创作者最关心的一点:多个镜头之间"更强的连贯性"。如果你被 Grok Imagine Video 1.5(6 月)、Video 1.5 参考引用(7 月)、Image 2.0(8 月)这一连串发布搞得有点晕,这篇文章会把 9 月 5 日真正的新东西和之前已有的能力分开讲清楚,并给出两条立刻能上手的路径。

要点速览

  • 9 月 5 日的发布在 Video 1.5 前面加了一层智能体:不用再逐条盯生成任务,xAI 表示这个更聪明的智能体能承接多镜头视频,并保持镜头之间的连贯性。
  • 智能体由 Image 2.0 驱动——这是 xAI 八月发布的图像模型,擅长精准编辑和一致的角色、场景、道具,而它们正是视频镜头的原料。
  • 在 xAI API 上,Video 1.5 价格为每秒 $0.08,支持 480p、720p、1080p,单条片段最长 15 秒,文生视频、图生视频、参考生视频都已支持。
  • AI Fruit 的 AI 视频生成器里可以直接选到同一个 Grok Imagine Video 模型:6–30 秒片段、480p/720p、每秒 3 积分,还有 Story 模式帮你规划多场景短视频。

9 月 5 日到底发布了什么

发布本身是 xAI 官方 @grok 账号的一条帖子:

Grok Imagine Video 1.5 智能体现在可用。它由我们最新的 Image 2.0 模型驱动,带来更高画质、来自更聪明智能体的更强叙事,并且擅长以更强的连贯性把多个镜头连接在一起。

细读这句话,里面其实捆着三个信息。第一,智能体——替你规划和执行视频任务的软件层——成了 Video 1.5 的前台。这不是凭空而来:Video 1.5 在 6 月 16 日正式可用时,xAI 就同步推出了 Projects、可并行的多个智能体和素材库搜索,把 Grok Imagine 从单一生成器变成一个工作台。9 月 5 日是这层智能体正式接管视频生成的节点。

第二,底层模型不再只是 Video 1.5——智能体运行在 Image 2.0 之上,也就是 xAI 最新的图像模型。它为什么对视频重要,下面细说。

第三,核心能力主张是多镜头连贯性:xAI 说智能体"擅长以更强的连贯性把多个镜头连接在一起"。注意这是 xAI 自己的描述,不是独立评测——但措辞本身说明了 xAI 的目标用户:需要一组镜头看起来像一条视频、而不是五段互不相干片段的创作者。

通往智能体之路:6 月到 9 月

这次发布最容易让人犯晕的是版本号。下面是根据 xAI 官方公告和文档整理的时间线:

日期 发布 新增内容
2026-06-16 Video 1.5 正式可用 Video 1.5 进入 API;Video 1.5 Fast 把 6 秒 720p 的生成压到约 25 秒(此前 40 秒以上);音频和语音同一轮生成;Projects 与并行智能体
2026-07-31 Video 1.5 参考引用 文生视频、原生 1080p、单次最多 7 张参考图、让同一张脸和同一个声音贯穿各场景的语音参考
2026-08-07 Imagine Image 2.0 新图像基座:区域编辑、分割、抠背景、单次最多 5 张参考图编辑、清晰小字、一致的角色/场景/道具组
2026-08-28 API 更新 Image 2.0 quality 默认改为 auto;编辑支持 5 张源图;新增 21:9 和 5:2 画幅
2026-09-05 Video 1.5 智能体 架在 Video 1.5 上的智能体界面,由 Image 2.0 驱动,主打多镜头连贯性

规律很清楚:一条流水线在逐件组装——先有更快的视频模型(6 月),再有让角色和声音跨镜头稳定的控制手段(7 月),然后是镜头出发的图像引擎(8 月),最后才是把整条流水线替你跑起来的智能体(9 月)。

Image 2.0 底座对视频意味着什么

xAI 的 Imagine Image 2.0 发布页,介绍魔法棒、分割与背景移除等精准编辑能力

来源:xAI《Imagine Image 2.0》发布公告(x.ai,2026 年 9 月 6 日访问)

用图像模型来宣布视频智能体的升级,乍看有点奇怪。但短视频 AI 视频的一条常见路径就是图生视频:先生成或上传一张静态图,再描述运动,让模型把它动起来。静帧就是镜头本身——所以视频的画质上限,很大程度上由图像模型决定。

xAI 八月发布的 Image 2.0 正是按这条工作流打造的:它生成的画面"能撑住"——信息密集的多元素构图、清晰的小号文字——并且在多轮生成和编辑之间保住你放入的内容。它还带着一排直接服务于视频前期制作的工具:只改选中区域的魔法棒、精确选区的分割、导出透明底的抠图,以及免手动合成的多参考图编辑(单次最多 5 张输入)。xAI 引用第三方 Arena 排行榜(截至 2026 年 8 月 7 日)称 grok-imagine-image-2 在文生图和图像编辑两项都排名世界第二——这是 xAI 转述的数据,本文未独立验证。

xAI 还演示了一套"先建世界"的工作流:一个角色、她的几个场景、随身道具分别生成,却保持同一风格——并明确把这定位成视频的原料。把这些一致的资产作为镜头交给智能体,多镜头连贯性的主张就成了一套系统,而不是一句口号。

多镜头连贯性,说人话版

示意图:同一草莓角色的三个连续镜头衔接成一条多镜头视频

"把多个镜头以更强连贯性连接在一起",就是"一条视频"和"幻灯片"的差距。拿水果实验室小剧场举例:镜头一介绍角色,镜头二切到反应,镜头三落在包袱上。如果每个镜头都各自盲生成,角色的脸、光线、色调会在切换处漂移——观众就直接划走了。

7 月的参考引用系统是 xAI 的第一个答案:每张参考图锁死一样东西——一张脸、一个产品、一个场景——单次生成最多 7 张,再加语音参考让同一个角色在每个场景里都是同一个声音。9 月的智能体主张是:在这套系统之上,规划层现在能自己处理镜头之间的衔接。

在智能体铺开期间,一个实用的规划方法是:先锁定身份资产——角色设定图、关键场景、干净背景上的产品——把每个镜头的动作和机位保持简单。这样无论是智能体还是你自己来组装序列,一致性都由参考图扛住,每条提示词只需描述一个变化。不过连贯性主张终究是 xAI 的:公告只是声称,你用自己的角色花两分钟实测一次,才是对你这个频道真正有效的结论。

现在就能用的路径

两条有据可查的路径,外加一组未知数:

1. Grok 官方应用(智能体模式)。 智能体入口在 grok.com/imagine/agent——Grok 网页版应用里的 Imagine 智能体模式,需要登录。注意 xAI 尚未公布的信息:智能体本身的订阅档位可用性和移动端支持。7 月参考引用功能上线时,图像与语音参考是从美国市场的 SuperGrok Heavy 和 SuperGrok Plus 订阅开始的,之后再逐步放开——预计这次也会是类似的分批节奏,把截止日期押上去之前,先确认你账号的 Imagine 可用功能。

2. xAI API。 对开发者来说,API 里的 Video 1.5 每秒 $0.08,支持 480p、720p、1080p,文生视频、图生视频、参考生视频单条最长 15 秒。请求是异步的——提交、轮询、取回 URL。图像侧每张 $0.04(1K 或 2K),API 还提供视频编辑(用提示词改片段的一部分)、视频延长(从最后一帧续拍)和参考生视频。一个维护提示:如果你在图像 API 上有存量调用,grok-imagine-image-quality 这一档 11 月 2 日退役,之后请求将由 grok-imagine-image-2.0 以 low 质量档接手。

3. 尚未公布的信息。 xAI 的帖子没有给出每日限额、智能体的分档定价或地区可用性。如果你要把它排进生产流程,这些是发布热度降温前该问清楚的问题。

AI Fruit 路径:同一个模型,装进创作者工作流

AI Fruit 视频生成器选中 Grok Imagine Video 模型,显示时长、分辨率、画幅与积分成本

AI Fruit 生成器中的 Grok Imagine Video(2026 年 9 月 6 日截图)

如果你要的主要是 Grok Imagine Video 的产出效果、而不是 Grok 的智能体工作台,AI Fruit 把同一个模型装进了为短视频构建的工作流。在模型选择器里直接选 Grok Imagine Video(xAI):片段 6–30 秒、480p 或 720p、五种画幅(含 9:16 和 16:9)、每秒 3 积分——默认 6 秒片段 18 积分,生成前就能看到成本。模板库覆盖短视频创作者真正在发的品类(水果进食循环、玻璃切割 ASMR、水果宝宝角色),可以从参考图或提示词起步。

和官方入口相比,有两处诚实的差异。AI Fruit 的选择器目前对 Grok Imagine Video 最高只到 720p——1080p 在 xAI 自己的入口里有,这里没有。另外 AI Fruit 的 Story 模式帮你规划和生成多场景序列、跨片段保留角色、上下文和版本,但并不承诺智能体式流水线那样的角色一致性保证。取舍正好和智能体相反:自动化少一些,但对模型、参数、单次生成成本的控制更明确——而且 Veo、Sora、Kling、Wan、Seedance 等其他视频模型就在同一个选择器里,一键切换,某个镜头 Grok 不合适随时换。

结论

9 月 5 日的发布与其说是新模型,不如说是新操作员:Video 1.5 智能体是 xAI 的一次下注——创作者想交代的是一段序列,而不是盯着一格格生成,Image 2.0 供应一致的镜头,7 月的参考系统守住身份。对短视频创作者来说,发布周里合理的动作是小步试:带着你的常驻角色,去 grok.com/imagine/agent 试一个多镜头场景,再把同一段需求丢进 AI Fruit 生成器里的 Grok Imagine Video,对比连贯性、可控性和积分消耗。底下的模型是同一个;哪个入口能留下来走进你的工作流,哪个就是对的。