HeyGen Video 1:技术、输入模态与定价——短视频创作者决策指南
HeyGen Video 1 是什么、三种输入模式、文档规格、按秒定价,以及给短视频创作者的引入-试用-跳过决策清单。

2026 年 9 月 30 日发布的 HeyGen Video 1,是 HeyGen 第一个通用型 AI 视频模型:它一次调用就能生成完整场景——主体、环境、光线,外加一条同步的音频轨——底层基于 MiniMax 的 H3 模型,再由 HeyGen 做后期训练(post-training)。它接受文本提示词、首帧图片,或多达十二个图像/视频/音频引用,输出按渲染秒数计价,叠加发布折扣后每秒最低 $0.01。这篇指南把官方文档里的事实汇总在一起,并落成一个「引入、试用还是跳过」的决策框架,写给短视频创作者。
要点速览
- HeyGen Video 1(模型 ID
heygen-video-1)是场景生成器,不是数字人产品——与 HeyGen 的 Avatar 系列不同,没有口播头像、脚本或口型同步环节。 - 一个模型,三种输入模式:文生视频、图生视频(你的图成为首帧)、引用生视频(最多 9 张图、3 段视频、3 段音频——共十二个引用,提示词可直接点名引用)。
- 单条片段 5–15 秒,480p 或 768p,六种画幅从 21:9 到 9:16,输出 MP4(H.264)、24 fps,自带生成的 AAC 立体声音轨。
- OpenRouter 标价:文生/图生视频按发布五折每秒 $0.01–$0.015(标准价 $0.02–$0.03),引用生视频每秒 $0.02–$0.03;图像和音频引用输入免费。
- 文档明确的优势场景:短而收束的镜头——单一主体、单一场景、单一动作、机位固定。明确的短板:长字幕文字、柔软有机运动、手部特写操作。
- 一条 10 秒 768p 文生视频,按当前折扣价约 $0.15(标准价 $0.30),试用成本低到可以忽略——真正的决策点在于 768p 和 15 秒上限是否适配你的工作流。
HeyGen Video 1 到底是什么
Video 1 是 HeyGen 全新产品线的第一条产品,和这家公司成名的数字人业务是两回事。HeyGen 官方文档对它的描述是「基于 MiniMax H3 构建并由 HeyGen 后期训练的通用视频模型」:给一段提示词,它一次生成整个场景——主体、环境、光线和声音。每条片段自带由同一提示词联合生成的音频轨(对白、环境声、音效),没有单独的语音环节,没有口型同步,也不需要挑头像。

来源:HeyGen 官方 Video 1 文档(developers.heygen.com),访问于 2026 年 10 月 1 日。
最后这一点比听上去更重要。HeyGen 靠 Avatar IV 和 Video Agent 建立了口碑——它们是用你已经写好的脚本去驱动你已有的形象。OpenRouter 的模型页把区别说得很直白:「它不是数字人产品……没有口播头像、脚本或口型同步环节;提示词和引用驱动整个场景。」如果你多年前用过 HeyGen,把它归档为「企业口播视频」,那 Video 1 是一个不同的工具——它真正对标的,是 Sora、Veo、Kling、Seedance 这些通用视频模型。
底层模型:MiniMax H3 提供了什么
在底层,Video 1 从 MiniMax H3 出发——这是 MiniMax 于 2026 年 7 月 31 日发布的开源通用视频模型,几天后开放了权重。按 MiniMax 官方公告,H3 能统一处理文本、图像、视频、音频的上下文,生成带原生立体声的视频;其技术栈包括官方命名的 Contextual Omni Representation、H3-VAE、H3-Omni Transformer 和 In-Context Regeneration。MiniMax 对 H3 的能力定位是:指令遵循、准确的文字与品牌渲染、视频到视频的动作迁移。
有一个文档层面的差异值得在选择前弄清楚。H3 本体可以生成最长 15 秒、2K 分辨率的视频,而 Video 1 的 API 输出上限是 768p(时长同为 5–15 秒)。HeyGen 尚未发布文档说明其后期训练对分辨率或画质做了什么,所以请把基础模型的规格表和 Video 1 的规格表当作两个独立的事实来看待;实际结论是:Video 1 目前最高 768p。
三种输入模式,一个模型 ID
Video 1 只有一个模型 ID,通过请求参数选择三种生成模式:
| 模式 | 你提供 | 你得到 |
|---|---|---|
文生视频(text_to_video) |
一段提示词 | 全新场景及其生成音效 |
图生视频(image_to_video) |
提示词 + 一张图 | 以你的图为首帧的片段 |
引用生视频(reference_to_video) |
提示词 + 图像/视频/音频引用 | 保留你提供的商品、人物或场景的新片段 |
两个设计细节让引用模式比笼统的「上传素材」好用得多。第一,列表顺序就是可点名的标签:第一张图是 <Picture 1>,第一段视频是 <Video 1>,第一段音频是 <Audio 1>,提示词里直接引用这些标签——你可以写出「Picture 2 里的人物开口唱歌,人声对齐 Audio 3」这样的指令。第二,模型最多接受九张图、三段视频、三段音频(共十二个引用),每个引用可以是 HTTPS URL(图片 16 MB、视频/音频 32 MB)、上传后的 asset ID,或内联 base64(图片 5 MB、视频/音频 16 MB)。

图生视频沿用首帧的宽高比,忽略画幅参数——这对直接动效化你手头的设计稿很有用。提示词上限 5,000 个 Unicode 字符,官方指引很直接:「长提示词胜过短提示词。」prompt_enhancement 参数(默认 turbo,可选更彻底的 quality,或 disabled 让文字一字不改地直达模型)控制生成前自动的提示词扩写环节。
HeyGen Video 1 规格速览
| 规格 | 文档值 |
|---|---|
| 模型 ID | heygen-video-1 |
| 时长 | 每条 5–15 秒(整数秒) |
| 分辨率 | 480p 或 768p(默认 768p) |
| 画幅 | 21:9、16:9、4:3、1:1、3:4、9:16——引用生视频另有 adaptive |
| 像素尺寸示例 | 9:16 → 768×1344(768p)/ 480×832(480p);16:9 → 1344×768(768p) |
| 输出格式 | MP4(H.264)、24 fps、AAC 32 kHz 立体声音轨 |
| 种子控制 | 可选 seed(0–4,294,967,295)用于复现同一条;任务会回报实际使用的种子 |
| API 形态 | POST /v3/models/videos 返回 202 + video_id;轮询 GET /v3/models/videos/{video_id};支持 Idempotency-Key;callback_url 一次性 webhook |
| 接入方式 | HeyGen API(付费密钥)或 OpenRouter |
seed 参数值得规划工作流的人注意:同样的提示词加同样的种子,连续提交会返回完全相同的文件,因此你可以锁定一条素材,每次只改提示词里的一处——这是结构化迭代镜头的方法,不用全部重摇。官方说明这种可复现性「在同一个部署内」成立,而非对某次渲染的永久句柄。
每条片段要花多少钱
Video 1 按渲染秒数计价,引用输入免费。OpenRouter 的模型页——两条官方接入路径之一——给出了当前价格:
| 输出类型 | 480p | 768p |
|---|---|---|
| 文生视频 / 图生视频 | 折扣价 $0.01/秒(标准 $0.02/秒) | 折扣价 $0.015/秒(标准 $0.03/秒) |
| 引用生视频 | 标价 $0.02/秒 | 标价 $0.03/秒 |

来源:OpenRouter Video 1 页面(openrouter.ai),访问于 2026 年 10 月 1 日;页面价格为当时的发布折扣价。
按 OpenRouter 发布推文的说法,五折发布折扣持续到十月底,所以如果你的评估期会跨过这个月,请按标准价做预算。算术很简单:一条 10 秒 768p 文生视频,按当前折扣价约 $0.15——标准价 $0.30。同规格十条一批,折扣价约 $1.50,标准价 $3.00。引用生视频在同分辨率下约为折扣文生视频的两倍(10 秒 768p 引用片段标价 $0.30),这是让模型吃进你自己产品图或素材的溢价。
它适合什么,不适合什么
HeyGen 和 OpenRouter 把 Video 1 定位给画框内有运动元素的短商业视频:品牌时刻、产品与设备演示、培训与入职内容。官方文档对模型的形态说得更具体,而且值得把短板和优势一样认真读——以下是 HeyGen 文档的官方描述,不是独立测试结论。
按文档说法,Video 1 最擅长短而收束的镜头:单一主体、单一场景、单一动作、固定或几乎不动的机位。文档列出的优势包括场景连贯性(物体保持大小、形状和位置)、严格按指令执行、画面与声音联合生成从而匹配你所描述的空间,以及引用生视频能保住你提供的物体的身份。它最不可靠的地方是:长屏幕文字、花瓣纸张头发这类柔软有机运动,以及组装或操作设备这类精细手部动作。
对短视频创作者来说,这个能力画像可以直接对号入座:产品 B-roll、品牌场景镜头、带环境声的演示类片段是它的主场;依赖细腻运动、画内文字可读性或精细手部动作的角色叙事,则是文档明示的风险区。
引入、试用还是跳过:决策清单
满足以下多数条件,现在就值得试用:你的片段在 5–15 秒内、768p 及以下够用;你希望画面和声音一次生成;你手上有引用生视频用得上的产品图或品牌素材;通过 seed 复现素材的迭代方式适合你;且你的工作流能接受异步 API(提交、轮询、下载)或 OpenRouter 集成。
以下情况暂时跳过:你需要 1080p 或更高分辨率、超过 15 秒的片段、稳定的画内文字、或精细的手部/有机运动——文档写明的上限和短板今天就把这些排除了。如果你的形式是真人出镜口播,Video 1 也不是该选的 HeyGen 产品——那是 Avatar 线的事。如果你习惯在带模板和积分包的浏览器工具里生成而不是调 API,纯 API 的接入方式会让你天天感到摩擦。
盯住两个会改变决策的变量:十月折扣期结束后的定价,以及 768p 上限是否会松动。两者都是可核验的带日期事实——模型 2026 年 9 月 30 日发布,本指南写于次日,最可能先变的正是它的规格表。
如果你更想在浏览器里直接试短视频创意而不是接 API,AI Fruit 的在线视频生成器支持提示词、图片、模板和可选模型——写作时共有六个厂商的八个模型,包括 Sora 2、Veo 3.1、Kling 3.0、Seedance 2.0——生成前就能看到模型选项和积分消耗。HeyGen Video 1 暂未进入模型列表,但上面的每秒成本算法,同样适用于你在那里试用任何模型前的决策。
最后更新:2026 年 10 月 1 日。规格与定价核对自 HeyGen 官方 Video 1 文档与 API 参考、HeyGen API 更新日志、OpenRouter 的 Video 1 页面,以及 MiniMax 的 H3 官方公告。本指南不含上手测试或独立跑分;厂商能力声明均已注明出处。