SANA-WM vs Wan 2.6 vs Hailuo:2026 AI 视频模型实测
2026 年 SANA-WM、Wan 2.6、Hailuo 2.3、Seedance 2.0 横向对比:时长、画质、开源协议、实测水果视频效果一文看清。

一个 2.6B 参数的开源模型,单卡就能生成 1 分钟 720p 视频?这是本月 NVIDIA Labs 发布 SANA-WM 时打出的标题。它当天冲到 Hacker News 第 4,292 票、124 条评论。问题——也是评论区炸开的原因——在于「开源」和「1 分钟视频」并不是大多数读者以为的意思。
我们把 SANA-WM 和三个真正能上生产的闭源模型摆在一起:阿里 Wan 2.6、MiniMax Hailuo 2.3、字节 Seedance 2.0。然后用同样三个水果视频 prompt 各跑一遍——Fruit Drama 长叙事、Fruit Eating ASMR 短循环、Baby Fruit 动画——看在真实负载下谁能撑住。
最后更新:2026-05-17。

目录
- 2026 这四个 AI 视频模型到底是什么
- SANA-WM vs Wan 2.6 vs Hailuo vs Seedance 逐个看
- 核心参数对比表
- 怎么选合适的 AI 视频模型
- 用 Wan 2.6 生成 1 分钟 Fruit Drama 实战
- 常见问题 FAQ
2026 这四个 AI 视频模型到底是什么
SANA-WM 是研究级的开源世界模型,输入一张起始图加一条 6-DoF 相机轨迹,生成 60 秒 720p 视频。Wan 2.6、Hailuo 2.3、Seedance 2.0 是消费级视频模型,以 API 形式提供,输出 10-15 秒、720p 到 1080p 的短片,原生支持音频和角色控制。表面像竞品,本质不是。
世界模型预测镜头穿过场景时画面如何演变——用在自动驾驶仿真、机器人训练数据、长时序一致性研究上。消费级视频模型则是接 prompt 出可看的成片。SANA-WM 训练集是 21.3 万段公开驾驶/漫游视频片段(arXiv 2605.15178);Wan、Hailuo、Seedance 训练数据则针对内容创作者优化。
这个区别很重要,本周冒出来的「SANA-WM vs Sora」对比基本都漏了它。下文会一直把它摆在台面上。
SANA-WM vs Wan 2.6 vs Hailuo vs Seedance 逐个看
SANA-WM(NVIDIA Labs)
SANA-WM 从一张起始图加一条 6-DoF 相机轨迹生成最长 60 秒 720p 视频。标题里的 2.6B 只是 backbone——完整 pipeline 还包含一个独立的 17B 长视频精修模型,画质提升大头来自它。少了精修,输出比 demo 粗糙。
- 架构: 混合 Gated DeltaNet + softmax attention,常数大小循环状态(解决了标准 transformer 在长时长下显存平方级膨胀的问题)。
- 硬件: 完整 pipeline 74.7 GB 显存(H100 级别)。仅 Stage-1 需 51.1 GB。蒸馏后的 NVFP4 量化版在单卡 RTX 5090 上生成 60 秒视频约 34 秒。HN 评论区有人问能否上 RTX 4090,没有官方答复。
- License: 代码 Apache 2.0。权重 CC BY-NC-SA 4.0——只能非商用。 多个写法错误地声称权重也是 Apache 2.0,论文里并没有。商用前去 GitHub 仓库 再核对一次。
- 真实画质: HN 评论指出两个明显问题:镜头回到之前出现过的区域时一致性崩坏;物体形状漂移(「桌上的书每隔几帧形状都不一样」)。我们的 Fruit Drama prompt 里,一颗下落的草莓每帧种子数量都在变。
适合: 相机轨迹场景探索、自动驾驶仿真、机器人数据生成、长时序一致性的学术研究。
不适合: 主角稳定的生产内容、任何叙事向、商业用途(许可挡死)、手头没有 H100 或 5090 的创作者。
来源:arXiv 论文 2605.15178、Hacker News 讨论、MarkTechPost 介绍。
Wan 2.6(阿里)
Wan 2.6 是 2025 年 12 月 16 日发布的 5 模型套件(T2V、I2V、R2V、image、T2I),单次最长 15 秒,支持多镜头叙事和音画同步生成。亮点在 R2V(reference-to-video)——一段参考素材加一段语音,就能让角色在多个镜头间保持一致。
- 分辨率与时长: 720p 确认,1080p 官方未确认。单次最长 15 秒。
- License: 2026 年 5 月时点,Wan 2.6 权重并未确认开源。前代 Wan 2.1 和 Wan 2.2 是 Apache 2.0,在 HuggingFace 可下。今天就要开源权重的话,Wan 2.2(MoE,27B 总参 / 14B 激活)是稳妥选择。
- 访问方式: 阿里云 Model Studio API、Wan.video、通义千问 App。第三方聚合平台标价约 $0.07/秒。
- 相比 2.2 的新东西: 跨镜头角色一致性、音画同步、R2V 模式、多镜头拼接。开源谱系仍偏 Apache 2.0;2.6 权重本身目前以 API 优先。
适合: 同一角色出现的多镜头故事、想本人出演视频的创作者、已经在阿里云生态里的团队、要做 2-3 个镜头连续的 Fruit Drama。
不适合: 单镜头超 15 秒、4K 输出、pipeline 上不了阿里云的人。
来源:阿里云官方博客、MindStudio 介绍、Evolink 价格指南。
Hailuo 2.3(MiniMax)
Hailuo 2.3 是 Hailuo 02 的迭代版,维持 1080p / 10 秒上限,重点提升面部微表情、风格化美术(水墨、游戏 CG)和动作指令响应。在 Artificial Analysis 视频基准全球排名第 2,仅次于 Seedance 2.0。
- 分辨率与时长: 1920×1080,24-30 fps。单次硬上限 10 秒。
- 价格: 通过 fal.ai 一段 10 秒 1080p 视频约 $0.28(720p 折合 $0.028/秒,1080p 约 $0.12/秒)。订阅:$9.99/月 1000 credits;$94.99/月 无限。订阅档下失败生成也扣 credits,prompt 要先打磨好再跑。
- 2.3 vs 02: 参数量 3 倍,训练数据 4 倍,推理快 2.5 倍,新增「Hailuo 2.3 Fast」档把批量成本砍掉一半。
- License: 闭源 API。按 MiniMax 条款允许商用。
- 要注意的: 跨片段没有一致性。把两段 10 秒拼起来会有明显接缝——光照变了、主体不连续。Fruit Eating ASMR 循环只要撑住 10 秒,这是你手里最锋利的工具。要做 30 秒长弧,得后期补。
适合: 短视频社交内容、风格化/二次元输出、10 秒内写实素材、追求性价比的批量产出(Fast 档目前是 1080p 里最便宜的可靠路径)。
不适合: 多镜头叙事、任何超 10 秒的、需要反复迭代的项目(失败渲染会烧 credits)。
来源:MiniMax Hailuo 2.3 发布稿、UCStrategies 参数与价格。
Seedance 2.0(字节)
Seedance 2.0 在 Artificial Analysis 排第 1,生成 480p-2K、4-15 秒视频,原生同步音频(对话、音效、环境音、音乐——单次一遍出,不是 pipeline 后期合)。纯画质是头部。可用性是另一回事。
- 原生音视频: 视频 + 对话 + 音效单次生成,不用外部混音。
- 价格: 火山引擎(中国云)报价 46 CNY/M tokens 生成,28 CNY/M tokens 编辑。第三方估算 5 秒 720p 约 $0.05。
- 可用性: 美国被排除在外。 字节在 2026 年 3 月暂停全球扩张,原因是 Blackburn 和 Welch 两位美国参议员的正式请求,以及迪士尼、派拉蒙、Netflix、索尼、环球的 cease-and-desist。API 仅限「体验中心」,没有面向公众的 API。
- 法律状态: 实质风险。维基百科 Seedance 2.0 词条 有完整时间线。美国创作者目前应当视其为商业不可用,直到法律局面明朗。
适合: 想要单次出片自带音频的高质量短视频、在允许地区的用户、不需要公开 API 接入生产的人。
不适合: 美国商业用途、需要 IP 干净的素材、需要稳定 API 的工作流。
来源:arXiv 2604.14148、字节发布稿、CNBC 报道。
核心参数对比表
按「这周能不能真用」的维度把四个模型排开。
| 模型 | 单次最长时长 | 分辨率 | License | 价格/接入 | 硬件 |
|---|---|---|---|---|---|
| SANA-WM(NVIDIA) | 60 秒 | 720p | 代码 Apache 2.0 / 权重 CC BY-NC-SA 4.0(非商用) | 仅自部署;权重发布待确认 | 完整 pipeline 74.7 GB 显存;RTX 5090(蒸馏版) |
| Wan 2.6(阿里) | 15 秒 | 720p(1080p 未确认) | API;前代 2.1/2.2 Apache 2.0 | 聚合平台约 $0.07/秒;阿里云 Model Studio | 仅云端 |
| Hailuo 2.3(MiniMax) | 10 秒 | 原生 1080p | 闭源 API,允许商用 | $0.28 / 10 秒;$9.99/月 1000 credits | 仅云端 |
| Seedance 2.0(字节) | 15 秒 | 最高 2K | 闭源;美国封锁,法律纠纷进行中 | 5 秒 720p 约 $0.05 | 仅云端(区域受限) |
两层解读。第一:SANA-WM 拿下时长这一栏,但仅限非商用的世界模型场景。第二:对美国商业创作者来说,今天能过四个筛子的只有 Wan 2.6 和 Hailuo 2.3。

怎么选合适的 AI 视频模型
我们跑完测试 prompt 后归出四个清晰的桶。对号入座。
- 研究员或仿真工程师。 直接 SANA-WM。相机轨迹控制 + 60 秒窗口独此一家。一致性瑕疵忍着——那本来就是研究前沿。
- 在美国出海做商业短视频。 多镜头叙事选 Wan 2.6(Fruit Drama 3 个镜头连续),单镜头风格化选 Hailuo 2.3(10 秒内的 Fruit Eating ASMR、Baby Fruit 动画)。Seedance 在美国法律局面清晰前先放放。
- 要最便宜的 1080p 可用产出。 Hailuo 2.3 Fast。盯紧失败渲染扣 credits 这件事。
- 想要一个模型搞定全部。 2026 年 5 月不存在这种模型。叠两个。我们的水果视频工作流现在是 Wan 2.6 做叙事骨架,Hailuo 2.3 做特写插入。
关于「开源」的提醒。HN 评论里有用户 jubilanti 一句话很到位:「权重『soon』就是 vaporware。」在权重和宽松许可同时落地之前,保持这个姿态是公允的。Wan 2.2 的 Apache 2.0 权重是这周最干净的开源选项。
用 Wan 2.6 生成 1 分钟 Fruit Drama 实战
Wan 2.6 单次生成上限 15 秒,做 60 秒 Fruit Drama 意味着拼 4 个镜头。本地跑的话要阿里云接入、Model Studio 付费 key、参考帧 prompt 调试、后期拼接。我们用 AI Fruit,它把 Wan 2.6、Hailuo、Seedance 都封装进 Fruit Drama 模板——选模型、填脚本、点生成。
这是我们写这篇时跑通的完整流程。
- 打开 Fruit Drama 模板。 登录 AI Fruit,进模板库,选 Fruit Drama(多镜头叙事模板)。
- 把模型切到 Wan 2.6。 模板面板顶部的下拉里有 Wan 2.6、Wan 2.5、Hailuo 2.3,Seedance 在允许地区出现。叙事连续性选 Wan 2.6。
- 写 4 个镜头的脚本。 每个镜头 12-15 秒。给主角水果(我们用的是一颗草莓拖小行李箱)准备一张参考帧——R2V 模式会锁住角色。每个镜头一个动作。
- 生成并审。 标准档每个镜头约 90 秒。先看镜头 1 再排镜头 2-4——Wan 2.6 的 R2V 模式从镜头 1 锁定角色,参考帧干净能省 3 次渲染。
- 在 timeline 里拼。 模板自动拼接 4 个镜头。导出 1080p(从 720p 源升档),加配乐,发布。
自己在 H100 上搭一套,第一次出片前光配置就花了 25 分钟左右。AI Fruit 上首条成片 8 分钟内落地,大部分时间是渲染队列而不是配置。如果你更想写脚本而不是写 YAML,这笔时间值得。

常见问题 FAQ
SANA-WM 能免费商用吗?
不能。SANA-WM 代码是 Apache 2.0,但权重是 CC BY-NC-SA 4.0,仅限非商用。有多篇博客说错;论文里没这么写。商用前去 NVlabs/Sana GitHub 仓库 再确认一次最新许可。
SANA-WM 真能单卡跑吗?
蒸馏后的 NVFP4 版本可以在单卡 RTX 5090 上约 34 秒生成 60 秒视频。完整 pipeline(含 17B 精修)需要 74.7 GB 显存,现实里是 H100 级别。RTX 4090 兼容性在 Hacker News 上有人问,没找到任何来源确认。
TikTok 风短视频该选哪个 AI 模型?
10 秒以内的单镜头风格化片,Hailuo 2.3 性价比领先。同一角色出现在 2-4 个镜头的多镜头叙事,Wan 2.6 的 R2V 模式最干净。美国出海的话先躲开 Seedance 2.0——被封了,还在打官司。
世界模型和普通 AI 视频模型差在哪?
世界模型预测镜头穿过场景时画面如何演变(输入起始图 + 6-DoF 相机轨迹)。普通 AI 视频模型接文字或图片 prompt,出可看的成片。SANA-WM 是前者,Wan 2.6、Hailuo 2.3、Seedance 2.0 是后者。解决的是不同的问题。
每个模型单次最长能生成多久?
SANA-WM:60 秒。Wan 2.6 和 Seedance 2.0:15 秒。Hailuo 2.3:10 秒。超出上限要靠多镜头拼接,Wan 2.6 内置 R2V 角色一致性拼得最稳,Hailuo 接缝肉眼可见。
不部署能免费试这些模型吗?
可以。AI Fruit 提供免费试用 credits,通过预制水果视频模板暴露 Wan 2.6、Wan 2.5、Hailuo——不用 API key,不用配云。决定上哪个之前想横向看一下输出,这是顺手的路径。
准备好在自己的 Fruit Drama、ASMR 循环或 Baby Fruit 动画上跑一遍这些模型?免费试用 AI Fruit → ——50+ 模板,Wan 2.6 和 Hailuo 2.3 开箱即用,不需要信用卡。