当整个AI视频行业都在用高昂的API定价和闭源壁垒筑起高墙时,MiniMax选择了一条截然不同的路——它问了一个看似简单却极其硬核的问题:如果把全模态视频生成模型的定价打到行业同类模型的1/3,并且直接开源,会怎样?
模型地址:https://modelscope.cn/models/MiniMax/MiniMax-H3
一、为什么这个模型值得你停下来读?
如果你接触过AI视频生成,你一定对这样的困境习以为常:想生成一支高质量的商业视频?得用闭源模型。但闭源模型要么贵得离谱(每秒几十元),要么能力单一(只能文生视频,不支持多模态参考),要么数据安全堪忧(素材要上传云端)。
但MiniMax H3给出了一个颠覆性的答案:
一个通用的全模态生成系统,支持文本、图像、视频、音频的统一理解与生成,最高输出15秒2K分辨率(2560×1440)原生双声道视频,定价仅为行业同类模型的1/3——而且宣布开源!
更绝的是,它在第三方评测机构Artificial Analysis的文生视频有声榜单中排名第二(Elo 1242分),仅以微弱差距落后谷歌Gemini Omni Flash(1245分);在视频编辑榜单中更以1130 Elo排名全球第一,领先Google Gemini Omni、字节Seedance 2.0等模型。
这不是在现有视频模型上做点微调——它是从架构到定价到开源策略,重新定义了“多模态视频模型应该怎么做”。
二、核心亮点:三大杀手锏
2.1 ★ 全模态统一理解与生成:文本/图像/视频/音频“一网打尽”
H3最核心的能力是真正的全模态(Omni-modal)——不是“文本模型+外挂视觉模块”,而是从系统层面原生支持多模态统一理解与生成:
- 输入:文本、图像、视频、音频的任意组合
- 输出:最高2K分辨率、15秒时长、24FPS、32kHz立体声的音视频
- 语言支持:稳定支持中、英、日、韩、法、德、西、意、葡、俄、阿等11种语言
具体怎么用?
H3提供了两种核心输入模式:
| 模式 | 输入类型 | 用途 |
|---|---|---|
| 首尾帧模式(Base-FL2VA) | 0/1/2张图像 | 文生视频、首帧→视频、尾帧→视频、首尾帧→视频 |
| 全参考模式(Base-Ref2VA) | ≤9张图像 + ≤3个视频片段 + ≤3个音频片段 | 多模态参考生成,总输入≤12个文件 |
一个具体例子:给H3一张人物参考图 + 一段希区柯克式镜头运动的参考视频 + 一条参考歌声的音频,它能读懂“让图里的人物按参考视频的镜头运动,并配上参考歌声”——把三种完全不相关的模态融合成一个连贯的输出。
2.2 ★ 价格屠夫:每秒8毛钱,仅为行业1/3
MiniMax H3在定价上展现了惊人的攻击性:
- 2K视频生成价格:0.8元/秒
- 约为业内同类旗舰模型的1/3
- 以12贝壳/秒计价(2K效果)
怎么做到的?MiniMax用高压缩Tokenizer减少视频生成所需Token数量,并对异构训练、任务负载均衡和GPU利用效率进行了全面优化。
对于需要大规模生成视频的商业场景(广告、电商、品牌、游戏),这意味着成本直接断崖式下降。
2.3 ★ 开源 + 64B Dense架构:多模态领域的“DeepSeek时刻”
H3宣布开源,模型权重已上架ModelScope:
| 维度 | MiniMax H3 |
|---|---|
| 模型大小 | 138.47B(Safetensors格式) |
| 架构 | 64B · DENSE |
| 开源协议 | MiniMax H3社区许可证 |
| 下载量 | 已超1,361次(截至8月3日) |
“天下苦闭源模型久矣,MiniMax要做多模态领域的Deepseek。”
这句话精准地概括了H3的战略意义——用开源打破闭源壁垒,用低价打破价格垄断。
三、技术解析:三大核心模块,重新定义多模态生成
H3的技术架构围绕三个核心模块展开:
3.1 H3-Context-IR:多模态“理解大脑”
这是一个托管的预处理与编排系统,专为自由形式的多模态输入设计。它能理解文本、图像、音频和参考视频之间的关系,以及这些素材与预期生成输出之间的关联。
内部工作流程包括:
- 指令解析:理解用户到底想要什么
- 跨模态关联:建立不同模态素材之间的联系
- 时序理解:理解视频的时间顺序逻辑
- 复杂逻辑推理:处理多步、多条件生成需求
注意:H3-Context-IR依赖于多阶段工作流和多个托管模型,未包含在本次开源发布中,但MiniMax提供了API供开发者复现官方工作流。
3.2 H3-Base:768p核心生成引擎
H3-Base是模型的核心生成模块:
- 文本编码:使用Qwen3-VL-32B的完整预训练权重,将其第50层的隐藏状态提供给H3-Omni-Transformer
- 视觉编码:H3-Encoder + H3-VisualVAE联合编码
- 音频编码:H3-AudioVAE独立编码
- 核心Transformer:H3-Omni-Transformer联合预测视频和音频的潜在表示,随后分别解码
- 稀疏注意力:原生支持稀疏注意力训练与推理,初始开源版本仅提供全注意力推理,稀疏注意力实现将在未来更新中发布
H3-VisualVAE的关键参数:
| 参数 | 值 |
|---|---|
| 空间压缩因子 | 16× |
| 时间压缩因子 | 4× |
| 潜在通道数 | 24(f16t4d24) |
| 进入Transformer的patch | 1×2×2 |
| 等效空间下采样 | 32× |
| 等效时间下采样 | 4× |
H3-AudioVAE:
- 左右声道独立处理,使用相同编码器/解码器
- 32kHz音频压缩为40Hz的潜在token序列
- 受VA-VAE启发优化潜在空间,兼顾重建质量和可学习性
3.3 H3-Regenerate-2K:从768p到2K的“超分增强”
H3默认输出为768p(短边768像素)。要获得2K分辨率,需要使用H3-Regenerate-2K模块:
将768p的结果连同原始上下文重新输入H3,再生2K分辨率输出。该过程充分利用了H3强大的生成能力以及原始上下文中包含的丰富信息,从而生成细节更准确、视觉保真度更高的高分辨率输出。
输出规格汇总:
| 规格 | 参数 |
|---|---|
| 时长 | 4–15秒 |
| 宽高比 | 21:9、16:9、4:3、1:1、3:4、9:16 |
| 分辨率 | 默认768p短边;2K(2560×1440)通过Regenerate实现 |
| 帧率 | 24 FPS |
| 音频 | 32kHz 立体声 |
| 语言 | 11种稳定支持 |
四、性能表现:全球视频编辑第一,文生视频第二
4.1 第三方评测:双榜顶尖
| 榜单 | 排名 | Elo分数 | 击败对手 |
|---|---|---|---|
| Artificial Analysis 视频编辑榜 | 🏆全球第1 | 1130 | Google Gemini Omni、字节Seedance 2.0 |
| Artificial Analysis 文生视频有声榜 | 全球第2 | 1242 | 仅落后Gemini Omni Flash 3分 |
4.2 核心能力:商用级多场景内容生成
官方宣称H3具备商用级的多场景内容生成能力:
- 指令遵循:精准理解并执行复杂多模态指令
- 文字与品牌信息呈现:视频中文字清晰可读,品牌信息准确传达
- V2V Motion Transfer:视频到视频动作迁移,让参考动作“移植”到新角色上
- 精准可控的多模态内容编辑与生成
适用场景:
- 广告、品牌、电商、产品设计、游戏
- 视觉包装和后期特效
- 特效剪辑包装类视频
4.3 实际体验:与Seedance“有来有回”
早期实测显示:
H3与Seedance 2.0能打得有来有回,同时生成速度更快,价格按照官方定价直接对比也更低。
简单的人物/背景/物体替换、基于参考视频学习风格并复制、根据文字需求直接生成一支产品概念片——这些都是H3的强项。
五、快速上手
5.1 模型下载(ModelScope)
gitlfsinstallgitclone https://modelscope.cn/models/MiniMax/MiniMax-H3模型大小:138.47B,约288GB
5.2 在线体验(无需下载)
| 平台 | 链接 |
|---|---|
| Web全球版 | hailuoai.video |
| Web中国版 | hailuoai.com |
| 桌面全球版 | hub.minimax.io |
| 桌面中国版 | hub.minimaxi.com |
5.3 API调用
MiniMax提供了在线API供开发者直接使用H3的能力。
重要提示:官方强烈建议将H3-Context-IR集成到生成流程中,或遵循“提示指南”构建自己的上下文处理系统。
5.4 硬件适配
沐曦股份曦云C系列GPU已率先完成对H3的Day 0适配,基于自研核心GPU IP打造,具备高能效比与高通用性。
六、总结与思考
MiniMax H3的价值,远不止于“又出了一个视频模型”。它真正值得深思的地方在于:
第一,它证明了“多模态模型可以既强又便宜”。2K视频每秒8毛钱、视频编辑全球第一、文生视频全球第二——性能不妥协,价格打骨折。
第二,它用开源打破了闭源壁垒。“天下苦闭源模型久矣”——H3的开源让开发者、企业和研究者第一次拥有了一个商用级全模态视频生成模型的完整权重。你可以本地部署、二次开发、定制微调。
第三,它重新定义了“多模态”的边界。不是“文生视频”一个孤岛,而是文本、图像、视频、音频的任意组合输入→统一理解→音视频联合输出。这代表着从“单一任务模型”到“通用多模态智能”的范式跃迁。
第四,它的技术架构极具前瞻性。H3-Context-IR做多模态理解、H3-Base做核心生成、H3-Regenerate-2K做超分增强——三个模块各司其职,构成了一个完整的全模态生成操作系统。
当然,H3也有明显局限:H3-Context-IR未开源,依赖API调用;初始版本仅支持全注意力推理,稀疏注意力待后续更新;138B的模型规模对硬件有较高要求。但它打开了一扇门:如果多模态视频生成的未来不一定是“更贵更闭源”,而是“更便宜更开放”呢?
模型地址:https://modelscope.cn/models/MiniMax/MiniMax-H3
欢迎下载、体验、二次开发——一起探索多模态视频生成的另一种可能。