MiniMax 正式发布新一代通用全模态生成模型MiniMax H3,作为品牌首款计划开源的多模态视听生成模型,H3 将文本模型成熟的推理、上下文技术迁移至视频生成领域,面向开发者与商业场景提供一体化音视频生成能力。
1. 模型核心技术特点
- 统一多模态理解管线原生支持文本、图像、短视频、音频混合输入,统一编码多模态上下文,支持参考素材联动生成、视频动作迁移(V2V)。
- 创新画面生成方案 不依赖传统后置超分,采用模型自生成方式提升分辨率,更好保留画面结构、文字细节,改善 AI 视频常见文字崩坏问题。
- 架构复用文本模型成熟方案 引入复杂指令拆解、上下文扩展、Muon 优化器等经过验证的技术,提升长提示词、复杂指令的遵循能力。
2. 完整能力参数清单
- 生成时长:5~15s,固定 24FPS
- 最高分辨率:2K(1440P),向下兼容 768P
- 音频:原生双声道同步生成音画
- 输入上限:9 图 + 3 视频 + 3 音频,合计 12 份参考素材
- Prompt 上限:7000 字符
- 画幅:9:16 /16:9 /1:1 /4:3 /21:9 全覆盖
3. 适用开发场景
- API 云端调用:搭建 AI 视频工具、短视频 SaaS、数字人配套视频生成
- 本地私有化部署:权重开放后,企业内网部署,数据不出域
- 二次微调:电商素材、品牌宣传片垂直场景定制优化
- 多模态 Agent 联动:图文、音频、视频联动自动化工作流
4. API 相关信息
H3 现已开放 API 接入,支持文本生成视频、图生视频、参考素材驱动生成、首尾关键帧过渡生成。 调用模式支持多种条件生成方式:纯提示词、单图起始帧、首尾帧动画、多素材参考驱动。
计费参考:2K 分辨率官方原价 0.8 元 / 秒,768P 档位成本更低,适合大批量素材生产。
5. 开源计划重点
官方披露:未来数日将开放 H3 模型权重。 对于开发者意义: ✅ 脱离公有云 API,自主控制推理成本 ✅ 行业数据集微调,适配垂直业务 ✅ 可自主进行 GPU 适配、推理优化
6. 横向对比与选型建议
- 如果你需要快速上线工具、不想运维显卡:优先公有云 API;
- 如果你有大量素材、数据合规要求高、长期稳定需求:等待开源权重本地部署;
- 业务重点是广告、电商素材、需要稳定文字 / LOGO 渲染:H3 具备明显优势。
7. 待优化方向(客观评价)
当前生成上限 15 秒,连续长镜头生成能力有限;复杂人物肢体细节依旧是现阶段所有文生视频模型共同难题。
MiniMax H3 打通了「云端 API + 开源本地部署」双路线,补齐 MiniMax 在通用视频生成赛道的布局。随着权重开放,国内开源多模态视频模型生态将迎来新一轮发展。
更多资料福利领取
后续我会持续跟进权重开放进度,第一时间整理本地部署环境、推理测试教程。
#MiniMaxH3 #AIGC #文生视频 #大模型开发 #AI 视频 API #开源大模型