国产MiniMax发布H3开源模态生成模型,视频编辑能力登顶全球第一
MiniMax发布首款开源多模态生成模型H3,在Artificial Analysis视频编辑榜以1130 Elo排名全球第一,支持15秒2K原生双声道音视频,定价0.8元/秒仅为竞品1/3。是MiniMax首款开源多模态生成模型,也是中国模型在视频生成赛道从"追赶"走向"并跑甚至领跑"的重要信号。
MiniMax于7月31日正式发布新一代全模态生成模型H3,并宣布将在数日内开源完整模型权重(MiniMax Community License)。H3在Artificial Analysis视频编辑榜单中以1130 Elo排名全球第一,超越Google Gemini Omni和字节Seedance。
H3的核心创新在于"全模态统一理解"架构——不再按图片、视频、声音划分任务边界,而是将文本/图片/音频/视频输入放入同一上下文理解。用户可以说"用视频1的希区柯克运镜方式,让图片2中的角色唱歌,歌声匹配音频3",H3自动解析跨模态关系。该模型支持2K分辨率直出、最长15秒音画内容,定价仅0.8元/秒(2K)、768p价格为同行720p的一半。
发布日期 :2026年7月31日
发布方 :MiniMax 稀宇科技
开源状态 :已于2026年8月3日正式开源权重
核心定位 :业界首款开源通用全模态生成模型
一、一句话定义H3
MiniMax H3不是又一个"文生视频"玩具——它是一款能"听懂"你给的所有素材、再"一步到位"吐出2K高清音画成片的通用全模态智能体。 文本、图片、视频、声音,四种模态在同一上下文里被统一理解、统一生成,原生双声道音频与画面同步输出,彻底告别后期配音合成的繁琐流程。
二、核心能力全景扫描
| 视频输出 | 最高 15秒 、 2K分辨率(1440P) 、 24fps ,不依赖后置超分,模型自生成高保真画面 |
| 音频输出 | 原生双声道 立体声,对话/音效/环境音一步生成,音画天然同步 |
| 输入上限 | 最多 9张图 + 3段视频 + 3段音频 ,混合文件总计不超过 12个 |
| Prompt上限 | 7,000字符 |
| 画幅支持 | 21:9 / 16:9 / 4:3 / 1:1 / 3:4 / 9:16 全覆盖 |
| 支持语言 | 稳定支持 11种 (中/英/日/韩/法/德/意/西/葡/俄/阿),其他语言不同程度支持 |
三大杀手级能力
- 全模态上下文统一理解 :上传产品白底图+品牌视频+旁白音频+文字指令,H3一次吃透所有信息,综合生成广告成片。
- V2V Motion Transfer(视频动作迁移) :精准提取源视频动作特征并复刻到目标视频,在Artificial Analysis视频编辑能力榜单中 排名全球第一 。
- 指令遵循与文字渲染 :品牌LOGO、产品文案在画面中呈现准确,大幅改善AI视频常见的文字崩坏问题。
三、技术架构:四大创新重构底层
H3的卓越表现并非凭空而来,其技术底座是对文本模型成熟方法论的系统性迁移与多模态重构:
1. 系统三大模块
| H3-Context-IR | 深度解析多模态指令,将其转换为结构化"上下文中间表示"(Context Intermediate Representation),是输出质量的关键前置 |
| H3-Base | 根据中间表示生成768p音视频,联合预测视频latent与音频latent |
| H3-Regenerate-2K | 将768p结果连同原始上下文送回,以2K分辨率二次生成,细节更准确、保真度更高 |
2. 四项底层技术突破
| 语言统一中间表示 | 用语言统一所有任务的中间表示,改变数据与标注方式,实现跨模态深层泛化连结 |
| 高压缩Tokenizer | 视频被压缩为更少Token,直接带来 4倍序列长度收益 ,这是2K直出+低成本的核心底气 |
| 异构训练架构 | 理解与生成采用异构训练,端到端训练吞吐量提升近 30% |
| 全新输出层设计 | 支持依据指令对生成结果进行二次编辑与优化,为可控生成提供更大空间 |
3. 关键技术细节
- H3-Encoder :使用Qwen3-VL-32B完整预训练权重,第50层hidden states提供给Omni-Transformer
- H3-VisualVAE :时间因果结构视频自编码器,空间压缩16倍、时间压缩4倍,latent channel 24(f16t4d24),采用ViT decoder降低解码成本
- H3-AudioVAE :独立处理左右声道,将32kHz音频压缩为40Hz latent token序列
- H3-Omni-Transformer :通过RoPE表达时空关系,联合预测视频与音频latent;原生支持稀疏注意力(首个开源版本为全注意力推理)
四、定价策略:一枚"价格核弹"
| 对比项 | H3 | 业内同类旗舰模型 |
| 2K视频生成 | 0.8元/秒 | 约2.4元/秒(3倍价格) |
| 成本优势来源 | 高压缩Tokenizer + 异构训练 + 负载均衡 + GPU效率优化 | — |
| 训练成本降幅 | — | — |
成本下降来自两大方向:一是通过高压缩Tokenizer减少视频生成所需Token数量;二是针对视频长度、分辨率和多模态负载差异大的特点,在异构训练、负载均衡和GPU利用效率等层面进行系统性调优。
五、开源进展与生态布局
| 2026年7月31日 | 正式发布,宣布将于近期开源 |
| 2026年8月3日 | 正式开源权重 (H3-Base、H3-Context-IR API同步开放) |
| 未来计划 | 稀疏注意力实现将在后续更新发布;H3后续版本将与M系列文本模型能力融合,持续Scaling |
1. 开源许可
采用 MiniMax H3 Community License ,包含完整训练代码、推理框架及预训练权重。企业可在本地灵活部署,结合自有数据微调;芯片厂商与开发者可参与适配优化。
2. 已有超过200家企业表达合作意向
六、落地场景矩阵
| 场景H3能力匹配 | |
| 品牌广告 | 指令遵循强、文字/LOGO渲染准确,声画协同制作故事感广告 |
| 电商短视频 | 旧视频翻新、一键换背景、动作迁移,极大降低制作门槛 |
| 产品设计/UI/UX | 生成游戏PV、UI动效、网页滚动动效等视觉包装素材 |
| MV/Vlog | 直接输出带歌词动态MV,或自动生成节奏装饰与背景音效的日常Vlog |
七、市场反应
- 股价表现 :MiniMax股价单日一度大涨超 14% ,扭转前期因股份解禁与产品降价带来的下跌趋势
- 竞争定位 :与OpenAI Sora、Google Veo、快手可灵走完全不同路线—— 开源权重+本地部署 ;相比偏向前期影视特效的Seedance 2.0,H3在视觉包装和后期特效方面形成互补
八、已知限制(官方坦诚披露)
| ❌ 4K输出 | 暂不支持 |
| ❌ 超长镜头 | 不支持超过15秒的连续镜头 |
| ⚠️ 文字细节 | 较小或密集文本偶尔出现乱码 |
九、一句话总结
MiniMax H3以"全模态统一理解+原生音视频直出+开源权重+行业1/3定价"四板斧,将AI视频生成从实验室玩具推向商业级生产力工具,标志着国产多模态大模型正式吹响了"以极致性价比+开放生态"挑战全球巨头的冲锋号。 8月3日权重全面开放后,社区适配进度与商业订单落地节奏,将是检验这一"以价换量"策略能否持续奏效的关键试金石。
信息综合自2026年7月31日至8月3日MiniMax官方发布及开源公告。H3现已开源,权重可于HuggingFace获取。