⚡ 要闻简报

国产MiniMax发布H3开源模态生成模型,视频编辑能力登顶全球第一

🕐 2026.08.03 星期一 来源 · MiniMax 🔥 10 次点击

MiniMax发布首款开源多模态生成模型H3,在Artificial Analysis视频编辑榜以1130 Elo排名全球第一,支持15秒2K原生双声道音视频,定价0.8元/秒仅为竞品1/3。是MiniMax首款开源多模态生成模型,也是中国模型在视频生成赛道从"追赶"走向"并跑甚至领跑"的重要信号。

MiniMax于7月31日正式发布新一代全模态生成模型H3,并宣布将在数日内开源完整模型权重(MiniMax Community License)。H3在Artificial Analysis视频编辑榜单中以1130 Elo排名全球第一,超越Google Gemini Omni和字节Seedance。

H3的核心创新在于"全模态统一理解"架构——不再按图片、视频、声音划分任务边界,而是将文本/图片/音频/视频输入放入同一上下文理解。用户可以说"用视频1的希区柯克运镜方式,让图片2中的角色唱歌,歌声匹配音频3",H3自动解析跨模态关系。该模型支持2K分辨率直出、最长15秒音画内容,定价仅0.8元/秒(2K)、768p价格为同行720p的一半。

‌ 发布日期 ‌:2026年7月31日
‌ 发布方 ‌:MiniMax 稀宇科技
‌ 开源状态 ‌:已于2026年8月3日正式开源权重
‌ 核心定位 ‌:业界首款开源通用全模态生成模型

一、一句话定义H3

MiniMax H3不是又一个"文生视频"玩具——它是一款能"听懂"你给的所有素材、再"一步到位"吐出2K高清音画成片的通用全模态智能体。 ‌ 文本、图片、视频、声音,四种模态在同一上下文里被统一理解、统一生成,原生双声道音频与画面同步输出,彻底告别后期配音合成的繁琐流程。

二、核心能力全景扫描

视频输出最高 ‌ 15秒 ‌、‌ 2K分辨率(1440P) ‌、‌ 24fps ‌,不依赖后置超分,模型自生成高保真画面
音频输出原生双声道 ‌立体声,对话/音效/环境音一步生成,音画天然同步
输入上限最多 ‌ 9张图 + 3段视频 + 3段音频 ‌,混合文件总计不超过 ‌ 12个
Prompt上限7,000字符
画幅支持21:9 / 16:9 / 4:3 / 1:1 / 3:4 / 9:16 全覆盖
支持语言稳定支持 ‌ 11种 ‌(中/英/日/韩/法/德/意/西/葡/俄/阿),其他语言不同程度支持

三大杀手级能力

  1. 全模态上下文统一理解 ‌:上传产品白底图+品牌视频+旁白音频+文字指令,H3一次吃透所有信息,综合生成广告成片。
  2. V2V Motion Transfer(视频动作迁移) ‌:精准提取源视频动作特征并复刻到目标视频,在Artificial Analysis视频编辑能力榜单中‌ 排名全球第一 ‌。
  3. 指令遵循与文字渲染 ‌:品牌LOGO、产品文案在画面中呈现准确,大幅改善AI视频常见的文字崩坏问题。

三、技术架构:四大创新重构底层

H3的卓越表现并非凭空而来,其技术底座是对文本模型成熟方法论的系统性迁移与多模态重构:

1. 系统三大模块

H3-Context-IR深度解析多模态指令,将其转换为结构化"上下文中间表示"(Context Intermediate Representation),是输出质量的关键前置
H3-Base根据中间表示生成768p音视频,联合预测视频latent与音频latent
H3-Regenerate-2K将768p结果连同原始上下文送回,以2K分辨率二次生成,细节更准确、保真度更高

2. 四项底层技术突破

语言统一中间表示用语言统一所有任务的中间表示,改变数据与标注方式,实现跨模态深层泛化连结
高压缩Tokenizer视频被压缩为更少Token,直接带来‌ 4倍序列长度收益 ‌,这是2K直出+低成本的核心底气
异构训练架构理解与生成采用异构训练,端到端训练吞吐量提升近‌ 30%
全新输出层设计支持依据指令对生成结果进行二次编辑与优化,为可控生成提供更大空间

3. 关键技术细节

  1. H3-Encoder ‌:使用Qwen3-VL-32B完整预训练权重,第50层hidden states提供给Omni-Transformer
  2. H3-VisualVAE ‌:时间因果结构视频自编码器,空间压缩16倍、时间压缩4倍,latent channel 24(f16t4d24),采用ViT decoder降低解码成本
  3. H3-AudioVAE ‌:独立处理左右声道,将32kHz音频压缩为40Hz latent token序列
  4. H3-Omni-Transformer ‌:通过RoPE表达时空关系,联合预测视频与音频latent;原生支持稀疏注意力(首个开源版本为全注意力推理)

四、定价策略:一枚"价格核弹"

对比项H3业内同类旗舰模型
2K视频生成0.8元/秒约2.4元/秒(3倍价格)
成本优势来源高压缩Tokenizer + 异构训练 + 负载均衡 + GPU效率优化
训练成本降幅
成本下降来自两大方向:一是通过高压缩Tokenizer减少视频生成所需Token数量;二是针对视频长度、分辨率和多模态负载差异大的特点,在异构训练、负载均衡和GPU利用效率等层面进行系统性调优。

五、开源进展与生态布局

2026年7月31日正式发布,宣布将于近期开源
2026年8月3日正式开源权重 ‌(H3-Base、H3-Context-IR API同步开放)
未来计划稀疏注意力实现将在后续更新发布;H3后续版本将与M系列文本模型能力融合,持续Scaling

1. 开源许可

采用 ‌ MiniMax H3 Community License ‌,包含完整训练代码、推理框架及预训练权重。企业可在本地灵活部署,结合自有数据微调;芯片厂商与开发者可参与适配优化。

2. 已有超过200家企业表达合作意向

六、落地场景矩阵

场景H3能力匹配
品牌广告指令遵循强、文字/LOGO渲染准确,声画协同制作故事感广告
电商短视频旧视频翻新、一键换背景、动作迁移,极大降低制作门槛
产品设计/UI/UX生成游戏PV、UI动效、网页滚动动效等视觉包装素材
MV/Vlog直接输出带歌词动态MV,或自动生成节奏装饰与背景音效的日常Vlog

七、市场反应

  1. 股价表现 ‌:MiniMax股价单日一度大涨超‌ 14% ‌,扭转前期因股份解禁与产品降价带来的下跌趋势
  2. 竞争定位 ‌:与OpenAI Sora、Google Veo、快手可灵走完全不同路线——‌ 开源权重+本地部署 ‌;相比偏向前期影视特效的Seedance 2.0,H3在视觉包装和后期特效方面形成互补

八、已知限制(官方坦诚披露)

❌ 4K输出暂不支持
❌ 超长镜头不支持超过15秒的连续镜头
⚠️ 文字细节较小或密集文本偶尔出现乱码

九、一句话总结

MiniMax H3以"全模态统一理解+原生音视频直出+开源权重+行业1/3定价"四板斧,将AI视频生成从实验室玩具推向商业级生产力工具,标志着国产多模态大模型正式吹响了"以极致性价比+开放生态"挑战全球巨头的冲锋号。 ‌ 8月3日权重全面开放后,社区适配进度与商业订单落地节奏,将是检验这一"以价换量"策略能否持续奏效的关键试金石。

信息综合自2026年7月31日至8月3日MiniMax官方发布及开源公告。H3现已开源,权重可于HuggingFace获取。

资料来源
  1. MiniMax
← 返回 [资讯]