Kimi K3 —— 全球首个开源3T级大模型释放完整权重
月之暗面今日正式释放Kimi K3完整2.8万亿参数开源权重(Modified MIT许可),成为全球首个开源3T级大模型。K3采用896专家MoE架构(16活跃专家)和Kimi Delta Attention(KDA)混合线性注意力机制,1M上下文窗口下推理速度提升6.3倍,在LMArena前端编程竞技场排名第一
Kimi K3 核心信息速览
Kimi K3是一个专为长程编程、深度知识工作和复杂推理等前沿任务设计的MoE(混合专家)架构模型。
| 项目 | 关键信息
| 总参数量 | 2.8万亿 (2.8T), 全球首个开源的3万亿级别模型。
| 激活机制 | 拥有896个专家, 每次推理仅激活其中16个(约等效500亿参数),兼顾能力与效率。
| 核心架构 | 自研 Kimi Delta Attention (KDA) 混合线性注意力和注意力残差 (Attention Residuals),训练效率较上代提升约2.5倍。
| 多模态与上下文 | 原生支持视觉理解,并拥有100万tokens的超大上下文窗口。
| 性能定位 | 综合能力全球第三,仅次于Claude Fable 5和GPT-5.6 Sol这两个最强的闭源模型。
💡 这意味着什么?
· 开源生态的里程碑
2.8万亿参数的权重开放,为全球开发者提供了前所未有的研究基石。得益于量化感知训练 (MXFP4权重 + MXFP8激活),模型权重仅需约1.4TB存储空间,让有算力资源的机构能够进行部署和研究。
· 用行动证明的“硬实力”
K3的能力不只停留在跑分上。一个令人印象深刻的展示是,它曾在48小时内自主完成了一颗4平方毫米芯片的完整设计。这标志着它在处理需要长期规划、多步骤推理的复杂工程任务上,已经迈出了从“对话”到“行动”的关键一步。
· 国产AI的“又一个DeepSeek时刻”
正如《自然》杂志等国际媒体所报道的,K3的出现是“中国开放权重模型改变对美国前沿模型价值看法”的标志性事件。它证明了 开源模型有能力无限逼近甚至在某些领域(如前端代码)超越最顶级的闭源模型,也预示着AI市场未来将是多元共存的,而非某个巨头通吃。