智谱发布GLM-5.3:同基座后训练编程开源登顶,意外涌现网络安全能力发现2404个真实漏洞
智谱发布GLM-5.3,与GLM-5.2同基座,能力提升全部来自后训练。编程多项基准开源第一,Z.ai Code Bench超越Claude Opus 4.8。网络安全能力意外涌现,CyberGym 84.5%为最强开源安全模型,红队测试发现2404个真实漏洞含1088个中高危。
智谱正式发布新一代基座模型GLM-5.3。该模型总参数7440亿(MoE架构,单次推理激活约400亿),与GLM-5.2共享同一基座,没有重新预训练,全部能力提升来自更长时间、更大规模和更多类型环境的后训练Scaling。核心技术包括IndexShare架构、SAO单轨迹异步优化和新一代Slime强化学习框架。编程能力方面,Terminal-Bench 3.0从GLM-5.2的4.6提升至28.3,DeepSWE v1.1从46.2升至66.9,Agents' Last Exam从23.8升至28.5,多项基准取得开源第一。
在智谱自建的Z.ai Code Bench中,GLM-5.3在High档位准确率31.4%,超过Claude Opus 4.8最高档位的29.5%,且每项任务平均输出约5万tokens(Opus 4.8约12万),效率显著更高。最令人意外的是网络安全能力的涌现:智谱在训练中引入了漏洞发现数据,本意是让模型更好地识别孤立漏洞,但模型开始跨多个阶段推理漏洞利用——不仅找bug,还能形成端到端利用计划。GLM-5.3在CyberGym得分84.5%,略高于Anthropic Fable 5的83.8%和GPT-5.6 Sol的83.6%。ExploitBench从GLM-5.2的24.4%升至54.4%。
联合国内头部安全团队测试中,GLM-5.3发现2404个漏洞(经专家审查去重),其中1097个中高危、107个严重级别,涵盖269个开源项目,最古老漏洞可追溯至1981年,平均漏洞年龄26.6年。智谱已建立公开安全披露账本跟踪漏洞协调披露流程。模型权重将在两周后以MIT协议开源,已上线ZCode、AutoClaw及扣子、WorkBuddy/CodeBuddy等编码平台。
一、背景
本次发布处于全球开源大模型竞速的关键节点:DeepSeek刚推出旗舰模型V4 Pro结束预览,Moonshot AI的Kimi K3占据了不少开源编程模型的市场份额,智谱选择在GLM-5.2发布两个月后快速迭代GLM-5.3,以“不扩参数、全靠后训练提效”的差异化路线,巩固自身在开源工程领域的领先地位;同时网络安全能力的意外涌现,也让开源模型首次在攻防场景中具备了接近闭源旗舰的实战能力,开辟了开源AI的全新应用赛道。
二、历史脉络
- 2026年1月,智谱正式发布GLM-5系列基础模型,同步完成港股上市,成为全球大模型第一股。
- 2026年4月,GLM-5.1版本正式开源,凭借稳定的长上下文能力快速拉高智谱股价至890港元。
- 2026年6月,智谱推出GLM-5.2与GLM-5-Turbo版本,优化了推理速度与日常场景表现,主打通用场景的高性价比。
- 2026年8月3日,智谱官网短暂泄露GLM-5.3规格页面,上线1小时后下线,当天带动智谱股价上涨8%,摩根大通随即预测该模型将于8月内正式发布。
- 此前市场曾有传闻智谱将跳过5.3直接发布万亿参数量级的GLM-5.5,最终GLM-5.3的正式发布,延续了智谱“平均两个月迭代一版”的激进产品节奏。
三、核心能力
1. 编程与工程执行能力
在Terminal-Bench 3.0评测中得分28.3,为当前开源模型最高成绩,领先Moonshot AI的Kimi K3;在DeepSWE 1.1评测中表现突出,相比GLM-5.2在内部Z.ai Code Bench编程基准上性能提升50%;在Agents' Last Exam等智能体基准测试中达到开源模型领先水平。
2. 网络安全专项能力
在CyberGym漏洞发现测试中得分84.5%,在ExploitBench、ExploitGym等漏洞利用链测试中相比前代实现大幅提升,训练过程中累计挖掘出2404个真实世界软件漏洞,其中包含大量此前未被披露的零日漏洞。
3. 端到端工程工作能力
训练环境完全对齐真实工程师的生产工作流,支持直接对接计算集群、存储系统、内部文档库与代码库,可独立完成需要资深工程师数天工作量的端到端ML基础设施优化任务,自主诊断训练栈瓶颈、实现优化方案并跑出可量化的性能提升结果。
四、技术解析
1. 同基座后训练路线
GLM-5.3完全复用GLM-5.2的7430亿参数基础模型,所有能力提升均来自于后训练阶段的环境扩展与数据优化,没有通过扩大参数量实现性能跃升。
2. 真实生产环境训练机制
后训练阶段大幅扩展了训练环境的覆盖范围,不再以编程习题为核心训练素材,转而大量引入真实企业级工程工作流任务,任务复杂度直接对齐资深工程师的日常完整工作单元。
3. 核心来源
公开资料未披露该模型的MoE路由策略、注意力机制类型、长上下文扩展方案等底层架构细节,官方技术报告中重点强调后训练阶段的环境规模扩展是性能突破的核心来源。
4. 网络安全能力
属于训练过程中的意外涌现,官方未披露针对该能力的专项训练数据集与算法设计细节。
五、应用场景全景
1. 企业级端到端软件工程场景
GLM-5.3已通过智谱API与GLM Coding Plan向所有订阅用户开放,大量AI基础设施企业已开始试用该模型完成大模型训练栈的性能优化工作,暂无公开具名企业完整落地案例。
2. 网络安全攻防场景
多家国内头部网络安全厂商已启动对接测试,尝试将GLM-5.3集成到自动化漏洞扫描系统中,提升复杂开源软件的漏洞挖掘效率,暂无公开具名合作项目披露。
3. 开源社区开发者场景
智谱计划在两周内完成安全评估与加固后,正式开放GLM-5.3的权重下载,全球开源开发者将可直接在本地部署该模型,搭建自主可控的本地编程智能体工作流。
4. 科研机构AI研发场景
国内多所高校的AI实验室已开始预约API测试权限,将该模型用于自主智能体的长期运行任务研究,暂无公开具名科研合作项目披露。
六、行业对比
| 模型名称 | 核心定位 | Terminal-Bench 3.0得分 | 网络安全专项表现 | 开放模式 | 核心短板 |
|---|---|---|---|---|---|
| GLM-5.3 | 开源工程旗舰模型 | 28.3(开源第一) | CyberGym 84.5% | 即将开源权重 | 多模态能力暂未公开 |
| DeepSeek-V4 Pro | 闭源旗舰编程模型 | 官方未披露 | 弱于GLM-5.3 | 闭源API | 无法本地部署 |
| Moonshot Kimi K3 | 通用长上下文开源模型 | 低于28.3 | 远低于GLM-5.3 | 开源权重 | 复杂工程执行能力不足 |
| Claude Opus 5 | 闭源通用主力模型 | 官方未披露 | 专项能力强 | 闭源API | 无法自主部署定制 |
七、产业链影响
1. 对下游开源开发者
开源模型首次在编程与网络安全两个高门槛领域追平甚至超越闭源竞品,大量此前依赖闭源API的工程类智能体项目,将可以迁移到本地部署的GLM-5.3上,大幅降低数据泄露风险与调用成本。
2. 对网络安全产业
开源模型具备高水准漏洞挖掘能力,将彻底改变攻防两端的技术平衡,一方面大幅降低企业的漏洞排查成本,另一方面也可能带来恶意攻击者利用开源模型批量挖掘漏洞的新风险。
3. 对上游算力产业
“不扩参数、靠后训练提效”的技术路线,将引导行业从一味追求大参数量转向优化后训练流程,降低大模型迭代对超高算力集群的依赖,为中小厂商提供更轻量化的模型升级路径。
总结
- GLM-5.3用“不扩参数、全靠后训练”的差异化路线,拿下开源编程能力第一的同时意外解锁顶尖网络安全能力,为国产开源大模型开辟了工程攻防的全新赛道。
- 证明了"后训练Scaling"的巨大潜力——在不更换基座、不增加参数的情况下,通过更长时间和更丰富的训练环境,可以大幅提升模型能力。
- GLM-5.3在编程效率上超越Claude Opus 4.8(用更少的token完成同等任务),直接冲击AI编程市场的成本结构。
- 网络安全能力的涌现开辟了新的商业化方向——安全审计是企业IT预算中最刚性的支出项之一,GLM-5.3发现的2404个真实漏洞证明了其在该场景的实用价值。
- 智谱AI官方2026年8月14日GLM-5.3发布公告
- 第一财经相关行业报道