⚡ 前沿动态

智谱发布GLM-5.3:基座不变靠后训练提升50%,CyberGym网络安全能力首次登顶

🕐 2026.08.17 星期一 来源 · 媒体 🔥 5 次点击

智谱AI发布GLM-5.3,沿用743B基座不扩大参数,纯靠极致后训练实现编程能力约50%提升。CyberGym安全审查得分84.5%首次超越Anthropic Mythos 5和GPT-5.6 Sol。模型意外涌现多步漏洞链推理能力,累计发现2436个漏洞(1097个中高危),权重推迟两周开源。

一、发布背景:国产大模型迭代的“非典型路径”

2026年Q2全球大模型市场进入“基座军备竞赛”的疲惫期,头部厂商动辄投入数亿美金重新训练基座,性能边际收益持续走低。智谱选择在GLM-5.2基座完全冻结的前提下,通过极致后训练Scaling实现性能跃升,打破了行业“性能提升必须依赖基座重训”的惯性认知。

从技术路线看,GLM-5.2的7430亿参数基座在2026年6月完成训练时,已在通用推理、长上下文处理维度摸到了当时的国产开源模型天花板,其128万Token的原生上下文窗口支持10本百万字级技术文档同时加载,此前已被大量企业用于代码库全量分析、科研文献批量梳理等场景。智谱本次没有选择推倒重来,而是将全部算力资源投入后训练环节,通过IndexShare样本索引体系、SAO对齐优化框架、新一代Slime长程推理增强技术三大核心创新,在零基座改动的前提下,将模型的“智能上限”直接拉高了50%。

二、后训练技术细节:三大核心创新拆解

1. IndexShare样本索引体系

传统后训练的数据集存在样本重复度高、分布不均的问题,大量低质代码样本会稀释模型的有效学习效率。智谱自研的IndexShare体系为每一条训练样本生成唯一语义指纹,通过向量聚类完成全样本去重,同时按照“基础语法-工程实现-复杂系统调试-漏洞逆向推理”的四层难度梯度完成样本排序,最终构建出规模达120T Token的高质量后训练数据集,其中高难度编程与安全样本占比从传统方案的7%提升至32%,从根源上避免了模型在低质样本中无效学习。

2. SAO对齐优化框架

该框架打破了传统RLHF对齐模式的局限,将“任务完成度-推理路径严谨性-输出结果安全性”三个维度的目标解耦,针对编程、网络安全等强工具属性场景单独构建奖励模型,避免通用场景的对齐约束过度限制模型在专业领域的探索能力。在网络安全任务中,SAO框架既保证模型不会输出恶意利用的攻击载荷,又能完整还原漏洞原理与防御方案,实现了“专业能力”与“安全合规”的双向平衡。

3. 新一代Slime长程推理增强技术

针对复杂代码调试、漏洞审计这类需要数百步连续推理的任务,该技术为模型新增了“中间结果自校验”机制,每完成15步推理就自动回溯校验前置步骤的逻辑正确性,将长推理路径的错误率从GLM-5.2的41%降至12%,这也是GLM-5.3在TerminalBench3.0这类长周期终端任务中得分实现数倍增长的核心技术支撑。

三、关键参数

1. 模型参数

项目 GLM-5.3
总参数规模 7430亿(与GLM-5.2相同,无新预训练)
上下文长度 100万Token
最大输出 128K Token
开源协议 两周后开源(需安全审查)
技术路径 后训练Scaling(无新基座、无更大架构)

2. 编程能力:全基准测试数据与行业对比

本次升级后,GLM-5.3在所有主流编程类基准测试中均实现了跨越式增长,部分指标追平甚至超越海外头部闭源模型:

基准测试项目 GLM-5.3得分 GLM-5.2得分 环比提升幅度 同期开源模型排名
Terminal Bench 3.0 28.3 4.6 515% 开源模型第1
DeepSWE v1.1 66.9 46.2 44.8% 开源模型第1
Agents' Last Exam (CLI) 28.5 23.8 19.7% 开源模型第1
AutomationBench 48.2 26.2 83.9% 开源模型第1
HLE w/ Tools 62.5 54.7 14.3% 国产模型第1
GDPVal-AA v2 1769 1508 17.3% 国产模型第1

其中Terminal Bench 3.0测试要求模型完全通过终端命令完成环境搭建、代码调试、故障排查全流程任务,GLM-5.3的28.3得分距离海外顶尖闭源模型Fable 5的33.7仅差5.4分,彻底缩小了国产开源模型在工程实操能力上的代差。

四、网络安全能力:CyberGym登顶的实战价值

CyberGym是当前国际公认难度最高的网络安全大模型评测基准,测试集覆盖白盒代码审计、黑盒漏洞挖掘、渗透测试路径还原、漏洞修复方案生成四大类任务,所有测试用例均来自近三年真实发生的高危CVE漏洞,要求模型不能依赖记忆答案,必须完成完整的逻辑推理才能输出正确结果。

GLM-5.3在该评测中取得84.5%的得分,首次超越Mythos 5的83.8%与GPT-5.6 Sol的83.6%,登顶全球第一。在白盒代码审查场景中,GLM-5.3对隐藏在10万行代码中的0day级漏洞的检出率达到79%,与Mythos 5能力持平,完全满足企业级代码安全审计的实战需求。

更关键的是,作为国产开源模型,GLM-5.3支持完全本地化部署,企业的核心代码、内部安全日志等敏感数据无需外传,彻底规避了此前海外闭源模型在安全审计场景下的数据泄露风险。此前Hugging Face社区披露的真实案例中,海外闭源模型拒绝分析某开源项目的攻击日志,正是GLM-5.2完成了完整攻击路径还原,而GLM-5.3将这类复杂安全任务的完成效率又提升了一倍。

  • 累计发现漏洞2436个,其中1097个中高危
  • 覆盖内核、浏览器、DNS等269个开源项目
  • 在逆向工程测试中发现Cursor的潜在严重漏洞

但需注意:在ExploitBench(实际利用能力)上,GLM-5.3仅54.4%,远低于Mythos 5的78%和GPT-5.6 Sol的76.5%。即"发现弱点"能力已接近前沿,"利用弱点"能力仍有差距

五、产业落地生态:从工具适配到行业重构

1. 企业级Agent适配

GLM-5.3发布后,阿里千问办公第一时间完成适配,在8月16日的版本更新中上线“前沿模型”专属档位,用户可直接调用GLM-5.3完成复杂代码工程搭建、全项目安全审计等任务,该功能上线首日调用量突破120万次。智谱官方同步宣布,将在模型发布两周后正式开放GLM-5.3的全部权重,所有企业均可免费下载本地化部署,无需申请特殊权限。

2. “开源的盾”行业计划

智谱同步启动该公益计划,为全球Star量超过1000的开源项目提供免费的GLM-5.3安全审计额度,帮助开源项目维护者自动完成全量代码漏洞扫描,目前已有超过300个国内开源项目提交申请,覆盖操作系统、数据库、Web框架等核心基础软件领域。

3. 商业化市场影响

在海外头部厂商宣布API价格上调的行业背景下,GLM-5.3的高性能并未同步提升定价,其API调用价格仅为海外同级别模型的1/5,大量海外中小科技企业已开始将代码开发、安全审计类工作负载从海外闭源模型迁移至GLM-5.3,高盛最新研报将智谱2026年全年收入预期上调35%,国产大模型的全球性价比优势正在快速转化为实际市场份额。

六、行业影响与后续演进方向

GLM-5.3的发布重新定义了大模型迭代的投入产出比,证明在后训练环节的精准投入,完全可以实现接近基座重训的性能收益,为全行业提供了一条低投入、高回报的技术迭代新路径。 智谱官方透露,后续将基于GLM-5.3的基座,进一步优化多模态安全推理、硬件端侧适配能力,预计在2026年Q4推出面向工控安全、车机安全等垂直场景的专属版本,填补国产大模型在关键基础设施安全防护领域的空白。

声明:文中数据及部分观点来源于网络,部分观点来源于个人分析和推理,仅供参考,不构成投资或商业决策建议。
资料来源
  1. 智谱GLM-5.3官方技术白皮书
  2. 北京日报
  3. CyberGym
  4. TerminalBench
  5. Hugging Face社区
← 返回 [前沿动态]