GLM-5.3 - 前沿编程能力与涌现的网络安全能力

2026 年 8 月 14 日,智谱 AI 正式发布 GLM-5.3。与 GLM-5.2 相比,基座模型完全相同,但通过极致的后训练 Scaling——数十倍的长程任务环境、更丰富多样的环境类型、超长的后训练时间——大大提高了模型的智能上界。我们发现充分的模型后训练能够涌现出超出预期的模型能力。

核心新能力

  • 更强的编程能力:GLM-5.3 是编程能力最强的开源模型,内部自建体感评测中较 GLM-5.2 提升 50%,在 Terminal Bench 3.0、Agents' Last Exam (CLI) 等公开基准测试中取得开源第一。

  • 网络安全能力:在白盒代码审查与漏洞发现等安全任务中,GLM-5.3 的表现持平 Mythos 5,展现出面向网络安全防御场景的强大潜力。

  • 后训练 Scaling:上述全部提升都来自后训练。基于 IndexShare、SAO、以及持续演进的新一代 Slime 框架,我们在与 GLM-5.2 完全相同基座上高效推进强化学习——可能我们还远未开发出这个基座的智能上界。

  • 开源承诺:将在发布两周后开放模型权重,此前完成安全评估与模型加固。

即日起上线智谱官方编程工具 ZCode、效率工具 AutoClaw,上线 GLM Coding Plan 全量用户及开放订阅。TraeWork/TraeCode/扣子、WorkBuddy/CodeBuddy、Qoder/QwenWork、CatPaw、JoyCode、OpenCode 等编码平台开放抢先体验。API 即将上线,完整模型权重将在两周内开源。

技术 Blog:https://z.ai/blog/glm-5.3

强大的编程能力

在多项主流基准测试中,GLM-5.3 是当前排名最高的开源模型,编程与智能体能力接近 Claude Fable 5,编程体感超过其他国产模型。

基准测试GLM-5.2GLM-5.3提升幅度
Terminal-Bench 3.04.628.3+515%
DeepSWE v1.146.266.9+45%
Agents' Last Exam23.828.5+20%
GDPval-AA v21769

在衡量模型于真实终端环境中完成复杂任务的 Terminal-Bench 3.0 上,GLM-5.3 得分从 4.6 大幅跃升至 28.3;在聚焦长程软件工程与持续代码修改能力的 DeepSWE v1.1 上,得分从 46.2 提升至 66.9;在覆盖多类真实专业场景、强调跨工具协作与长程任务的 Agents' Last Exam 上,得分从 23.8 提升至 28.5。在覆盖 44 种职业、考察真实高价值知识工作的 GDPval-AA v2 中得分 1769,展现出基于编程能力涌现的专业任务执行能力。

GLM-5.3 编程基准对比

整体来看,GLM-5.3 在复杂软件工程、终端操作和更广泛的真实世界 Agent 任务上均取得非常显著的进步。

Z.ai Code Bench:真实编程体感评测

自研的 Z.ai Code Bench 评估模型在真实编程场景中的综合体感。模型会被置于复杂的本地开发环境,并在不同思考档位下执行端到端任务,更接近开发者实际使用 Coding Agent 时的体验。

GLM-5.3 Z.ai Code Bench

测试结果显示,GLM-5.3 在效果和 Token 利用率之间取得了更好的平衡。在 High 档位下,GLM-5.3 达到 31.4% 的准确率,超过 Claude Opus 4.8 最高档位的 29.5%,每项任务平均输出约 5 万 tokens,而 Opus 4.8 需要约 12 万 tokens——意味着 GLM-5.3 可以用更短的执行路径完成任务。

GLM-5.3 训练过程中,不只让模型完成编程题,而是把训练环境扩展到更接近真实专家工作的完整流程,有些任务的工作量相当于一位工程师连续数天的工作。以机器学习优化任务为例,模型使用与算法工程师相同的计算集群、存储系统、内部文档、代码库和实验结果,端到端实现可量化的提速。在这样的环境中训练,模型学到的不只是单向执行指令,而是从发现问题开始,推进分析、实施验证,最终独立完成工作。

涌现的网络安全能力

在任务环境不断扩张的过程中,我们观察到模型在网络安全领域的表现超出预期。安全能力的出现并不偶然——安全工作本质上是约束严格的编程能力。我们从 2025 年 9 月开始在这个方向投入研究,在 GLM-5.2 与 GLM-5.3 的研发过程中,与国内多家头部安全实验室一同推进更多长程任务环境,构建更专业化的评测与执行框架(harness)。

安全基准测试

从任务链条看,网络安全能力大致包括代码审查、漏洞验证、漏洞利用以及真实环境中的攻防闭环。我们选取了覆盖漏洞分析、验证和利用不同阶段的三个基准:

基准测试GLM-5.2GLM-5.3Mythos 5GPT-5.6 Sol
CyberGym(白盒漏洞识别)77.2%84.5%83.8%83.6%
ExploitBench(漏洞利用)24.4%54.4%78.0%76.5%
ExploitGym 2h(吞吐量)29项105项181项
ExploitGym 6h(吞吐量)39项130项247项

GLM-5.3 网络安全能力对比

三个基准呈现出相同的趋势:越接近漏洞利用链的前端,GLM-5.3 相较 GLM-5.2 的提升越明显;越深入完整利用,模型与 Mythos 5 等闭源前沿模型之间的差距也越大。GLM-5.3 进步最快的方向,正是当前仍需要重点追赶的方向。

安全评估成果

从 GLM-5.2 发布以来,我们联合国内清华大学、南开大学,以及云起无垠、绿盟科技、赛博昆仑、DARKNAVY、华顺信安、奇安信、安恒信息、元序星核、腾讯玄武、云鼎实验室等多家安全团队,开展了密集的红队测试与安全评估。

  • 累计发现漏洞 2,436 个(经过初筛、去重),其中 1,097 个为中高危
  • 许多漏洞多年来甚至几十年都未被发现,最早可追溯至约 45 年前
  • 代表性漏洞覆盖系统内核、操作系统、浏览器引擎、开源基础组件、互联网应用与互联网协议等 269 个项目
  • 部分漏洞的威胁甚至可以让 Android、Windows、macOS 以及某国民级通信软件出现大范围崩溃

这些发现已发展成为一项持续的漏洞发现和披露工作。相关漏洞已陆续提交 CNNVD/CNVD 等国家漏洞库。为提高披露过程的透明度,我们建立了 Z.ai 安全披露账本(https://cvd.z.ai/),记录漏洞从发现、确认到修复的进展。

参考 Zerodium、Crowdfense、Apple Security Bounty、Pwn2Own 等全球漏洞交易与赏金市场公开报价,这些漏洞创造的经济价值达 3000 万元

"开源的盾"计划

Hugging Face 官方披露事件给出的警示:如果强大的攻击能力正在扩散,防守能力就不能只在少数闭源模型公司。Anthropic 向约 150 家大型机构提供 Mythos 模型及安全服务,更广泛的企业和开源项目则难以获得同等水平的安全能力支持。

随着 GLM-5.3 的发布与开源,我们同步启动"开源的盾"计划

  • 对重点开源项目开展持续安全审计,帮助维护者免费发现和修复风险(https://huggingface.co/spaces/zai-org/OpenVuln)
  • 向开源社区免费提供模型额度及更加便捷的防御入口,开源项目维护者可以申请用于安全审计和防御任务
  • 在 ZCode 中提供代码审计功能,让安全检查进入日常研发流程

当最强的矛被锁在少数人手里,最好的盾必须属于所有人。

真实案例:最好的安全,是事故最终没有发生

保护 Cursor,守住开发者的工作台 清华大学 NASP 实验室借助 GLM-5.3,对 Cursor 的 Rust 与 Electron 混合架构及权限边界展开分析,发现潜在失陷风险——攻击者可能借此实现任意文件写入,进一步窃取敏感信息,甚至接管开发环境。漏洞已上报 CNVD 和 CNNVD。

保护国民级通讯 APP,守住数亿人的设备安全 安全研究人员在一款拥有数亿日活用户的即时通信软件中发现异常——攻击者无需诱导用户点击链接或打开文件,只需发送一条看似正常的消息,就可能在用户几乎无感知的情况下触发漏洞,远程完成设备接管。风险在抵达用户之前被拦下。

保护 DNS 基础设施,守住互联网的"导航系统" 清华大学 NISL 实验室与云起无垠借助 GLM 模型,在诞生于 1983 年的 DNS 协议中发现了一类潜伏 40 余年的协议级漏洞——攻击者发送少量特殊请求,就能将服务器计算压力最高放大近 8 万倍。该漏洞可能影响全球九成以上主流 DNS 系统,涉及超过 1000 万处公网 DNS 服务。

保护邮件与办公系统,化解微软全球级安全事件 赛博昆仑借助 GLM 发现三枚微软重大漏洞,涉及邮件预览、文档处理和服务端远程访问,串联成"客户端预览即中招、服务端可被远程攻破"的攻击路径。微软官方致谢了"Kunlun Lab&GLM"。

保护真实世界,提前阻断人形机器人失控风险 DARKNAVY 借助 GLM 在一家全球顶级具身智能机器人厂商系统中发现致命级漏洞——攻击者可能同时远程劫持上千台机器人并控制其执行恶意动作。一场可能影响真实世界的"机器人集体失控"事故被提前阻断。

上述漏洞均已联系厂商进行修复,进入 CNNVD/CNVD 负责任披露与协同修复流程。

有责任的开源

随着模型能力提升,我们同步强化安全体系,构建了迄今为止最稳健的风险审查系统。GLM-5.3 的风险审查系统采用分层纵深防御设计

  • 外层分类器(classifier flag):用轻量模型标记并拦截大规模滥用请求
  • 推理监控器(reasoning monitor):在模型推理过程中实时审查任务意图,判断是否存在潜在危害
  • 深度安全对齐:让模型从根本上自主识别并拒绝攻击性请求(开源权重场景下唯一仍然有效的防线)

审查系统遵循风险分级原则,以意图为中心而非关键词为中心审查,精准拦截高风险任务请求,不"误杀"安全知识问答、蓝队防御、CTF 教学、漏洞挖掘与修复等正向安全任务。模型最敏感的能力仅通过"网络安全受信访问"计划保留给经过验证的用户使用。

在全面推出前,我们进行了尤为密集的安全性评估与广泛的红队测试。DARKNAVY 团队评估认为,该模型在风险防护与能力释放之间取得了良好平衡,相比于前代模型显著提高了未授权恶意滥用的门槛。

人工智能发展不应该是某个国家的独奏,而应当是全球合作的交响。随着 GLM-5.3 的发布及开源,安全防御能力将不再是少数机构的特权,而是全球开发者都能平等获得和共同完善的公共能力。

ESC

输入关键词开始搜索

支持搜索标题、内容、标签