智谱发布GLM-5.3:编程能力跃居开源榜首,Token效率超Claude Opus
SmartHey8月14日消息,智谱今日正式发布 GLM-5.3。该版本沿用 GLM-5.2 的基座模型,但通过创新的后训练 Scaling 技术显著拓展了模型的智能上限:支持数十倍更长的任务上下文、覆盖更广泛多样的任务环境,并投入超长周期进行精细化后训练。
相比前代,GLM-5.3 在多项关键能力上实现突破:
顶尖的开源编程能力。GLM-5.3 目前是综合表现最强的开源大模型,在智谱自建的真实体感编程评测中较 GLM-5.2 提升达 50%;在 Terminal Bench 3.0、Agents' Last Exam(CLI)等主流开源基准测试中均位列第一。
扎实的网络安全能力。在白盒代码审计与漏洞识别等高要求安全任务中,GLM-5.3 表现与 Mythos 5 持平,展现出面向企业级安全防御场景的实用潜力。
高效后训练架构升级。全部能力提升均源于后训练优化。依托 IndexShare、SAO 及新一代 Slime 强化学习框架,智谱在未改动基座的前提下,实现了更高效率的智能对齐——这意味着当前基座仍具巨大挖掘空间。
分阶段开源策略。模型权重将于发布后两周正式开放,此前将完成严格的安全评估与加固,确保其防御价值最大化、攻击风险最小化。
据智谱官方披露,GLM-5.3 已在多项权威基准中登顶开源模型榜单,其编程与智能体能力已逼近 Claude Fable 5 水平,实际编码体感明显优于其他国产同类模型。
具体性能提升如下:
- 在真实终端复杂任务评测 Terminal-Bench 3.0 中,得分从 4.6 跃升至 28.3;
- 在长程软件工程与持续代码演进测试 DeepSWE v1.1 中,得分由 46.2 提升至 66.9;
- 在强调跨工具协作与多步推理的 Agents' Last Exam 中,得分从 23.8 升至 28.5;
- 在覆盖 44 类职业、考察高价值专业任务执行能力的 GDPval-AA v2 中斩获 1,769 分,印证其由编程能力驱动的专业任务泛化能力。
为更贴近开发者真实体验,智谱自主研发了 Z.ai Code Bench 编程体感评测体系:模型被置入真实本地开发环境,在不同思考强度档位下执行端到端编码任务,全面模拟 Coding Agent 实际工作流。

测试表明,GLM-5.3 在效果与计算效率之间达成更优平衡:在 High 思考档位下,准确率达 31.4%,超越 Claude Opus 4.8 最高档位的 29.5%;每项任务平均仅需输出约 5 万 tokens,而 Opus 4.8 需约 12 万 tokens——意味着 GLM-5.3 可以更短路径、更高精度完成复杂指令。

即日起,智谱官方编程工具 ZCode 与效率助手 AutoClaw 全面上线,同步向 GLM Coding Plan 全量用户开放使用权限及订阅服务。
TraeWork / TraeCode / 扣子、WorkBuddy / CodeBuddy、Qoder / QwenWork、CatPaw、JoyCode、OpenCode 等主流编码平台已开启抢先体验通道。
API 接口即将上线;完整模型权重将在两周内开源,开源前已完成关键安全加固,兼顾模型实用性与可控性。
据智谱公告,今日 13:00 起,GLM Coding Plan 用户额度已全量重置,所有用户可在后台「用量统计」页面实时查看恢复后的可用配额。
