
大家好我是程序员天天困。8 月 14 日智谱正式甩出新一代基座模型 GLM-5.3。这个时间点很微妙——月之暗面 Kimi K3 和 DeepSeek V4 Pro 刚发布没多久国产开源旗舰的节奏已经卷到了月月有新版本。但这次最值得聊的不是又涨了几分而是智谱在官方博客开篇就写了一句很直白的话Scaling post-training is all we did。基座没换参数没加所有提升都来自后训练。这篇就把官方技术报告和文档过一遍聊聊 GLM-5.3 到底强在哪、哪些数字需要冷静看、API 迁移有什么坑。一、先看结论这次到底更新了什么GLM-5.3 是智谱最新旗舰模型据公开报道总参数规模 7430 亿使用与 GLM-5.2 完全相同的基础模型。这意味着所有能力提升都来自后训练阶段——更多任务环境、更多样化的长程任务、更长的训练时间。后训练Post-training基座模型完成预训练之后用强化学习、人类反馈等方法针对性打磨能力的阶段。你可以理解为同一个大脑又送去集训了一个月。官方给了两个核心更新方向更强的编程能力以及意外涌现的网络安全能力。模型支持 1M 上下文窗口最大输出 128K Tokens目前只处理文本模态。发布节奏上GLM Coding Plan 已全量上线 5.3模型 API 近期开放完整权重计划在发布两周后安全评估完成后开源。二、编程能力内部基准涨 50%开源 SOTA 怎么来的先说结论GLM-5.3 在编程上的提升是实打实的而且不是靠刷公开榜刷出来的。公开基准三个最有代表性的数字基准GLM-5.2GLM-5.3说明Terminal Bench 3.04.628.3开源最佳超 Kimi K3 的 17.4DeepSWE v1.146.266.9接近 Fable 5 的 69.7Agents’ Last Exam (CLI)23.828.5超 Kimi K3 的 27.6 和 Opus 4.8 的 25.7Terminal Bench 3.0 从 4.6 飙到 28.3 是这次最夸张的数字。这个基准测的是模型在真实终端环境里端到端完成任务的能力不是写个函数就完事。但智谱自己也知道公开榜可能有污染所以搞了个内部基准叫 Z.ai Code Bench把智能体丢进复杂本地开发环境里按端到端完成率和细粒度检查项准确率两个维度打分。结果是 5.3 比 5.2 提升了约 50%。更值得关注的是 Token 效率。Max 档位下5.3 准确率 34.5%、平均每项任务输出约 7.5 万 Token5.2 是 23.4%、约 9.6 万 Token。花更少的 Token办更多的事。跟闭源模型比High 档位下 5.3 用约 5 万 Token 拿到 31.4%Opus 4.8 用约 12 万 Token 拿到 29.5%。不过官方也很坦诚Max 档 Fable 5 是 39.5%5.3 是 34.5%差距还在。这些提升背后的方法论智谱总结为任务环境规模化。训练任务不再是传统编程题而是接近专家真实工作的完整单元——比如给模型一个计算集群和代码库让它定位训练栈瓶颈、实施优化、跑实验、交付可量化的加速。有些任务资深工程师也要做好几天。说白了前沿模型的竞争正在从谁的模型更聪明转向谁能搭出更接近真实工作的训练环境。三、网络安全意外涌现但别被单一榜单带节奏这是这次发布最有意思的部分。智谱原话是后训练时把漏洞发现数据和环境加进去原本只想让模型更会找 bug结果网络安全能力的增长速度超出了预期。5.3 不只是能识别孤立漏洞开始能跨多个漏洞利用阶段推理形成完整的利用链。三个基准看下来网安基准GLM-5.2GLM-5.3Mythos 5怎么看CyberGym77.2%84.5%83.8%白盒源码找漏洞5.3 全场第一ExploitBench24.4%54.4%78.0%真实漏洞深度利用翻倍但差距明显ExploitGym (6h)39 项130 项247 项限时完成漏洞利用任务仍有近一倍差距CyberGym 84.5% 确实是开源第一还略超 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。但这个基准测的是最基础的白盒场景——给源码、触发异常来验证漏洞属于漏洞挖掘的起点。越往漏洞利用链深处走差距越真实。ExploitBench 上 5.3 虽然比 5.2 翻倍还多54.4% vs 24.4%但 Mythos 5 是 78.0%。ExploitGym 六小时完成数 5.3 是 130 项Mythos 5 是 247 项差了快一倍。官方自己一句话总结得很到位当前差距最大的方向恰恰也是能力增长最快的方向。真正有说服力的是真实代码库测试。从 GLM-5.2 起智谱就联合国内多家安全团队用模型扫真实代码库。经过专家复核、筛选、去重5.3 在 269 个项目中共发现 2436 个漏洞其中 1097 个中高危Critical 107 个、High 990 个。这些漏洞横跨系统内核、浏览器引擎、开源基础设施、Web 应用和网络协议最老的一个已在代码里潜伏约 40 年官方台账标注最早可追溯到 1981 年。智谱为此建了个公开的 Z.ai 安全漏洞披露台账目前 53 个已公开、2383 个仍在协调披露中。这也是开源权重两周后才放的原因——一个编码和挖洞能力都在开源第一梯队的模型直接开放下载安全评估和加固必须先做。四、API 必看思考模式强制开启老代码不改会报错GLM-5.3 的 API 有一个破坏性变更上线前务必注意思考功能不能关闭了。模型始终启用思考提供三个推理强度档位参数取值默认说明thinking.typeenabledenabled仅支持开启不再支持disabledreasoning_effortlow/high/maxmaxlow 轻量、high 增强、max 深度如果你现有代码里写的是thinking.type: disabled直接把 model ID 换成glm-5.3请求会失败。迁移办法是先改成enabled并把reasoning_effort设成low再切模型 ID。官方建议 Coding 等复杂任务用max。请求示例{model:glm-5.3,thinking:{type:enabled},reasoning_effort:max}可能有人会问为什么要强制开思考不给关闭选项从 5.2 到 5.3 的训练路线看智谱把 SAO带上下文压缩的长程 RL 策略和思考深度绑定了。关掉思考等于丢掉这套后训练带来的大部分增益模型表现会明显退化。与其让用户踩坑不如直接不支持。简单任务用low档位省 Token 就行。协议支持上5.3 同时兼容 OpenAI Chat Completion、OpenAI Response 和 Anthropic Message 三种协议Base URL 分别是/api/paas/v4、/api/v1和/api/anthropic。不过订阅过 GLM Coding Plan含已过期的账号暂时只能用 OpenAI Chat Completion 协议官方说近期迭代。能力层面支持流式输出、Function Calling、上下文缓存、结构化输出该有的都有。五、什么时候能用上、怎么用最划算目前 GLM Coding Plan 已经全量上线 GLM-5.3可以在 ZCode、Claude Code、Cline、Cursor、Trae 等主流编程智能体里直接用。新版 Coding Plan 改成了基于积分的配额系统输入、缓存输入、输出 Token 分开计分。有个省钱细节非高峰时段调用只消耗标准积分的 50%。高峰时段是工作日 14:00–18:00UTC8其他时间包括周末全天都是半价。ZCode 侧还有两个 buff98% 的缓存命中率重复上下文按缓存价计费以及 8 月 31 日前 1.5 倍限时额度加成叠加缓存优惠最多能到标准额度的 180%。模型 API 官方说近期上线完整权重两周后开放。换句话说8 月底之前 5.3 就会出现在 Hugging Face 上。说句带限定的判断GLM-5.3 是目前编程和 Agent 能力最强的开源模型之一但开源第一要分场景看——CyberGym 确实第一ExploitBench 和 ExploitGym 离闭源前沿还有明显差距编码能力在 High 档位 Token 效率惊人但 Max 档位和 Fable 5 仍有 5 个百分点的差距。选型时别只看一个数字先想清楚自己的任务在能力链的哪一层。我是程序员天天困持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊GLM-5.3 两周后开源你会第一时间拿来跑编程还是测网安