2026 年 8 月 14 日,智谱发布了 GLM-5.3。这次发布最有意思的地方是:基座模型一个参数都没换——它和 GLM-5.2 用的是完全相同的底座,所有提升全部来自后训练(Post-training)规模化。智谱在公告里的原话是"可能我们还远未开发出这个基座的智能上限"。
提升幅度不是挤牙膏:内部编程基准 Z.ai Code Bench 上较 GLM-5.2 提升 50%,公开基准 Terminal-Bench 3.0 从 4.6 分跳到 28.3 分。发布当天,金山办公的 AI 办公智能体灵犀专业版就首发接入了它。这篇文章不复述新闻,只解决三个实操问题:现在怎么用上、三档推理怎么选、从 5.2 迁移要改什么。
一、关键规格先摊开看
| 规格 | 数值 | 实操含义 |
|---|---|---|
| 上下文窗口 | 1M Token | 项目级代码库可以整个塞进去 |
| 最大输出 | 128K Token | 长文件改写不用分段 |
| 模态 | 仅文本 | 截图、图片理解需求别找它 |
| 思考模式 | 强制开启,不可关闭 | 每次调用都有推理开销,计费要想清楚 |
| 推理档位 | low / high / max,默认 max | 不显式指定就按最深的档位跑 |
| 接入渠道 | GLM Coding Plan 已全量;模型 API 近期上线 | 现在想用,走 Coding Plan |
基准成绩挑几个有代表性的:DeepSWE v1.1 从 46.2 升到 66.9;在 Z.ai Code Bench 的 Max 档位下准确率 34.5%,每项任务平均输出约 7.5 万 Token——而 GLM-5.2 是 23.4% 配 9.6 万 Token。更准,还更省输出 Token,这对按量计费的用户是双重利好。官方对比里,High 档位的 GLM-5.3(31.4%,约 5 万输出 Token)已经超过了 Claude Opus 4.8(29.5%,约 12 万输出 Token)。
另一个意外收获是网络安全能力:漏洞发现基准 CyberGym 得分 84.5% 当前第一;智谱与安全团队合作用模型扫真实代码库,在 269 个项目里发现了 2,436 个漏洞,其中 1,097 个中高危,最久的一个在代码里潜伏了约 40 年。如果你做代码安全审计,这个方向值得专门测试。
二、现在怎么用上:Coding Plan 是正门
模型 API 官方标注"将于近期上线",所以当下唯一正经入口是 GLM Coding Plan——订阅制,在 Claude Code 等编程智能体里直接切换模型即可用。新版 Coding Plan 采用积分配额制,一个值得利用的规则:非高峰时段(含周末全天)调用只消耗标准积分的 50%,批量重构、长跑 Agent 任务尽量排到晚上或周末。
以 Claude Code 为例,接入大致三步:
# 1. 订阅 GLM Coding Plan 后在智谱开放平台拿到 API Key
# 2. 把 Claude Code 的端点指向智谱的 Anthropic 兼容接口
export ANTHROPIC_BASE_URL="https://open.bigmodel.cn/api/anthropic"
export ANTHROPIC_AUTH_TOKEN="你的智谱 API Key"
# 3. 启动后把模型切换为 glm-5.3 即可
官方同时公布了三种协议的接入端点,等 API 正式开放后按你的技术栈选:OpenAI Chat Completion 协议走 https://open.bigmodel.cn/api/paas/v4,OpenAI Response 协议走 https://open.bigmodel.cn/api/v1,Anthropic Message 协议走上面那个 /api/anthropic。注意一个限制:订阅过 Coding Plan(含已过期)的账号,暂时只能用 OpenAI Chat Completion 协议调用模型 API。
三、low / high / max 三档推理怎么选
GLM-5.3 的思考功能是永远开启的,你唯一能调的是强度。官方建议 Coding 等复杂任务用 max,但所有调用都跑 max 既慢又贵,按任务分档才是正解:
- low(轻量推理):日常问答、简单补全、写 commit message、解释报错。响应快,适合高频交互场景。
- high(增强推理):中等复杂度的功能开发、代码审查、单文件重构。官方数据里这一档的性价比最突出,建议作为日常默认。
- max(深度推理,默认档):跨文件架构调整、疑难 bug 定位、长程 Agent 任务、安全审计。准确率和 Token 效率的提升主要在这一档体现。
调用时显式传参,别吃默认值:
{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "high"
}
四、从 GLM-5.2 迁移:一个必踩的坑
如果你的现有代码里写着 thinking.type: "disabled"——这在 GLM-5.2 时代是合法且常见的省 Token 写法——直接把模型 ID 换成 glm-5.3 后请求会失败。官方迁移要求只有两步:
- 把
thinking.type改为"enabled"; - 把
reasoning_effort显式设为"low"(这是原来"关闭思考"最接近的替代)。
建议在切换前全局搜一遍代码库里的 disabled 和模型 ID 硬编码,一次改完。其余能力——流式输出、Function Calling、上下文缓存、JSON 结构化输出——都保持支持,不需要改接入代码。
五、注意事项与常见问题
- API 还没全量开放:按 Token 计费的独立 API 分阶段开放中,价格未公布。等 API 的用户可以先关注官方文档,Coding Plan 用户不受影响。
- 纯文本模型:GLM-5.3 目前只处理文本模态,多模态需求需要搭配其他模型。
- 强制思考意味着成本下限:没有"关掉思考省一把"的选项了,预算敏感的高频简单调用务必用 low 档,并把简单任务路由给更便宜的小模型。
- 峰值准确率仍有差距:官方自测里 Max 档 34.5% 对 Claude Fable 5 的 39.5% 还有距离,尖端难题不必强行用它死磕。
小结
GLM-5.3 是"后训练撬动基座"路线的一次漂亮验证:不换底座,编程能力提 50%,Token 效率反而更好,还顺手把网络安全能力推到了开源模型一线。上手记住四件事:现在走 Coding Plan 接入,非高峰时段积分半价别浪费;三档推理按任务难度显式指定,日常用 high 性价比最高;从 5.2 迁移先全局改掉 thinking.type: "disabled",否则直接报错;API 按量计费再等官方开放。把它放进编程 Agent 里跑一周真实任务,对比一下完成率和 Token 账单,你会得到自己的答案。
