GLM 5.3:跑分、API 接入与开源权重时间表(2026)
GLM 5.3 的独立 API 已开放,与 5.2 同价。这里有官方规格、全部跑分、权重进度,以及 thinking 关不掉之后的迁移成本实测。
GLM 5.3 发布时没有按 token 计费的 API,五天之后这个口子补上了:独立 API 已开放,$1.4 输入 / $4.4 输出,与 GLM 5.2 同价,OpenRouter 和第三方网关也都上架了。 现在只剩权重还没放。模型沿用 GLM 5.2 的基座,全部提升来自后训练。
发布时间: 2026-08-14(Z.ai 发布说明)
基座模型: 与 GLM 5.2 相同,提升全部来自后训练
规格: 1M 上下文,最大输出 128K(Z.ai 模型页)
价格: $1.4 输入 / $0.26 缓存输入 / $4.4 输出,与 GLM 5.2 同价
开源权重: 仍未公开,HuggingFace 仓库返回 401
编程能力: Terminal Bench 3.0 从 4.6 到 28.3,开源模型 SOTA
破坏性变更: thinking.type "disabled" 取消;reasoning_effort 只剩 low/high/max
独立 API: 已开放,api.z.ai,三种协议
其他入口: OpenRouter、各家聚合网关、GLM Coding Plan、ZCode
快照日期: 2026-08-19
GLM 5.3 是什么?
它是 GLM 5.2 的一次后训练升级,不是新的模型家族。 这话是 Z.ai 自己在 GLM-5.3 发布说明第一段写的:模型「用的是和 GLM-5.2 相同的基座」,「所有提升都来自后训练」。
- 基座权重与
z-ai/glm-5.2完全一致,上面多加了一个月的强化学习 - 训练环境是合成的长程任务,有些任务放给资深工程师做也要好几天
- 目标很明确,就是 agent 编程:终端任务、仓库级改动、多步工具调用
- 发布说明里还有很长一节讲安全研究能力,不在本文范围内,感兴趣直接看原文
r/LocalLLaMA 的发布贴几小时内冲过 800 赞、赞同率 0.99,热评都盯着一件事:一个 743B 量级的模型在和大得多的对手掰手腕。不过这个参数量是社区自己算的,官方没公布过,所以别当事实引用。
GLM 5.3 什么时候发布的?
2026 年 8 月 14 日,当天就对 GLM Coding Plan 订阅用户全量开放。
各个入口的开放进度并不齐,去找之前先看这张表:
| 入口 | 2026-08-14 状态 | 2026-08-19 状态 |
|---|---|---|
| Z.ai 发布说明 | 已发布 | 未变 |
| GLM Coding Plan / ZCode | 全量可用 | 全量可用 |
| Z.ai 文档模型页 | 还没上 | 已上线,1M 上下文 + 128K 输出 |
| 独立模型 API | 「即将上线」,未给日期 | 已开放,api.z.ai 三种协议 |
| Z.ai 定价表 | 最高只到 GLM 5.2 | 已有 GLM-5.3 行,$1.4 / $0.26 / $4.4 |
| OpenRouter 目录 | 没有 | z-ai/glm-5.3,上下文 1,048,576 |
| 包括 ofox 在内的各聚合网关 | 尚未上架 | z-ai/glm-5.3 已上架 |
| HuggingFace 权重 | 仓库已建,未公开 | 仍返回 401 |
五天时间,从只有订阅能用变成除权重外全线可用。这是 Z.ai 发版的固定节奏,方向值得记住:套餐先拿到模型,按量 API 隔几天跟上,权重最后放。
GLM 5.3 开源了吗?
还没有。Z.ai 承诺在发布约两周后放出权重,条件是「安全评估和加固完成」。
这一条我们没有直接采信,而是实际去查了。HuggingFace 上 zai-org/GLM-5.3 仓库已经存在,通过 API 请求返回 401,而 zai-org/GLM-5.2 返回 200。401 而不是 404,说明仓库已经建好并处于受控状态,不是根本没有。这更像排好期的发布,而不是一句空话。8 月 19 日、也就是发布第五天再查,返回的仍然是 401,按两周算大概会落在 8 月底。
上一轮可以当参照。Simon Willison 在 2026 年 6 月 17 日记录过:「中国的 Z.ai 在 6 月 13 日把 GLM-5.2 交给 coding plan 订阅用户,昨天(6 月 16 日)就放出了 MIT 许可的完整开源权重。」上次隔了三天,这次官方说的是两周。许可证也值得盯一眼——5.2 是 MIT,5.3 用什么 Z.ai 还没说。
现在就要能下载的权重,那还是 GLM 5.2。我们的 GLM 5.2 本地部署指南讲了各档 GGUF 量化各自吃多少资源,自建成本与硬件配置里有 vLLM 的实测数据。5.3 和 5.2 共用基座,显存占用和部署形态基本不变——后训练升级唯一让人省心的地方就在这儿,容量规划不用重做。
GLM 5.3 多少钱?
输入 $1.40、缓存输入 $0.26、输出 $4.40,每 100 万 token。和 GLM 5.2 一模一样。 开发者文档的定价表已经有 GLM-5.3 这一行,价格与 5.2、5.1 逐项相同。
| 项目 | 价格 |
|---|---|
| 输入 | $1.40 / 100 万 token |
| 缓存输入 | $0.26 / 100 万 token |
| 缓存存储 | 免费,标注为限时 |
| 输出 | $4.40 / 100 万 token |
| GLM Coding Plan | 积分配额,输入、缓存输入、输出分别计 |
| 非高峰折扣 | 标准积分的 50% |
| 高峰时段 | 工作日 14:00–18:00(UTC+8) |
同价升级是少见的情况:定价这个问题自己就回答了自己,除非你要权重、或者要关掉思考,否则没有留在 5.2 的成本理由。这个持平的单价还盖住了一件事——按 Z.ai 自己的数据,GLM 5.3 的 token 效率更高,同一个任务应该更便宜,而不是持平。
真正省钱的是缓存那一行。$0.26 对 $1.40,重复前缀只花冷读的 19%,而且促销期内缓存写入免费。OpenRouter 挂的也是 $1.4 / $4.4、上下文 1,048,576,说明第三方是原价透传,没有加价。端点表、迁移顺序,以及每个 reasoning_effort 档位的实测单次成本,见我们的 GLM 5.3 API 接入与定价。
GLM 5.3 的上下文窗口有多大?
1M token,最大输出 128K,两个数字都是官方写明的。 Z.ai 的 GLM-5.3 模型页列了这一对,智谱中文文档口径一致。
不过 Z.ai 自己跑评测时并没有全都拉满,这反而透露了模型实际被压到什么程度:
| 评测 | 实际使用上下文 | 最大输出 |
|---|---|---|
| Terminal Bench 3.0 | 400K | 128K |
| Terminal Bench 2.1 | 未说明 | 65,536 |
| DeepSWE v1.1 | 400K | 未说明 |
| Agents’ Last Exam (CLI) | 1M | 64K |
| SWE-Marathon、PostTrainBench | 1M | 128K |
| NL2Repo | 1M | 64K |
| HLE with tools | 300,000,配上下文管理策略 | 163,840 |
如果你本来打算吃满这 100 万,这个差距值得留意:1M 是模型能接受的上限,而 400K 是 Z.ai 给自己主打的编程榜单选的值。将来提供 5.3 服务的 endpoint 也可能自己再压一档,以那边公布的数字为准。
GLM 5.3 编程能力强了多少?
新的 agent 类榜单上提升很大,已经跑饱和的老榜单上提升有限。 下面所有数字都出自 Z.ai 自己。Terminal Bench、SWE-Marathon、Agents’ Last Exam 用的是 Claude Code 2.1.207,reasoning effort 拉到 max;DeepSWE 用的是 mini-swe-agent。
| 评测 | GLM 5.3 | GLM 5.2 | Kimi K3 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal Bench 3.0 | 28.3 | 4.6 | 17.4 | 21.1 | 34.6 |
| Terminal Bench 2.1 | 88.2 | 81.0 | 88.3 | 85.0 | 88.8 |
| DeepSWE v1.1 | 66.9 | 46.2 | 67.5 | 58.0 | 72.7 |
| SWE-Marathon v1.1 | 42.5 | 19.4 | 48.1 | 48.8 | 42.5 |
| Agents’ Last Exam (CLI) | 28.5 | 23.8 | 27.6 | 25.7 | 28.6 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1588 | 1730 |
真正撑起这次发布的是 Terminal Bench 3.0 那一行:4.6 到 28.3,而 GLM 5.2 在这个榜单上基本算没参赛。换到 Terminal Bench 2.1,所有模型挤在 85 到 89 之间,同一次升级只值 7 分,排名一位没动。新榜单有空间显示变化,老榜单没有。
Z.ai 主推的其实不是分数,是 token。High 档下 GLM 5.3 在自家 Code Bench 上拿 31.4%,每题约 50K 输出 token;Claude Opus 4.8 是 29.5%,花掉 120K。
这条最值得自己验一遍,因为你付钱付的就是 token 数。Z.ai 还报了 Max 档 34.5%、约 75K token,对应 GLM 5.2 是 23.4%、96K。Claude Fable 5 在这个私有榜上仍以 39.5% 领先,Terminal Bench 3.0 的头名还是 GPT-5.6 Sol,所以准确的说法是「开源模型 SOTA」,不是「SOTA」。
整张表还有一点要提醒:它是一个私有榜加一批由厂商自己跑的公开榜。表里 Kimi K3 和 Claude Opus 4.8 的成绩是 Z.ai 跑的,不是各自厂商跑的。
升级 GLM 5.3 要改代码吗?
如果你关过思考,那就要改。thinking.type: "disabled" 已经取消,Z.ai 明说请求会直接失败。
新的约定:
thinking.type只接受enabledreasoning_effort接受low、high、max,默认max- 编程任务 Z.ai 建议用
max - 迁移顺序有讲究:先改成
enabled加reasoning_effort: "low",再换模型 ID
{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}
失去 disabled 的代价很容易被低估,所以我们在 2026 年 8 月 14 日拿 GLM 5.2 通过 OpenAI 兼容 endpoint 实测了一遍。同一条最简 prompt「Reply with the single word: ok」,每种配置跑三次:
| 请求配置 | 输出 token(3 次) |
|---|---|
| 默认(思考开启) | 144, 138, 90 |
reasoning_effort: "low" | 69, 86, 122 |
reasoning_effort: "max" | 101, 120, 102 |
thinking.type: "disabled" | 2, 2, 2 |
这么短的 prompt 上,思考档位之间的抖动比 low 和 max 的差距还大,所以别从这三行里读出什么排序。有意义的是最后一行:关掉思考每次都是 2 个输出 token,而最省的思考档也要 69 到 122。在 GLM 5.3 上,最后这一行没有了。
这张表测的是 GLM 5.2,而从它推出来的那个结论后来被推翻了。2026-08-19 直接在 GLM 5.3 上实测,一个单词答案的分类 prompt 在 reasoning_effort: "low" 下输出中位数是 3 个 token(10 次),max 是 105。5.3 上的地板不是 70 token,基本回到了当年 disabled 的水平。麻烦的是默认档就是 max,所以不显式设这个参数直接搬过去,拿到的就是 105 token 那一版。GLM 5.2 与 GPT-5.5 成本对比里有这类流量的具体算法。
GLM 5.3 支持哪些能力?
纯文本输入输出,外加思考模式、流式、Function Calling、上下文缓存、结构化输出。 这五项是 Z.ai 模型页当前列出的全部。
| 能力 | 状态 |
|---|---|
| 输入 / 输出模态 | 仅文本 |
| 思考模式 | low、high、max,不能关闭 |
| 流式输出 | 支持 |
| Function Calling | 支持 |
| 上下文缓存 | 支持 |
| 结构化输出 | 支持,含 JSON |
| MCP | 能力列表里已经不再列出 |
MCP 这一行值得单独说,因为它动过:8 月 15 日模型页的能力列表里还有 MCP 的链接,8 月 19 日就没有了,官方没有任何说明。所以别把 MCP 当成确定支持,接进去之前自己测一遍。
除此之外相对 GLM 5.2 没有任何新增,和「只做了后训练」的说法对得上。视觉、生图、语音仍在 GLM-5V 和 GLM-Image 那几条独立产品线上。
怎么用上 GLM 5.3?
现在有四条路:Z.ai 按量 API、GLM Coding Plan、ZCode,或者任何上架了 z-ai/glm-5.3 的聚合平台。
| 路径 | 能拿到什么 | 代价 |
|---|---|---|
| Z.ai 模型 API | 按 token 计费 $1.4 / $4.4,三种协议 | 订阅过 Coding Plan 的账号只能走一种协议,见下 |
| GLM Coding Plan | 积分配额,非高峰五折 | 订阅制,不是用多少付多少 |
| ZCode | Goal 模式、98%+ 缓存命中率、限时 1.5 倍配额(至 2026-08-31) | Z.ai 自家客户端 |
| Claude Code / Cline / OpenCode | 沿用现有工具,换个模型 | 走的是套餐配额,不是计量 key |
| 聚合平台与网关 | 一个 key 打通多模型 | 模型 ID 各家不同,OpenRouter 和 ofox 上都是 z-ai/glm-5.3 |
真正落地的 endpoint 和发布当天预告的那套不一样。模型页现在写的是:OpenAI Chat Completion 协议走 https://api.z.ai/api/coding/paas/v4,OpenAI Response 协议走 https://api.z.ai/api/v1,Anthropic Message 协议走 https://api.z.ai/api/anthropic。发布当天那份说明里的 open.bigmodel.cn/api/paas/v4 不是最终形态,别再照抄。更麻烦的是同一个页面里的 Quick Start 示例请求打的是 https://api.z.ai/api/paas/v4/chat/completions,没有 /coding 这一段——一个页面两个口径,其中一个 404 的话,先试另一个,别急着怀疑 key。
还有一条限制容易漏:凡是订阅过 GLM Coding Plan 的账号(包括已过期的),目前只能走 OpenAI Chat Completion 协议访问模型 API。
走聚合平台的话,改两行就行:
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.ofox.io/v1")
r = client.chat.completions.create(
model="z-ai/glm-5.3",
messages=[{"role": "user", "content": "Refactor this module and run the tests."}],
reasoning_effort="low", # 5.3 上没有 "disabled" 这个选项了
)
print(r.usage)
模型 ID 的前缀是 z-ai 而不是 zai,写错这一点是拿到下面这个报错最常见的原因:
{"error":{"message":"Model 'zai/glm-5.3' not found","type":"model_not_found","code":404}}
z-ai/glm-5.2 在同一个 endpoint、同一把 key 上就能跑,所以两个模型之间切换只是改一个字符串。key 的完整配置步骤见 GLM 5.2 接入教程。
昨天刚发的模型,怎么让编程工具用上?
只要工具允许你自己填 endpoint,改一个字符串就够了。 发布周的样子每次都一样:订阅产品第一天就有这个模型,计量 API 隔几天才开,文档页比公告晚一天,而你手上每个工具都写死了一份模型列表。GLM 5.3 从 8 月 14 日到 8 月 19 日把这套流程完整走了一遍,权重还排在队尾。
你能控制的只有一件事:换个模型要重新接多少管子。允许你设 base_url 和模型字符串的工具,遇到新模型就是改一行。锁死下拉框的工具,只能等它自己发版——r/opencodeCLI 上的帖子在公告一小时内就出现了,原因就在这里。
Claude Code、OpenCode 和大多数工具说的都是 OpenAI 兼容的 HTTP,所以一个 key 挂一个 base URL,就能让它们共用同一份账单和同一套故障切换。ofox 的同一个 endpoint 后面挂着约 130 个模型,z-ai/glm-5.3 和 z-ai/glm-5.2 都已上架,两者之间来回切就是上面那段代码,别的什么都不用动。
GLM 5.3 和 GLM 5.2 到底差在哪?
差在后训练,以及三件你需要动手应对的事:思考关不掉了、权重还下不到、Terminal Bench 3.0 从 4.6 变成了 28.3。
| GLM 5.3 | GLM 5.2 | |
|---|---|---|
| 基座模型 | 相同 | 相同 |
| 上下文 / 最大输出 | 1M / 128K | 1M / 128K |
| 公布 token 单价 | $1.40 / $0.26 / $4.40 | $1.40 / $0.26 / $4.40 |
| 计量 API | 已可用 | 已可用 |
| 聚合平台上架 | 已上,z-ai/glm-5.3 | 已上,z-ai/glm-5.2 |
| 权重 | 仍未公开 | 已公开,MIT |
| 关闭思考 | 不支持 | 支持 |
| 思考档位 | low / high / max,默认 max | 档位之外还有 disabled |
| Terminal Bench 3.0 | 28.3 | 4.6 |
价格这一项既然打平,真正还站得住的理由只剩一个:你要能下载的权重。另一个候选——为高频短请求保留 thinking.type: "disabled"——一实测就没了:5.3 上 low 回答分类 prompt 的输出中位数是 3 个 token。其余情况都指向 5.3,而且 GLM 5.2 接入教程可以原样套用,key、endpoint、请求结构都没变。
参考信息来源
- Z.ai 发布说明:GLM-5.3
- Z.ai 开发者文档:GLM-5.3 模型页
- Z.ai 开发者文档:定价
- Z.ai devpack 文档:GLM Coding Plan 概览
- 智谱开放文档:GLM-5.3
- HuggingFace:zai-org
- OpenRouter:z-ai/glm-5.3
- r/LocalLLaMA:GLM 5.3 Released
- r/opencodeCLI:GLM 5.3 is there!
- Simon Willison:GLM-5.2 is probably the most powerful text-only open weights LLM
- GLM 5.3 API 定价与端点、reasoning_effort 实测(ofox 博客)
- ofox 模型页:GLM 5.3
- ofox 模型页:GLM 5.2
常见问题
- GLM 5.3 的独立 API 现在能用了吗?
- 能用了。Z.ai 定价表已经有 GLM-5.3 这一行:输入 $1.4、缓存输入 $0.26、输出 $4.4,与 GLM 5.2 完全同价。OpenRouter 和包括 ofox 在内的网关也都已上架,模型 ID 是 z-ai/glm-5.3。GLM Coding Plan 仍是另一条按积分计费的路径。
- GLM 5.3 最大能输出多少 token?
- 128K,上下文窗口 1M,这两个数字写在 Z.ai 模型页上。智谱自己跑 benchmark 时用的上限还更低一些:Terminal Bench 3.0 和 PostTrainBench 是 128K,Agents' Last Exam 只有 64K。将来真正提供服务的那个 endpoint 可能还会有自己的上限。
- GLM 5.3 能配 Claude Code 用吗?
- 可以。Z.ai 把 Claude Code、Cline、OpenCode 列为 GLM Coding Plan 支持的编程工具,它自己跑分用的也是 Claude Code 2.1.207。注意别再传 thinking 关闭,改用 reasoning_effort,5.3 已经不接受关思考了。
- GLM 5.3 和 Kimi K3 谁更强?
- 按智谱自己那张表:Terminal Bench 3.0 是 28.3 对 17.4、AutomationBench 是 48.2 对 46.7,GLM 5.3 赢;Toolathlon 76.5 对 73.0、SWE-Marathon 48.1 对 42.5,Kimi K3 赢。这些数字全部由 Z.ai 跑出,当成厂商声明看,别当第三方结论。
- GLM 5.3 换基座了吗?
- 没有。Z.ai 明说 GLM 5.3 用的是和 GLM 5.2 完全相同的基座模型,所有提升都来自后训练。发布博文开头第一句就是「Scaling post-training is all we did for GLM-5.3」。
- GLM 5.3 有免费额度吗?
- 没有免费档。按量计费是输入 $1.4 / 输出 $4.4(每 100 万 token)。想少付钱只有两条路:缓存输入按 $0.26 计,缓存写入限时免费;或者订阅 GLM Coding Plan,非高峰时段调用只消耗标准积分的一半,高峰是工作日 14:00–18:00(UTC+8)。
- 哪里能下载 GLM 5.3 权重?
- 暂时哪里都下不到。发布五天后,HuggingFace 上 zai-org/GLM-5.3 通过 API 访问仍返回 401,而 GLM 5.2 返回 200。Z.ai 说安全评估和加固做完之后放权重,大约在发布后两周,也就是 8 月底前后。


