GLM-5.3-Flash 对比 DeepSeek V4 Flash:谁便宜,得看你几点调用
DeepSeek 的价按小时浮动,一周 21% 的时间翻倍;GLM 的便宜带到期日。缓存命中率不过 75%,DeepSeek 的低价缓存救不回它的输出价。
这两个模型都叫 Flash,而且都没有「一个价格」。 DeepSeek V4 Flash 的单价按小时浮动,一周有 21% 的时间自动翻倍;GLM-5.3-Flash 的低价是一次带到期日的促销,2026-09-09 结束。所以「谁更便宜」这个问题,在你说清楚几点调用、缓存命中率多少、输出占多大比重之前,是没有答案的。
好消息是这三件事都能算,而且不需要跑分——两家的价格结构都是公开文档写死的。
下面的数字都来自 DeepSeek 定价文档、Z.ai 定价页与两家模型文档,2026-08-28 当日回源。利益披露:Ofox 同时转售这两个模型,其中一条对我们不利的事实写在第四节。
两个 Flash 的价目表分别长什么样?
先把四张价目表摊开。每百万 token,美元。
| GLM-5.3-Flash 牌价 | GLM 五折价 | DeepSeek 谷时 | DeepSeek 峰时 | |
|---|---|---|---|---|
| 未命中输入 | 0.15 | 0.075 | 0.22 | 0.44 |
| 缓存命中输入 | 0.03 | 0.015 | 0.007 | 0.014 |
| 输出 | 0.50 | 0.25 | 0.66 | 1.32 |
两个「第二列」的性质完全不同,这点值得先说清楚。
GLM 的 $0.075 是促销。Z.ai 定价页原文:「GLM-5.3-Flash is available at a 50% discount (strikethrough prices are list prices). The promotion ends at 24:00 on September 9, 2026 (UTC+8, Singapore time).」到期之后回到 $0.15,是一次性的。
DeepSeek 的谷时价不是促销,是常设结构。定价页写着峰时为「01:00 - 04:00 and 06:00 - 10:00 UTC, Monday through Friday」,其余一律谷时,且「Off-peak rates are half of the peak rates」。每周 35 小时峰时,占 168 小时的 21%——约 79% 的时间你付的是那个便宜一半的价。
换成北京时间是 09:00–12:00 与 14:00–18:00,正好压在国内团队的工作时段上。如果你的流量跟着人上下班走,你拿到的谷时比例会明显低于 79%。
为什么「谁更便宜」没有单一答案?
因为两家在三条计费线上的胜负是反的。
拿 GLM 牌价对 DeepSeek 谷时价,逐行看:
| 计费线 | GLM 牌价 | DeepSeek 谷时 | 谁便宜 |
|---|---|---|---|
| 未命中输入 | $0.15 | $0.22 | GLM,1.47 倍 |
| 输出 | $0.50 | $0.66 | GLM,1.32 倍 |
| 缓存命中输入 | $0.03 | $0.007 | DeepSeek,4.29 倍 |
DeepSeek 的缓存便宜得离谱,但输出更贵。 这不是小数点级的差别:4.29 倍对 1.32 倍,两个方向都够大,谁赢完全取决于你的账单里这两项各占多少。
一个只做长文档分类、每次输出十几个 token 的活,账单几乎全在输入上,缓存那一行说了算。一个写代码、每次吐几千 token 的 agent,输出那一行说了算。同样两个模型,两种活,结论相反。
缓存命中率要多高,DeepSeek 才反超?
这条可以精确算出来,因为它只依赖公开价格。
设输入里有 h 的比例命中缓存,输出 token 量是输入的 r 倍。DeepSeek 谷时更便宜的条件是:
0.22(1−h) + 0.007h + 0.66r < 0.15(1−h) + 0.03h + 0.50r
化简后:h > (0.07 + 0.16r) / 0.093
代进去:
| 输出量占输入 | DeepSeek 需要的缓存命中率 |
|---|---|
| 可忽略 | 超过 75% |
| 2% | 超过 79% |
| 5% | 超过 84% |
| 10% | 超过 92% |
| 14.4% 以上 | 做到 100% 也追不回来 |
这就是那个反直觉的结论:只要输出量超过输入的约 14.4%,DeepSeek 那个便宜 4.3 倍的缓存价就再也救不回它的输出价。 缓存折扣只作用在输入上,而输出那一行没有任何折扣可打。
所以判断该用哪个,不用跑分,先去日志里查两个数:缓存命中率,以及输出 token 与输入 token 的比值。多数对话式和写作类负载的 r 远高于 14.4%,这些活直接选 GLM 就行。真正落在 DeepSeek 一侧的是长上下文、高重放、短输出那一类——正好是 agent 循环反复重放同一份长系统提示的形状。同类负载的取舍我们在 Gemini 3.1 Flash Lite 对比 DeepSeek V4 Flash 的高并发 agent 循环里单独算过。
经 Ofox 调 DeepSeek,为什么只有峰价?
这一条对我们自己不利,但接入前你该知道。
我们的 DeepSeek V4 Flash 模型页挂的是输入 $0.44、输出 $1.32、缓存读 $0.014。把这三个数和上面那张表对一遍——与 DeepSeek 的峰时价一字不差。
也就是说走我们的网关调这个模型,你全天都按峰价结算,拿不到那 79% 时间的谷时折扣,三项都相当于直连谷时价的两倍。要那个折扣,直连 DeepSeek。
GLM 那边我们是另一种做法:GLM-5.3-Flash 模型页挂 $0.075 输入、$0.25 输出、$0.015 缓存读,是把 Z.ai 的五折促销原样透传,牌价划掉摆在旁边。所以促销 09-09 结束时,这一页的价格会跟着回到 $0.15 和 $0.5。
两条路子不同,带来的实际后果是:在我们这里比价,GLM 会显得比它在公平口径下更占优。 如果你拿网关价直接做决策,记得把 DeepSeek 那一列除以二再看一遍。
除了价格,还有哪几处硬差别?
三处,都写在各自文档里。
输出上限差 2.9 倍。 DeepSeek V4 Flash 的最大输出是 384K,GLM-5.3-Flash 是 131,072。上下文两边都是 1M,所以差别不在你能塞进去多少,而在它一次能吐出来多少。要一次生成超长报告或大批量结构化数据,131K 是会撞到的墙。
协议与并发。 DeepSeek 同时提供 OpenAI 与 Anthropic 两种格式的端点(https://api.deepseek.com 与 https://api.deepseek.com/anthropic),文档标注 flash 档并发上限 2500,且默认开启思考模式、可切非思考模式。迁移 Anthropic 生态的工具链时这一条能省不少活。
权重与架构。 GLM-5.3-Flash 是开源权重,320B 总参、18B 激活、45 层,Z.ai 称其为首个采用稀疏注意力加线性注意力混合架构的开源前沿模型。这三个数各自决定什么,我们在 GLM-5.3-Flash 便宜九倍那篇里拆过。DeepSeek 的 API 文档没有对 V4 Flash 的权重开放情况作说明,这一项我们没有可引用的一手材料,不下判断。
那到底该怎么选?
四步,按能省下多少排。
- 先去日志里取两个数,不要先看价目表:缓存命中率,以及输出 token 与输入 token 的比值。这两个数一出来,上面那张交叉表直接给答案。
- 输出占输入超过 14.4% 的负载,选 GLM。 这一档里 DeepSeek 的缓存优势在数学上不可能翻盘,不用再算。
- 长上下文、高重放、短输出的活,把 DeepSeek 直连纳入比价。 但要算你实际落在谷时的比例,别直接用 79%——如果流量跟着国内工作时间走,峰时那 7 小时会吃掉相当一部分。
- 把 09-09 写进日历。 GLM 现在的单价会翻倍回牌价。按牌价重算一遍,看结论会不会翻。牌价下 GLM 在未命中输入和输出上依然领先,所以多数情况下结论不变,但值得你自己确认一次。
同代满血版的接入细节在 GLM 5.3 API 的价格与端点,DeepSeek 侧的省钱杠杆在 DeepSeek V4 Flash 涨价前的 6 个杠杆。
两家把定价规则都写在明面上了,连峰时的具体钟点都标了出来。真正要做的不是猜谁便宜,是先量一下自己的负载长什么样。
参考
常见问题
- GLM-5.3-Flash 和 DeepSeek V4 Flash 哪个便宜?
- 没有单一答案,因为两边都不止一个价。DeepSeek 按时段浮动,谷时每百万 token 输入 $0.22、输出 $0.66,峰时翻倍到 $0.44 和 $1.32;GLM 是牌价 $0.15 和 $0.5,现在五折 $0.075 和 $0.25,促销 2026-09-09 到期。未命中输入和输出这两项 GLM 都更便宜,DeepSeek 唯一压倒性占优的是缓存命中输入:谷时 $0.007 对 GLM 牌价 $0.03,便宜 4.3 倍。
- DeepSeek 的峰时是几点?
- 按 DeepSeek 定价页原文,峰时是 UTC 时间周一至周五的 01:00–04:00 与 06:00–10:00,其余时段一律谷时价,谷时为峰时的一半。算下来每周 35 小时是峰时,占 168 小时的 21%,也就是约 79% 的时间你付的是打折价。北京时间对应 09:00–12:00 与 14:00–18:00,恰好压在国内工作时段上。
- 缓存命中率要多高,DeepSeek 才比 GLM 便宜?
- 取决于你的输出量。拿 DeepSeek 谷时价对 GLM 牌价算:输出量可忽略时,缓存命中率要超过 75% DeepSeek 才更便宜;输出量占输入 5% 时要超过 84%;占 10% 时要超过 92%;一旦输出量超过输入的约 14.4%,命中率做到 100% 也追不回来。DeepSeek 的缓存便宜 4.3 倍,但输出贵 1.3 倍,两个方向互相抵消。
- 经网关调 DeepSeek 和直连有什么差别?
- 价格结构会变。Ofox 的 DeepSeek V4 Flash 页面挂的是 $0.44 输入、$1.32 输出、$0.014 缓存读——与 DeepSeek 的峰时价一字不差,也就是说走网关你全天都按峰价付,拿不到那 79% 时间的谷时折扣,三项都相当于直连谷时价的两倍。这一条对我们自己不利,但你该在接入前知道。
- 除了价格,两者还有什么硬差别?
- 输出上限差得最多:DeepSeek V4 Flash 最大输出 384K,GLM-5.3-Flash 是 131,072,差 2.9 倍,上下文都是 1M。DeepSeek 默认开思考模式并同时提供 OpenAI 与 Anthropic 两种协议端点,文档标注 flash 档并发上限 2500。GLM 这边的差异化在权重开源与架构,320B 总参、18B 激活、45 层。


