LLM API 价格:牌价没写的 6 项成本

缓存读写反向定价、峰谷计费、上下文阈值翻倍、没算进 completion 的推理 token、聚合器平台费、订阅与按量的取舍,外加十六个模型的现价页索引。

LLM API 价格:牌价没写的 6 项成本

摘要:模型页上那个「每百万 token 多少钱」是计算的起点,不是答案。它和你的账单之间隔着六个机制,每一个的影响都可能超过换一家厂商。这一页把六个都点名,链到每一个背后的实测,并索引我们持续维护的各家现价页。

Last updated 2026-08-31。下面引用的倍数是当天从各家自己的缓存与定价文档里读的。

牌价没写的六项成本是什么?

1. 为什么缓存有时反而让账单更贵?

在当前的旗舰模型上,缓存的两头都被重新定价了,而其中只有一头是折扣。Anthropic 把倍数直接写了出来:

5-minute cache write tokens are 1.25 times the base input tokens price · 1-hour cache write tokens are 2 times the base input tokens price · Cache read tokens are 0.1 times the base input tokens price

OpenAI 在 GPT-5.6 及以后落到了同样的形状,「cache writes cost 1.25× the standard, uncached input-token rate」,读取是该费率的 0.1 倍;更早的 OpenAI 模型完全不收缓存写入费。所以缓存是一场对命中率的赌:写一次读一次,你付的是普通 input 成本的 1.35 倍而不是 2 倍;写进去从不读回来,你就是单纯多付了 25%。

两家的实现差异大到会影响你的架构:Anthropic 与 OpenAI 的提示词缓存 有成本算法和三个缓存未命中的修法。命中率高时真实账单长什么样,LLM API 缓存命中算法 算的是定价页暗示 $50、账单却写 $4 的那个案例。还有一个会击穿直觉的细节:DeepSeek 匹配的是完整的前缀单元而不是逐字节前缀,所以在错误的位置改一个字符就可能把整次命中丢掉。

2. 为什么同样的负载下午三点比凌晨三点贵?

DeepSeek 在 2026-08-16 的 UTC 16:00 把整个 V4 系列改成了峰谷计费。同一份负载在一天里的两个时间跑,出来是两个账单,而任何在那个日期之前建的成本模型,错的是一个倍数而不是一个百分点。

DeepSeek API 涨价 里有窗口和每档的倍率。涨价后少付钱的六种方法 是应对那一面。

3. 为什么多一个 token 会让整个请求翻倍?

这是最让人意外的一条。Grok 4.6 在提示词到 200K token 之前是每百万输入 $2、输出 $6。过了这条线,请求里的每一个 token 都按双倍计费,不只是超出阈值的那部分。201K token 的提示词不是比 199K 的略贵,是贵一倍。

200K 悬崖,以及什么时候 4.5 更划算 里有算法和临界点。

4. 为什么你的成本估算器会低估推理模型?

如果你的估算器算的是 prompt_tokens × input + completion_tokens × output,先确认这个模型的推理 token 在不在 completion_tokens 里。在 Grok 4.6 上不在。在一份实测的编程负载上,这个公式把计费的输出低估了 77%,把整次调用低估了约 71%。

Opus 5 对比 Grok 4.6 成本 就是这个问题浮出来的那次正面对比:账单是 3.6 倍,产出的代码是 1.75 倍,而账只有在把推理 token 正确计入之后才对得平。

5. 聚合器是按 token 收还是按钱收?

OpenRouter 不在厂商费率之上加每 token 的加价。它收的是信用卡充值的 5.5% 平台费,用加密货币降到 5%,另外还有一笔固定的单笔手续费,让小额充值按比例更亏。这是和「加价」形状完全不同的一种成本,也意味着解法是一次充多点,而不是换模型。

OpenRouter 收的每一笔费用逐项拆解 里有完整明细。

6. 订阅什么时候比按量 key 更差?

一份固定月费把可变成本变成了固定成本,这本身有价值。它同时也把「花钱问题」变成了「可用性问题」:窗口耗尽时,你是停工,而不是多付钱。

Grok Build 每月 30 美元对上 API 每百万约 1 美元 是完整的对比推演。Codex 周上限与一把能封顶花费的按量 API 是同一笔交易从另一面看:带硬上限的按量 key 同时给你可预测性和继续干活的能力。

每个模型的现价在哪一页?

价格按月在动,所以这个索引指向的是我们为每个模型维护的那一页,而不是复述会过期的数字。

厂商页面它解决什么更新于
OpenAIGPT-5.6 Terra 对比 GPT-5.5半价,以及编程产出是否顶得住2026-07-10
OpenAIGPT-5.4 Pro API 指南定价,以及 Pro 档什么时候值2026-04-28
AnthropicClaude Opus 5 APIFable 5 级别的产出,半价2026-07-26
AnthropicSonnet 5 对比 Opus 4.8纸面便宜 60%,以及这个结论在哪成立2026-07-01
xAIGrok 4.6 API 定价200K 悬崖,以及 4.5 什么时候仍然更划算2026-08-19
xAIGrok Build 对比 API订阅对上按量2026-08-29
GoogleGemini 3.7 Flash API$0.75 的费率,以及那个会返 400 的参数2026-08-21
DeepSeekDeepSeek API 定价指南官方每百万 token 费率2026-08-18
DeepSeekV4 Pro 0813价格、开放权重、跑分2026-08-17
DeepSeek牌价背后的真实成本缓存命中与未命中之间的 120 倍差2026-08-17
Z.aiGLM 5.3 API定价、端点和 reasoning_effort2026-08-19
阿里Qwen 3.8 Max价格、上下文窗口、开放权重2026-08-03
MoonshotKimi K3 对比 GLM-5.2 每次运行成本前沿模型值不值 2.8 倍2026-07-17
MiniMaxMiniMax M2.7 API 定价免费额度、接入,以及横向位置2026-08-17
聚合器OpenRouter 定价逐项拆解每一笔真实费用2026-08-31
视频AI 视频 API 每条可用片成本为什么每秒单价是最小的一项2026-08-26

如果你要的是一张跨厂商的总表而不是一家一页,AI API 价格对比 把二十三个模型并排放在一起,带缓存和批处理的算法。引用里面任何数字之前先看它的日期行:正文声明的核对时间是 2026 年 5 月下旬,之后有几家的价格已经动了,DeepSeek 动得最多。

视频定价的机制差异大到需要自己的一张地图。Seedance API 指南 里是按秒、按分辨率的那套结构。

不换模型怎么少付钱?

四条路,大致按每投入一小时的回报排序。

  1. 按任务分流。 Claude Code 里的混合路由 把便宜的那 90% 轮次发给便宜模型,成本降约 80%。把 AI API 成本降 60% 是通用版。
  2. 用真的能用的免费额度。 编程场景免费 LLM API 额度排名 把有真实上限的和第一次跑 agent 循环就死掉的分开了。分模型看:DeepSeek V4 FlashGLM 5.2Kimi K2.7 Code
  3. 把现成的折扣拿掉。 低于牌价的 LLM API 列了 13 个当前低于牌价的模型。
  4. 把下限封住。 一个硬性花费上限,会把失控的循环从一张账单变成一个报错,而报错更便宜。如果你在处理这些报错,LLM API 报错码 讲了哪些计费失败以 402 的形式到达、哪些以 429 到达。

参考信息来源

常见问题

为什么账单比模型页上的价格高?
两个数字之间隔着六件事:缓存写入是普通 input token 的 1.25 到 2 倍而缓存读取只有 0.1 倍、有的厂商现在按时段计费、有的在上下文超过阈值后整个请求翻倍而不是只翻超出部分、推理 token 可能不在你的估算器读的 completion_tokens 里、聚合器把平台费收在充值上、订阅制和按量计费的算法完全不同。这里每一项的影响都比换一家厂商更大。
现在哪家 LLM API 最便宜?
这个问题不稳定到我们已经不用一个名字回答它了。价格按月在动:DeepSeek 在 2026 年 8 月把整个 V4 系列改成了峰谷计费,Grok 4.6 在超过 200K 上下文后所有 token 价格翻倍,各种折扣活动来了又走。按你的负载形态选,然后去厂商自己的页面上核当前那个模型的现价。
提示词缓存到底省不省钱?
对合适的负载省得很多。Anthropic 的缓存读取是基础 input 的 0.1 倍,写入是 1.25 倍(5 分钟)或 2 倍(1 小时);OpenAI 在 GPT-5.6 及以后用同样的 1.25 倍写入和 0.1 倍读取,更早的模型不收写入费。所以写进去却从没读回来,等于多付 25%;写一次读一次是 1.35 倍而不是 2 倍。各家的命中规则也不同,DeepSeek 匹配的是完整的前缀单元,不是逐字节前缀。
一个月 30 美元的编程订阅比按量 API 便宜吗?
完全取决于你实际推多少 token,而且临界点比大多数人以为的低。Grok 那个案例我们算过:每月 30 美元对上 API 每百万 token 约 1 美元。订阅在高强度交互式使用上赢,在自动化或者突发型负载上输,那种场景下一把带花费上限的按量 key 既更便宜也更可预测。
聚合器会在 token 单价上加价吗?
OpenRouter 不在厂商费率之上加每 token 的加价,它收的是信用卡充值的 5.5% 平台费,这是另一种机制、另一套算法。用加密货币支付降到 5%,另外还有一笔固定的单笔手续费,会让小额充值按比例变得更贵。