LLM API 价格:牌价没写的 6 项成本
缓存读写反向定价、峰谷计费、上下文阈值翻倍、没算进 completion 的推理 token、聚合器平台费、订阅与按量的取舍,外加十六个模型的现价页索引。
摘要:模型页上那个「每百万 token 多少钱」是计算的起点,不是答案。它和你的账单之间隔着六个机制,每一个的影响都可能超过换一家厂商。这一页把六个都点名,链到每一个背后的实测,并索引我们持续维护的各家现价页。
Last updated 2026-08-31。下面引用的倍数是当天从各家自己的缓存与定价文档里读的。
牌价没写的六项成本是什么?
1. 为什么缓存有时反而让账单更贵?
在当前的旗舰模型上,缓存的两头都被重新定价了,而其中只有一头是折扣。Anthropic 把倍数直接写了出来:
5-minute cache write tokens are 1.25 times the base input tokens price · 1-hour cache write tokens are 2 times the base input tokens price · Cache read tokens are 0.1 times the base input tokens price
OpenAI 在 GPT-5.6 及以后落到了同样的形状,「cache writes cost 1.25× the standard, uncached input-token rate」,读取是该费率的 0.1 倍;更早的 OpenAI 模型完全不收缓存写入费。所以缓存是一场对命中率的赌:写一次读一次,你付的是普通 input 成本的 1.35 倍而不是 2 倍;写进去从不读回来,你就是单纯多付了 25%。
两家的实现差异大到会影响你的架构:Anthropic 与 OpenAI 的提示词缓存 有成本算法和三个缓存未命中的修法。命中率高时真实账单长什么样,LLM API 缓存命中算法 算的是定价页暗示 $50、账单却写 $4 的那个案例。还有一个会击穿直觉的细节:DeepSeek 匹配的是完整的前缀单元而不是逐字节前缀,所以在错误的位置改一个字符就可能把整次命中丢掉。
2. 为什么同样的负载下午三点比凌晨三点贵?
DeepSeek 在 2026-08-16 的 UTC 16:00 把整个 V4 系列改成了峰谷计费。同一份负载在一天里的两个时间跑,出来是两个账单,而任何在那个日期之前建的成本模型,错的是一个倍数而不是一个百分点。
DeepSeek API 涨价 里有窗口和每档的倍率。涨价后少付钱的六种方法 是应对那一面。
3. 为什么多一个 token 会让整个请求翻倍?
这是最让人意外的一条。Grok 4.6 在提示词到 200K token 之前是每百万输入 $2、输出 $6。过了这条线,请求里的每一个 token 都按双倍计费,不只是超出阈值的那部分。201K token 的提示词不是比 199K 的略贵,是贵一倍。
200K 悬崖,以及什么时候 4.5 更划算 里有算法和临界点。
4. 为什么你的成本估算器会低估推理模型?
如果你的估算器算的是 prompt_tokens × input + completion_tokens × output,先确认这个模型的推理 token 在不在 completion_tokens 里。在 Grok 4.6 上不在。在一份实测的编程负载上,这个公式把计费的输出低估了 77%,把整次调用低估了约 71%。
Opus 5 对比 Grok 4.6 成本 就是这个问题浮出来的那次正面对比:账单是 3.6 倍,产出的代码是 1.75 倍,而账只有在把推理 token 正确计入之后才对得平。
5. 聚合器是按 token 收还是按钱收?
OpenRouter 不在厂商费率之上加每 token 的加价。它收的是信用卡充值的 5.5% 平台费,用加密货币降到 5%,另外还有一笔固定的单笔手续费,让小额充值按比例更亏。这是和「加价」形状完全不同的一种成本,也意味着解法是一次充多点,而不是换模型。
OpenRouter 收的每一笔费用逐项拆解 里有完整明细。
6. 订阅什么时候比按量 key 更差?
一份固定月费把可变成本变成了固定成本,这本身有价值。它同时也把「花钱问题」变成了「可用性问题」:窗口耗尽时,你是停工,而不是多付钱。
Grok Build 每月 30 美元对上 API 每百万约 1 美元 是完整的对比推演。Codex 周上限与一把能封顶花费的按量 API 是同一笔交易从另一面看:带硬上限的按量 key 同时给你可预测性和继续干活的能力。
每个模型的现价在哪一页?
价格按月在动,所以这个索引指向的是我们为每个模型维护的那一页,而不是复述会过期的数字。
| 厂商 | 页面 | 它解决什么 | 更新于 |
|---|---|---|---|
| OpenAI | GPT-5.6 Terra 对比 GPT-5.5 | 半价,以及编程产出是否顶得住 | 2026-07-10 |
| OpenAI | GPT-5.4 Pro API 指南 | 定价,以及 Pro 档什么时候值 | 2026-04-28 |
| Anthropic | Claude Opus 5 API | Fable 5 级别的产出,半价 | 2026-07-26 |
| Anthropic | Sonnet 5 对比 Opus 4.8 | 纸面便宜 60%,以及这个结论在哪成立 | 2026-07-01 |
| xAI | Grok 4.6 API 定价 | 200K 悬崖,以及 4.5 什么时候仍然更划算 | 2026-08-19 |
| xAI | Grok Build 对比 API | 订阅对上按量 | 2026-08-29 |
| Gemini 3.7 Flash API | $0.75 的费率,以及那个会返 400 的参数 | 2026-08-21 | |
| DeepSeek | DeepSeek API 定价指南 | 官方每百万 token 费率 | 2026-08-18 |
| DeepSeek | V4 Pro 0813 | 价格、开放权重、跑分 | 2026-08-17 |
| DeepSeek | 牌价背后的真实成本 | 缓存命中与未命中之间的 120 倍差 | 2026-08-17 |
| Z.ai | GLM 5.3 API | 定价、端点和 reasoning_effort | 2026-08-19 |
| 阿里 | Qwen 3.8 Max | 价格、上下文窗口、开放权重 | 2026-08-03 |
| Moonshot | Kimi K3 对比 GLM-5.2 每次运行成本 | 前沿模型值不值 2.8 倍 | 2026-07-17 |
| MiniMax | MiniMax M2.7 API 定价 | 免费额度、接入,以及横向位置 | 2026-08-17 |
| 聚合器 | OpenRouter 定价逐项拆解 | 每一笔真实费用 | 2026-08-31 |
| 视频 | AI 视频 API 每条可用片成本 | 为什么每秒单价是最小的一项 | 2026-08-26 |
如果你要的是一张跨厂商的总表而不是一家一页,AI API 价格对比 把二十三个模型并排放在一起,带缓存和批处理的算法。引用里面任何数字之前先看它的日期行:正文声明的核对时间是 2026 年 5 月下旬,之后有几家的价格已经动了,DeepSeek 动得最多。
视频定价的机制差异大到需要自己的一张地图。Seedance API 指南 里是按秒、按分辨率的那套结构。
不换模型怎么少付钱?
四条路,大致按每投入一小时的回报排序。
- 按任务分流。 Claude Code 里的混合路由 把便宜的那 90% 轮次发给便宜模型,成本降约 80%。把 AI API 成本降 60% 是通用版。
- 用真的能用的免费额度。 编程场景免费 LLM API 额度排名 把有真实上限的和第一次跑 agent 循环就死掉的分开了。分模型看:DeepSeek V4 Flash、GLM 5.2、Kimi K2.7 Code。
- 把现成的折扣拿掉。 低于牌价的 LLM API 列了 13 个当前低于牌价的模型。
- 把下限封住。 一个硬性花费上限,会把失控的循环从一张账单变成一个报错,而报错更便宜。如果你在处理这些报错,LLM API 报错码 讲了哪些计费失败以 402 的形式到达、哪些以 429 到达。
参考信息来源
常见问题
- 为什么账单比模型页上的价格高?
- 两个数字之间隔着六件事:缓存写入是普通 input token 的 1.25 到 2 倍而缓存读取只有 0.1 倍、有的厂商现在按时段计费、有的在上下文超过阈值后整个请求翻倍而不是只翻超出部分、推理 token 可能不在你的估算器读的 completion_tokens 里、聚合器把平台费收在充值上、订阅制和按量计费的算法完全不同。这里每一项的影响都比换一家厂商更大。
- 现在哪家 LLM API 最便宜?
- 这个问题不稳定到我们已经不用一个名字回答它了。价格按月在动:DeepSeek 在 2026 年 8 月把整个 V4 系列改成了峰谷计费,Grok 4.6 在超过 200K 上下文后所有 token 价格翻倍,各种折扣活动来了又走。按你的负载形态选,然后去厂商自己的页面上核当前那个模型的现价。
- 提示词缓存到底省不省钱?
- 对合适的负载省得很多。Anthropic 的缓存读取是基础 input 的 0.1 倍,写入是 1.25 倍(5 分钟)或 2 倍(1 小时);OpenAI 在 GPT-5.6 及以后用同样的 1.25 倍写入和 0.1 倍读取,更早的模型不收写入费。所以写进去却从没读回来,等于多付 25%;写一次读一次是 1.35 倍而不是 2 倍。各家的命中规则也不同,DeepSeek 匹配的是完整的前缀单元,不是逐字节前缀。
- 一个月 30 美元的编程订阅比按量 API 便宜吗?
- 完全取决于你实际推多少 token,而且临界点比大多数人以为的低。Grok 那个案例我们算过:每月 30 美元对上 API 每百万 token 约 1 美元。订阅在高强度交互式使用上赢,在自动化或者突发型负载上输,那种场景下一把带花费上限的按量 key 既更便宜也更可预测。
- 聚合器会在 token 单价上加价吗?
- OpenRouter 不在厂商费率之上加每 token 的加价,它收的是信用卡充值的 5.5% 平台费,这是另一种机制、另一套算法。用加密货币支付降到 5%,另外还有一笔固定的单笔手续费,会让小额充值按比例变得更贵。


