GPT-6 Luna API 价格:批处理、缓存和重试费用怎么算
用每千条提取任务的明确假设计算 GPT-6 Luna 成本,区分 Standard、Batch、Fast 和长上下文,避免把桌面访问当成免费 API。
GPT-6 Luna 在 OpenAI 直连 Standard 短上下文下,普通输入每百万 token 0.10 美元,输出 0.50 美元。 批量分类或提取的纯 token 费用可以很低,但无效输出、人工检查和重试同样属于任务成本。
以下依据 Luna 模型页和官方价格,于 2026 年 9 月 23 日核对,单位为美元/百万文本 token。本文不是 Ofox 报价,也没有把低单价当作准确率实测。
不同处理模式的费率
| 模式与输入规模 | 普通输入 | 缓存读 | 缓存写 | 输出 |
|---|---|---|---|---|
| Standard,不超过 272K | 0.10 | 0.01 | 0.125 | 0.50 |
| Standard,超过 272K | 0.20 | 0.02 | 0.25 | 0.75 |
| Batch/Flex,不超过 272K | 0.05 | 0.005 | 0.0625 | 0.25 |
| Fast,不超过 272K | 0.20 | 0.02 | 0.25 | 1.00 |
门槛按单次请求计算,不按一个 batch 内所有独立请求的总 token 算。长输入的 Batch/Flex 使用长上下文 Standard 的一半,Fast 使用其两倍;地域处理等适用费用另查。不同模式不能自由组合成额外折扣。
1,000 条提取任务要多少钱
假设每条请求包含普通输入 2,000、计费输出 300 token,共 1,000 条独立请求;没有缓存、工具费或重试。
| 项目 | Standard | Batch |
|---|---|---|
| 200 万输入 token | 0.20 美元 | 0.10 美元 |
| 30 万输出 token | 0.15 美元 | 0.075 美元 |
| 合计 | 0.35 美元 | 0.175 美元 |
这是固定 token 数量的算术例子,不表示一份真实文件必然消耗这些 token。若 100 条各重试一次,且每次用量完全相同,合计变为 Standard 0.385、Batch 0.1925 美元。实际重试可能带更长提示和输出,应记录真实用量。
CSV 费用表与Python 计算器提供上述计算,运行时不联网、不消耗推理额度。
Batch 适合能等待的任务
Batch 文档描述的是异步处理及 24 小时完成窗口,不是交互响应提速承诺。每条记录应有稳定 ID,取回结果后逐条核对成功、失败和过期状态,不能悄悄丢弃没有输出的记录。
校验至少分两层:JSON 是否符合 Schema,字段值是否符合原文。合法 JSON 里仍可能有错误金额、虚构分类或遗漏限定条件。失败后是重试、交给更强模型还是人工检查,应在预算中提前考虑。
有复用,才可能有缓存收益
缓存读比普通输入便宜,首次写入却更贵。重复使用的指令前缀可能带来后续节省,只出现一次的独特文档不会自动获得读取折扣。
普通输入、缓存读、缓存写必须互不重叠。若某段前缀按写入计费,不要再算普通输入。估算时同时考虑首次写入和实际命中,而不是把所有输入都当缓存读。
发布公告列出的旧 Luna 促销价为输入 0.20、输出 1.20 美元。新输入价下降 50%,输出价约下降 58.3%;不能把所有计费项统称“恰好降价一半”。
用验收结果决定是否采用 Luna
官方将 Luna 定位为聚焦、高吞吐任务模型。可以据此选择评测起点,但应准备包含普通和困难记录的样本,在看结果之前定义验收标准,并保留误分类等失败样本。
GPT-6 选型指南说明何时考虑 Sol/Astra;工具接入先看 Responses 参数检查。只想尝试桌面模型时,请看入口指南,不要把桌面套餐权益换算成免费 API。
常见问题
- 一个很大的 batch 会触发长上下文加价吗?
- 门槛看每条请求的输入量,不是所有独立请求的合计。
- 0.35 美元是实测结果吗?
- 不是。它假设 1,000 条请求各有 2,000 输入和 300 输出 token,没有缓存、工具费及重试。
- Free 或 Go 用户调用 API 免费吗?
- 桌面访问与 API 计费不同,不能从套餐名称推断 API 免费。


