GPT-6 Luna API 价格:批处理、缓存和重试费用怎么算

用每千条提取任务的明确假设计算 GPT-6 Luna 成本,区分 Standard、Batch、Fast 和长上下文,避免把桌面访问当成免费 API。

浅色卡片上的印章黑色线描,配几何图形与文章英文标题。

GPT-6 Luna 在 OpenAI 直连 Standard 短上下文下,普通输入每百万 token 0.10 美元,输出 0.50 美元。 批量分类或提取的纯 token 费用可以很低,但无效输出、人工检查和重试同样属于任务成本。

以下依据 Luna 模型页官方价格,于 2026 年 9 月 23 日核对,单位为美元/百万文本 token。本文不是 Ofox 报价,也没有把低单价当作准确率实测。

不同处理模式的费率

模式与输入规模普通输入缓存读缓存写输出
Standard,不超过 272K0.100.010.1250.50
Standard,超过 272K0.200.020.250.75
Batch/Flex,不超过 272K0.050.0050.06250.25
Fast,不超过 272K0.200.020.251.00

门槛按单次请求计算,不按一个 batch 内所有独立请求的总 token 算。长输入的 Batch/Flex 使用长上下文 Standard 的一半,Fast 使用其两倍;地域处理等适用费用另查。不同模式不能自由组合成额外折扣。

1,000 条提取任务要多少钱

假设每条请求包含普通输入 2,000、计费输出 300 token,共 1,000 条独立请求;没有缓存、工具费或重试。

项目StandardBatch
200 万输入 token0.20 美元0.10 美元
30 万输出 token0.15 美元0.075 美元
合计0.35 美元0.175 美元

这是固定 token 数量的算术例子,不表示一份真实文件必然消耗这些 token。若 100 条各重试一次,且每次用量完全相同,合计变为 Standard 0.385、Batch 0.1925 美元。实际重试可能带更长提示和输出,应记录真实用量。

CSV 费用表Python 计算器提供上述计算,运行时不联网、不消耗推理额度。

Batch 适合能等待的任务

Batch 文档描述的是异步处理及 24 小时完成窗口,不是交互响应提速承诺。每条记录应有稳定 ID,取回结果后逐条核对成功、失败和过期状态,不能悄悄丢弃没有输出的记录。

校验至少分两层:JSON 是否符合 Schema,字段值是否符合原文。合法 JSON 里仍可能有错误金额、虚构分类或遗漏限定条件。失败后是重试、交给更强模型还是人工检查,应在预算中提前考虑。

有复用,才可能有缓存收益

缓存读比普通输入便宜,首次写入却更贵。重复使用的指令前缀可能带来后续节省,只出现一次的独特文档不会自动获得读取折扣。

普通输入、缓存读、缓存写必须互不重叠。若某段前缀按写入计费,不要再算普通输入。估算时同时考虑首次写入和实际命中,而不是把所有输入都当缓存读。

发布公告列出的旧 Luna 促销价为输入 0.20、输出 1.20 美元。新输入价下降 50%,输出价约下降 58.3%;不能把所有计费项统称“恰好降价一半”。

用验收结果决定是否采用 Luna

官方将 Luna 定位为聚焦、高吞吐任务模型。可以据此选择评测起点,但应准备包含普通和困难记录的样本,在看结果之前定义验收标准,并保留误分类等失败样本。

GPT-6 选型指南说明何时考虑 Sol/Astra;工具接入先看 Responses 参数检查。只想尝试桌面模型时,请看入口指南,不要把桌面套餐权益换算成免费 API。

常见问题

一个很大的 batch 会触发长上下文加价吗?
门槛看每条请求的输入量,不是所有独立请求的合计。
0.35 美元是实测结果吗?
不是。它假设 1,000 条请求各有 2,000 输入和 300 输出 token,没有缓存、工具费及重试。
Free 或 Go 用户调用 API 免费吗?
桌面访问与 API 计费不同,不能从套餐名称推断 API 免费。