GPT-6 Sol API 怎么收费?缓存和长上下文别算错

按输入、输出、缓存读写拆解 GPT-6 Sol 费用,说明超过 272K 输入后的整次请求计价,并提供可下载的费用表与本地计算器。

浅色卡片上的夹板黑色线描,配几何图形与文章英文标题。

GPT-6 Sol 在 OpenAI 直连 API 的 Standard 短上下文价格为:普通输入每百万 token 2 美元,输出 10 美元。 预算不能只乘这两项;缓存读写、输入长度和处理模式都会影响账单。

以下价格依据官方模型页定价文档,于 2026 年 9 月 23 日核对。单位均为美元/百万文本 token,属于 OpenAI 直连报价,不是 Ofox 目录价格或订阅额度。

先选对价格档

Standard 处理普通输入缓存读缓存写输出
输入不超过 272K20.202.5010
输入超过 272K40.40515

超过门槛后,长上下文费率用于整次请求,并非只对超出 272K 的部分加价。模型能容纳多长上下文是容量问题;账单从哪里涨价是另一件事。

Batch、Flex 是对应 Standard 费率的一半,Fast 是对应费率的两倍。这些处理模式不能随意叠乘。支持地域处理的情形还可能有附加费,当前 EU 数据驻留仅支持 Standard。应以实际请求使用的模式计算,而非事后从价格表挑最低一行。

缓存写入不能重复算普通输入

缓存文档将普通输入、缓存读和缓存写分开。按写入费率收费的 token,不应再算一次普通输入。

费用 = (普通输入 × 输入费率 + 缓存读 × 读取费率
      + 缓存写 × 写入费率 + 计费输出 × 输出费率) / 1,000,000

如果用量导出只有“总输入”和缓存细项,应先按供应商字段定义拆出互不重叠的数量。输出也应使用计费 token,包括适用时的推理用量,不能只数屏幕上看见的文字。

一个可以复算的例子

假设一次 Standard 短上下文请求有普通输入 20,000、缓存读 60,000、缓存写 20,000、计费输出 5,000 token。这些分类不重叠,例子是数学演示,不是模型实测。

项目算式美元
普通输入20,000 × 2 / 1M0.040
缓存读60,000 × 0.20 / 1M0.012
缓存写20,000 × 2.50 / 1M0.050
输出5,000 × 10 / 1M0.050
合计四项相加0.152

下载费率与例子 CSV本地计算器可以复算。程序不联网,不读取你的账单,也不会预测缓存命中率。

若普通输入变为 300,000,输出为 5,000,需整次采用长上下文费率:0.3 × 4 + 0.005 × 15 = 1.275 美元,另计适用费用。把前 272K 仍按短上下文计价会低估这笔费用。

比旧版便宜,不代表账单必然减半

发布公告将 GPT-6 Sol 的普通输入/输出 2/10 美元,与 GPT-5.6 Sol 之前的促销价 4/20 美元对照;这两个字段确实下降 50%。但一次任务的上下文、推理、工具操作和重试次数可能变化。

历史账单保留历史费率。把旧用量代入新价格只能回答假设问题,不能改变实际已经支付的金额。升级时应比较同一验收目标下的总费用和人工修复量。

按完成的任务记账

记录精确模型、供应商、模式、输入长度、缓存分类、输出、工具费用和验收结果,失败尝试也要保留。只统计成功请求会漏掉被丢弃结果的成本。

Sol 与 Opus 5.5 对比提供同口径计算框架;GPT-6 选型讨论任务起点。若购买网关服务,必须再次核对实际路由报价,不能把 OpenAI 直连价格套到 Ofox。

常见问题

超过 272K 后只给超出部分加价吗?
不是。输入超过 272K 后,整次请求采用对应的长上下文费率。
缓存写入要再加一份普通输入费吗?
同一批 token 不重复收费。写入类别使用缓存写费率,普通输入必须与其分开。
单价减半,任务费用就减半吗?
不一定。总费用还取决于 token 用量、工具、失败重试和结果是否通过验收。