GPT-6 Sol High 和 XHigh 怎么选?按合格任务算成本
比较 GPT-6 Sol high 与 xhigh 的推理设置、费用和编程验收方法。区分 effort 与 mode,用明确算例说明为什么同一单价仍会产生不同账单。
复杂编程可以先评估 high;只有自己的任务显示额外推理值得,才保留 xhigh。 两者是 gpt-6-sol 的设置,不是两个模型。推理更多也不保证补丁正确,最终仍要看验收结果。
本文于2026年9月25日核对官方资料,没有运行两档同任务对照测试。下文是配置说明、假设算例和评估流程,不是实测结果。美元价格指 OpenAI 直连 API,不是 Ofox 报价或 ChatGPT 订阅费用。
从 High 调到 XHigh,究竟改了什么?
Sol 模型页列出 none、low、medium、high、xhigh、max,默认是 medium。所以选择 high 本身已经偏离默认设置。推理指南建议根据实际质量收益、延迟和费用评估更高档位。
| 比较项 | High | XHigh |
|---|---|---|
| 模型 ID | gpt-6-sol | gpt-6-sol |
| Responses 参数 | reasoning: {"effort":"high"} | reasoning: {"effort":"xhigh"} |
| 适合先评估的任务 | 有明确测试的仓库修复 | high 在需求清晰时仍未解决的难题 |
| 需要核验 | 正确性、回归、用量 | 相同项目,以及额外工作是否改变验收结果 |
这些任务建议是评估起点,不是质量排名。如果连失败测试和预期行为都没有写清,更高档位也无法可靠补全缺失需求。先提供相关文件、复现方法和约束,再决定要不要增加推理。
公平对照先固定这些条件
带推理且要调用工具的 Agent 应使用 Responses。Sol 的 Chat Completions 函数调用只支持 none;在该路径改成 high 后遇到适配错误,不能算作模型能力失败。可先核对工具调用迁移说明。
请求体结构示例:
{"model":"gpt-6-sol","reasoning":{"effort":"high"},"input":"Review the supplied patch against the stated acceptance tests."}
这是未执行的接口结构示例,不是完整仓库 Agent。另一组只将 effort 改成 xhigh。实际评估还要固定仓库 commit、提示词、工具定义、权限、输出上限和最大重试次数。reasoning.mode 的 standard 与 pro 是独立执行模式,也要保持一致;示例省略该字段,使用默认 standard。
每组从同一份干净代码开始,不让后一组看到前一组的补丁或隐藏答案。选多个有代表性的任务,交替运行顺序,保留失败和超时。只给失败的一方额外重跑,会让结论失真。
单价相同,账单仍然可能不同
在 Standard 处理、输入不超过272K token时,Sol 每百万普通输入 token 为2美元,输出为10美元。官方价表未按 high/xhigh 分别报价,但额外推理可能增加计费输出,工具循环也可能让后续输入变长。
假设一次未缓存请求有5万输入 token。如果计费输出为5000 token,费用是 $0.15;如果计费输出为1.5万,费用是 $0.25。这些是假设用量,不代表 high 或 xhigh 实际会用这些 token。
缓存读、缓存写、工具和处理模式另算。输入超过272K后,整次请求的输入及缓存费率翻倍,输出费率乘1.5。不要把上下文跨档带来的涨价误归因于 effort。类别拆分见Sol 计费说明。
按合格任务作决定
先写验收条件,再看答案:原故障确实修好、必要测试通过、没有无关行为变化,审查者能解释补丁为什么成立。人工审查分钟数单独记录,长解释不一定减少审查工作。
每档将包含失败尝试的总费用除以合格任务数。若没有任务合格,这个比值没有定义。还要看从开始到拿到合格补丁的耗时,而不是只看首字速度。一份很便宜但未完成的回答,不能当作便宜交付。
如果结果相当,且 high 的实际总费用或耗时更低,可以保留 high;只有 xhigh 稳定增加合格结果时,才有理由在该类任务中使用它。两档都失败,先检查任务描述和检索。模型层面的选择可看Sol、Luna 与 Astra 选型。保存提示词、commit、测试命令和失败记录,让结论能随仓库变化重新验证。
常见问题
- XHigh 写代码一定比 High 好吗?
- 本文没有同任务实测,不能下这个结论。应检查额外推理是否稳定增加合格补丁,且收益足以抵消用量和等待时间。
- XHigh 有单独的 API 加价吗?
- Sol 标准价表未单列 effort 附加费,但档位可能改变 token 用量。处理模式、上下文长度和缓存类别也影响费用。
- 带推理的工具调用用哪个接口?
- 使用 Responses。Sol 在 Chat Completions 中只有 reasoning_effort 为 none 才支持函数调用,不能把它当作 high/xhigh 工具调用路径。


