Luna 初筛、Sol 复核:怎样确认路由真的省钱
设计 GPT-6 Luna 到 Sol 的升级规则,检查被直接放行的错误,把重试、复核和人工处理计入总成本。附离线路由样本与成本反例,不冒称真实模型节省比例。
Luna 先处理、Sol 再复核,只有在错误水平可接受、总成本更低时才值得采用。 只看第一笔便宜的调用,会漏掉升级、重试和人工处理。本教程先搭建验收方法,再讨论是否省钱。
2026 年 9 月 24 日核对了 Luna和 Sol文档。把它们作为初筛与升级候选是工程假设,不是已测出的质量排名。练习包只含预先编写的教学路由记录,不调用模型。
用可观察的失败定义升级条件
沿用结构化提取教程的工单任务:分类、订单号、原文引用。响应需完成、可解析、格式合规且引用有来源,才有资格进入下一层判断;这些条件仍不能保证类别正确。
明确三条路径:直接接收、升级 Sol、人工处理。不是所有失败都该再问模型。原文缺关键资料时可能需要追问用户,退款等动作还需要独立授权。
| 观察到的情况 | 候选处理 | 原因 |
|---|---|---|
| ID 没依据或缺少引用 | 升级或人工复核 | 缺少来源支持 |
| 原文互相矛盾 | 人工复核或补充信息 | 第二次猜测可能掩盖问题 |
| 低风险且通过校验 | 可进入抽样验收 | 仍可能有语义错误 |
| 拒答或策略停止 | 按适用规则处理 | 不用换模型逃避安全限制 |
| 暂时性通信失败 | 有上限的技术重试 | 不是质量判断 |
规则需要版本号。评估中途调整阈值,应保留旧规则并重跑保留测试集,不能把不同条件的结果混在一起。
别只复核升级样本
升级样本看起来难,往往更容易得到人工关注。真正容易漏掉的是通过校验、被直接接收的错误。
独立抽查已接收记录,不按模型置信度挑样本。同时记录“错误接收数/已接收数”和“错误接收数/全部任务数”,说明样本量与抽样方法。少量手挑案例不足以估计生产错误率,罕见但代价高的类别和各语言问题要单列。
模型说“我很有把握”不等于校准后的概率。若使用分数,阈值应在标注数据上建立,再到独立保留集验证;不能让产生错误的系统成为自己的唯一裁判。
把整条路径的成本加全
每个原始任务都关联初筛调用、Sol 调用、失败重试、外部工具及人工处理。使用对应日期、供应商与模式的真实用量和价格,历史账单不能用今天的单价重写。
路由成本 = 初筛 + 升级 + 重试及工具 + 人工处理
比较“完成且达标的任务成本”,而不只是每百万 token 单价。未解决任务也要保留,否则丢弃难题的系统会显得便宜。人工处理要明确时间及计价假设,或单独报告分钟数,不能默认为零。
运行离线成本反例
解压练习包后运行:
python3 lab.py routing
下表是任意成本单位,不是美元报价,也不是模型结果。
| 工单 | 路径 | 示例总单位 | 预先设定的结果 |
|---|---|---|---|
| T1 | 接收 | 1 | 正确 |
| T2 | 升级 | 5 | 正确 |
| T3 | 接收 | 1 | 错误 |
| T4 | 人工 | 10 | 正确 |
合计 17 个单位。包内还列出仅计算 token 的假设全 Sol 基线 16;它没有实测质量,也没计基线的人工处理,因此不能选出赢家。这个反例只说明四次便宜调用不足以证明省钱。两条直接接收记录中有一条错误,也不是 Luna 被测得“50% 错误率”。
建立可比的全 Sol 基线
两条路径使用同一保留集、分类规则、输出 Schema 和人工判定方式。固定供应商、模型 ID、effort、预算与工具权限,记录无法统一的差异。服务波动可能影响延迟时,随机化执行顺序,并测实际耗时。
基线的重试和人工处理也要照样计入。按类别比较质量、达标任务成本、未解决数和延迟分位数,同时报告样本量。多跑几次能暴露波动,但不能自动让小样本具有代表性。
先设业务能接受的错误与成本界限,再选择阈值。试点阶段保留人工批准是合理结果,证据足够后再逐步自动化。Sol 定价说明与 Luna 定价说明帮助解释用量,不能代替同任务实验。
常见问题
- 先用 Luna 就一定便宜吗?
- 不一定。第二次模型调用、重试和人工处理都要计入,并与满足同样质量要求的全 Sol 基线比较。
- 可以只靠模型自报置信度分流吗?
- 不应只靠它。需要独立标注数据校准,并结合可观察的校验失败和风险规则。
- 17 个单位是真实账单吗?
- 不是,是为教学设定的任意成本单位,只说明计算逻辑,不是供应商报价或模型实测。


