【Claude 降级指南】Opus 5 变难用?锁回 4.6 还是改提示词

Opus 5 说改好了其实没改?Opus 4.5 到 4.8 都还在线,价格一样 $5/$25。症状对照表、退役时间表,加实测 1.30 倍的 token 差价,帮你判断该锁版本还是改提示词。

【Claude 降级指南】Opus 5 变难用?锁回 4.6 还是改提示词

摘要

Opus 5 的吐槽大多能对上官方写进文档、且明说可以靠提示词调的行为变化,不是能力退步。Claude Opus 4.5 到 4.8 全都还是 Active 状态,价格同为 $5/$25,各自有公布的退役底线,所以锁回旧版本是一次只改一个字符串的实验。下面的实测 token 数据会告诉你这笔账真正的样子:输入文本便宜 23%,但工具重的调用反而更贵。

吐槽源头:      r/claude「Opus 5 is so awful」,522 赞,赞同率 0.83,507 条评论(读取于 2026-08-12)
最高频症状:    说修好了,其实没修
最可能的原因:  thinking 被关掉,工具调用被当成纯文本吐出来、从未执行
锁旧版 Opus:   4.5 / 4.6 / 4.7 / 4.8 全部 Active,同为 $5/$25,改一个字符串
最早退役:      Opus 4.5「不早于 2026-11-24」;4.6 是 2027-02-05
通知承诺:      退役前至少 60 天
4.6 正文更省:  同一段输入 1,185 对 1,541 token(实测 2026-08-12,1.30 倍)
5 的工具更省:  tool-use 系统提示 286 对 497 token
别白费劲:      靠调低 effort 让回答变短(没用)
从提示词里删:  「再检查一遍」以及任何额外的验证步骤

一篇标题叫 “Opus 5 is so awful” 的帖子从 8 月 9 日起就挂在 r/claude 前排。它值得看,而且值得细看,因为里面绝大多数抱怨描述的行为,Anthropic 自己在提示指南里都写了,并且当成可调项。

这不代表抱怨的人错了,只说明这些问题是能修的,而这更有用。这篇文章把声音最大的几个症状对到官方给出的成因上,给出想直接锁版本时该填的模型 ID,再算一遍锁版本到底花多少钱。

大家到底在抱怨 Opus 5 的什么?

五类症状,没有一类是「跑分变低了」。 下面是截至 2026 年 8 月 12 日那个帖子里的内容。

症状代表性评论(分数)帖子里的出现频次
说修好了其实没修原帖:「每次让 opus 5 修点东西,它都说修好了,然后根本没修」原帖,外加若干回复
长篇大论地自我更正「我得为一小时前当成事实告诉你的东西向你更正」(117)最高赞评论
不认你报的 bug,跟你争「每次都得跟它掰扯五分钟,证明我看到的 bug 是真的」(29)3 条独立反馈
话又长又绕「说话像 IQ 1000」(13);「发明一些听着差不多但完全没定义的术语」(17)4 条独立反馈
想锁 4.6,又怕它没了「哪天真把 opus 4.6 下架我就走」(40);「Opus 4.6 到现在依然能打」(30)3 条独立反馈

在把这些当数据之前,有三点要先说清楚。

这个帖子的赞同率是 0.83,也就是大约每六个投票的人里有一个不同意。这是真实的分歧,不是共识。而且 Reddit 帖天然筛出正在受苦的人,没人会发「我的 agent 循环今天挺好」。

发帖的人用的是订阅版,不是 API。这件事比看上去重要:API 上你可以设 effort、开关 thinking、锁模型 ID,聊天产品里基本都做不到。下面好几个修法只有直连 API 或走网关时才存在。

最后,这个帖子里有一个流传很广的说法,把这次变化归因到几个点名的具体人员在公司之间流动。我们不转述。它无法核实,而且是针对真实个人的指控。

是模型的问题,还是你提示词的问题?

先从这儿查,因为答案是「有一部分是你的提示词」的概率,比帖子里显示的高。 Anthropic 专门为 Opus 5 出了一份提示指南,开篇就说这个模型「在现有的 Claude Opus 4.8 提示词上开箱即用表现良好」,然后才列出那些「最常需要调」的行为。

列出来的这些行为,和帖子几乎一条对一条:

  • 默认回答更长。「Claude Opus 5 面向用户的默认回答比之前的 Opus 模型更长。」
  • 过程叙述更多。「Claude Opus 5 在 agent 工作中很爱叙述:它倾向于先宣布自己接下来要做什么。」
  • 自我更正说出口。「这个模型也比之前的模型更爱把对自己早前说法的更正讲出来,这在面向用户的产品里可能并不合适。」
  • 任务范围扩大。「Claude Opus 5 还可能扩大任务范围,加进没有被要求的步骤。」
  • 更爱开 subagent。「Claude Opus 5 比之前的模型更容易把活儿分派给 subagent。」

把这份清单和抱怨并排放,重合度很难忽视。帖子里最高赞那条几乎是「自我更正」那一项的逐字描述。「白跑一趟的巨型支线任务」那条评论(12 分)是任务范围扩大。「拿别的 agent 去执行一个我已经否掉的方案」那条(29 分)是 subagent 分派。

这在发布当天就看得出来,不是事后诸葛。读完 Anthropic 自己的发布博客,Simon Willison 写道「从发布博客里这个例子看,它可能是一个不停往前冲的主动型选手」,他指的是一个 Frontier-Bench 任务里 Opus 5 远远做过了字面要求。三周之后,坐在工作会话里的人看到的同一个特性,就成了没人要的支线任务。行为本身没有争议,有争议的是你要不要它默认打开。

有一条指令是明确起反作用的,今天就可以删:

如果你的提示词里有显式的验证指令(「任何非平凡任务都加一步最终验证」「用一个 subagent 来验证」),删掉:这类指令会让 Claude Opus 5 过度验证,删掉能减少白花的 token 且不损失质量。

这和通行的提示词经验是反着的。如果你维护着一个共享提示词库,里面有一条一刀切的「让模型自查」规则,Opus 5 需要的是一个例外,不是照抄。

哪个症状对哪个修法?

这张表是这篇文章的主干。 每一行把帖子里的一个症状、官方给出的成因、以及能解决它的最小改动配在一起。这里没有一条需要离开 Anthropic。

症状官方给出的成因最小改动什么时候别这么做
说修好了,其实什么都没变thinking 关闭时工具调用被当文本吐出重新打开 thinking,降到 lowmedium effort如果必须关着 thinking,用下面那段组合缓解提示词
可见输出里冒出 <thinking> 标签同样是 thinking 关闭这条路径同上,另外把系统提示里「不要推理」之类的规则删掉文档说点名标签本身反而效果更差
回答太长默认啰嗦程度提高在提示词里明确要求长度别为这个调低 effort,没用
满屏「需要澄清一下,我刚才说错了」更正叙述把更正限定在会改变结果的那些上保留在 thinking 块里;这里管的是可见文本
跟你争 bug 是不是真的字面执行「只报高危问题」这类指令让它带置信度全报,第二轮再过滤如果你确实只要一遍过滤好的结果,就不用改
干了你没让它干的活任务范围扩大明确约束范围开放式研究类任务不适用
从 4.8 换过来账单涨了subagent 变多,外加新分词器限制 subagent 数量;重新跑一轮 effort 扫描先看下面的 token 账,别只怪 subagent
想在 review 时快速过一遍低 effort 下准确率仍然稳大胆用 lowmedium高难度 agent 工作要往上抬到 xhigh

范围约束这一条,Anthropic 自己的措辞最值得逐字抄走:

按被要求的范围交付被要求的东西。常规判断自己拿主意,只有当不同理解会导致做出实质不同的活儿时才回来确认。如果这个要求看起来有问题、或者有更好的做法,用一句话说出来,然后仍按要求把活儿做完,而不是悄悄缩小、放大或改变它。把整件事做完,同时止步于明显超出要求的动作。

为什么它说做完了,其实没做?

因为 thinking 关闭时,工具调用可能被写成散文,而不是被执行。 这是 Anthropic 的 Opus 5 文档里最有用的一条,它对最大声那个抱怨的解释力,胜过任何关于模型质量的猜测。

原文是这么写的:

thinking 关闭时,模型偶尔会把工具调用写进面向用户的正文,而不是发出结构化的 tool_use 块。这一轮正常结束、调用从未执行,而在 agent 循环里,泄漏出来的文本还留在对话历史里,后面几轮也会受影响。这在搜索这类工具密集的任务上最常见。

停下来想想这个失败的形状。没有报错。没有异常。你的 harness 看到的是一轮成功的对话,模型说它改了文件,而文件从头到尾没被碰过。然后那句编造出来的调用留在历史里,把后面的一切都带偏。从外面看,这和一个谎报工作的模型没有区别。

有两件事让它在 Opus 5 上变成了新问题:

  1. Opus 5 的 thinking 默认是开的,而 Opus 4.8 上不写这个字段就等于不思考。所以只有显式关掉它的代码才会中招,而这往往是从 4.8 时代沿用下来的设置,那会儿关闭本来就是默认行为。
  2. 关闭 thinking 现在最高只能配到 high effort。把 thinking: {"type": "disabled"}xhighmax 一起发会返回 400。迁移指南把这两处变化都写了,我们的 Opus 5 API 指南则把完整的配置差异走了一遍。

官方推荐的修法根本不是一段提示词,而是别再关 thinking:

对大多数任务来说,在相近的成本下,开着 thinking 用 low effort 比关掉 thinking 表现更好。

如果你的集成必须关着 thinking,Anthropic 给了一段能同时缓解两种异常的组合指令:

When you use a tool, you may say a brief sentence first. If no tool can express
what the user asked for, say so instead of guessing. Do not include internal or
system XML tags in your response.

注意第一句。这个失败看起来来自压制了模型本来想写的开场白,所以明确允许它在调用工具之前先说一句,本身就是修法的一部分。另外,把任何叫模型不要思考、不要推理的规则删掉;提示指南说这类规则只会让标签泄漏更严重,而不是更轻。

为什么它非说你的 bug 不存在?

有一部分原因是你自己写下的那条指令。 帖子里有三个人各自描述了同一场拉锯:他们报了一个 bug,模型坚持说没有,争论花掉的时间比修它还多。

Anthropic 在 Opus 5 提示指南的代码审查一节里记录了一个相邻的行为:

如果你的审查提示词写着「只报高危问题」或者「保守一点」,模型可能会字面执行这条指令,报得更少;改成让它全都报出来,在另一轮里过滤。

要说清楚这条解释了什么、没解释什么。它覆盖的是漏报:模型认真查了,判断某个发现低于你设的门槛,于是不吭声。它并不直接解释争论,也就是模型主动反驳一个你能复现的 bug。这是两种不同形状的失败,硬说文档把两者都覆盖了就太糙了。

把它们连起来的是字面执行指令这件事。提示词里的严重性措辞设了一条上报线,而 Opus 5 执行这条线比早前的模型更严格。一旦模型把你的 bug 归到线以下,你再问一次,在它读来就是要它为这个归类做辩护,而不是重新调查。你拿到的是一段辩词,不是第二次审视。

有两件事要改,按顺序:

  1. 把「发现」和「过滤」拆开。 让它把每个候选问题都报出来,附上置信度和严重性判断,然后另起一轮排序。精度不会掉,你也不再为一条模型正替你执行的门槛做优化。
  2. 明确地重开调查。 不同意的时候别重复你的结论,把复现步骤给它,让它去跑那段代码,这一步把这一轮从判断拉回到证据。

如果你正想往提示词里加一句「认真点,这次真的验一下」,别加。那是一条验证指令,按上一节所说,它会和模型本来就有的行为叠加,买到的是更长的回答,不是更好的回答。

现在还能锁 Claude Opus 4.6 或 4.8 吗?

能,而且 Anthropic 为每一个版本都公布了底线日期。 帖子里「哪天真把 opus 4.6 下架我就走」那条是最有行动价值的焦虑,模型弃用页直接回答了它。

模型ofox 模型 ID状态最早退役输入 / 输出
Claude Opus 5anthropic/claude-opus-5Active不早于 2027-07-24$5 / $25
Claude Opus 4.8anthropic/claude-opus-4.8Active不早于 2027-05-28$5 / $25
Claude Opus 4.7anthropic/claude-opus-4.7Active不早于 2027-04-16$5 / $25
Claude Opus 4.6anthropic/claude-opus-4.6Active不早于 2027-02-05$5 / $25
Claude Opus 4.5anthropic/claude-opus-4.5Active不早于 2026-11-24$5 / $25

4.5 以上的每个 Opus 版本牌价都一样,所以锁一个旧的是行为选择,不是预算选择。Anthropic 写明的政策是「公开发布的模型在退役前至少提前 60 天通知」,并且就退役后保留模型权重发布了公开承诺

不过退役不是理论问题。Claude Opus 4.1 在 2026 年 6 月 5 日进入弃用,2026 年 8 月 5 日正式退役,就在这个帖子发出的一周前。它提前两个月公告,和政策描述的完全一致。所以诚实的说法是:4.6 还能安稳用一段时间,到时候你会收到通知,但你仍然不该造一个扛不住换模型 ID 的东西。

锁版本之前有两条脚注:

  • fast mode 只有 Opus 5 和 4.8 有。 在 Opus 4.7 上发 speed: "fast" 请求会报错。在 Opus 4.6 上它按标准速度跑、按标准价计费,这种失败更糟,因为它是静默的。
  • effort 档位不一样。 xhigh 在 Opus 5、4.8、4.7 上有,4.6 没有,它到 max 就封顶,中间少一档。

为什么是 4.6,不是 4.8?

因为 4.6 是旧分词器上的最后一代 Opus,而这是唯一一条会改变你账单的版本分界线。 帖子是凭感觉选的 4.6,上面引用的那几条点名版本的评论说的也是 4.6 而不是 4.8。更硬的理由在下一节:Anthropic 是在 4.7 换的分词器,所以 4.8 数你输入的方式和 Opus 5 完全一样,锁它买到的是旧行为配新 token 数。

按你想撤销的东西来选:

  • 既要旧行为也要省 token: 选 4.6。旧分词器上最新的一代 Opus,输入文本便宜 23%。代价是放弃 xhigh 和 fast mode,而且它的底线日期比 4.8 早将近四个月。
  • 只要旧行为: 选 4.8。最近的一次回退,只退一个版本而不是两个,你的调优失效得更少。fast mode 和 xhigh 都在,底线日期到 2027-05-28,而且它的 tool-use 系统提示是 290 token,4.6 是 497;一旦你的流量偏工具重,这一项比分词器更要紧。

锁 4.6 真的更便宜吗?

同样文本的输入 token 上是的,大约便宜 23%。我们实测过。 这是帖子里没人提的部分,而且它推翻了「牌价一样就等于账单一样」这个假设。

Anthropic 在价格页写着:「Claude 4.7 及以后的模型使用新的分词器……这个分词器对同样的文本会产生约 30% 更多的 token。Claude Sonnet 4.6 及更早的模型使用旧分词器。」

我们把同一段 4,365 字符的 payload(技术散文加一段 Python 代码块,就是真实代码审查请求的样子)通过 ofox 发给五个模型,从响应里读 prompt_tokens。同一段内容、同一个请求、同一天。

模型分词器prompt_tokens对比 Opus 4.6
Claude Opus 51,5411.30x
Claude Opus 4.81,5411.30x
Claude Sonnet 51,5411.30x
Claude Opus 4.61,1851.00x
Claude Sonnet 4.61,1851.00x

实测于 2026-08-12,走 api.ofox.ai。单条 payload 是一个数据点,不是基准测试,Anthropic 也明说「具体增加多少取决于内容和工作负载的形态」。我们测到的 1.30 倍落在官方说的约 30% 区间内,这也是单个样本能得出的全部结论。

按每百万输入 token $5 算,同一份文档在 Opus 5 上花 $0.0077,在 Opus 4.6 上花 $0.0059。单次请求微不足道,一百万次 agent 轮次就不是了。

现在说反向的配重,因为这笔账不是单边的。Anthropic 公布了每个模型的 tool-use 系统提示开销,Opus 5 在这项上更精简:

  • Opus 5:286 tokenauto/none 工具选择)
  • Opus 4.8:290 token
  • Opus 4.6:497 token
  • Opus 4.7:675 token

也就是说,工具重的请求在 4.6 上每次要多付 211 个 token,Opus 5 不用付。请求短、工具 schema 大的场景里,锁 4.6 反而更贵。注意 4.8 落在哪:290 token,距 Opus 5 只差 4 个,比 4.6 低 207,所以如果你的流量偏工具重,4.8 才是那个既拿到旧行为、又不用背工具开销的版本。把锁版本当成本优化之前,先算清楚你的流量落在这条线的哪一边。如果还用了提示缓存,注意 Opus 5 把可缓存前缀的最小长度降到了 512 token,Opus 4.6 是 4,096,这一点在我们的提示缓存省钱算账一文里讲得更细。

如果就是想离开 Anthropic 呢?

那最划算的一步是先在 Anthropic 内部往下走一档,而不是直接走出去。 按你这边要改多少东西排序。

  • Claude Sonnet 5anthropic/claude-sonnet-5,$2/$10。 输入输出都比 Opus 便宜 60%,1M 上下文,而且 Anthropic 取消了 9 月 1 日涨到 $3/$15 的计划,$2/$10 现在是长期价。同一个提示词家族,你调过的东西大部分能平移。Sonnet 5 对比 Opus 4.8 里有正面对比。
  • Claude Haiku 4.5anthropic/claude-haiku-4.5,$1/$5。 适合 subagent 和机械性的处理。200K 上下文,不是 1M。
  • GPT-5.6 Solopenai/gpt-5.6-sol,$5/$30。 帖子里被提到最多的替换对象。它在输出吞吐上领先,在首 token 延迟上落后;具体数字在我们的 Opus 5 对比 GPT-5.6 Sol 一文里,那篇是跑分对比,不是路由建议。
  • Kimi K3moonshotai/kimi-k3,$3/$15。 输入 1M、输出也 1M,这个组合不多见。见 Kimi K3 对比 GPT-5.5 和 Opus 4.8

有一点要说清楚:这几个都不是上面那些症状的即插即用解法。为了治啰嗦而换厂商,等于继承另一家的啰嗦默认值,提示词照样要重写。锁一个旧 Opus 是这页上唯一一个只改一个字符串、其余什么都不动的选项。

如果你的抱怨其实是关于编程工具而不是模型,那模型可能压根不是那个变量。我们的编程 agent harness 横评讲了哪些 harness 允许你换掉底下的模型。

怎么在一个账号里同时跑两个模型版本?

上面每个修法都需要一次 A/B,而跨模型版本的 A/B 通常意味着两条账单线和两套凭据。 这正是「先锁 4.6 试试」麻烦的地方。你想让昨天的模型和今天的模型回答同一段提示词,并排放着,token 数还要能直接比,而厂商控制台并不是为这件事设计的。

因为 Opus 4.5 到 5 说的都是同一套 OpenAI 兼容的 HTTP 结构,它们之间的差别就是请求体里的一个字符串。把一个客户端指向一个 base URL,循环遍历模型 ID,从每个响应里读 usage 就行。无论你是在比两个 Anthropic 版本,还是拿 Anthropic 的模型比 Moonshot 的,做法完全一样。

Python:同一段提示词,四个模型版本

from openai import OpenAI

client = OpenAI(base_url="https://api.ofox.io/v1", api_key="YOUR_OFOX_KEY")

PROMPT = "Find the race condition in this handler and fix it. Do not refactor anything else."

for model in [
    "anthropic/claude-opus-5",
    "anthropic/claude-opus-4.8",
    "anthropic/claude-opus-4.6",
    "anthropic/claude-sonnet-5",
]:
    r = client.chat.completions.create(
        model=model,
        max_tokens=2048,
        messages=[{"role": "user", "content": PROMPT}],
    )
    u = r.usage
    print(f"{model:32} in={u.prompt_tokens:>6} out={u.completion_tokens:>6}")

Node:同样的结构

import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://api.ofox.io/v1",
  apiKey: process.env.OFOX_API_KEY,
});

const PROMPT =
  "Find the race condition in this handler and fix it. Do not refactor anything else.";

for (const model of [
  "anthropic/claude-opus-5",
  "anthropic/claude-opus-4.8",
  "anthropic/claude-opus-4.6",
  "anthropic/claude-sonnet-5",
]) {
  const r = await client.chat.completions.create({
    model,
    max_tokens: 2048,
    messages: [{ role: "user", content: PROMPT }],
  });
  console.log(
    `${model.padEnd(32)} in=${r.usage.prompt_tokens} out=${r.usage.completion_tokens}`,
  );
}

上面那张 token 表就是这么跑出来的。在你从我们的数字得出任何结论之前,先拿你自己的提示词跑一遍,并且把 usage 数字留下来,别只看回答;在这个对比里,token 数是一半的故事。

要控 effort 和显式的 thinking 开关,用 https://api.ofox.io/anthropic 这个 Anthropic 原生端点,模型 ID 写裸的 claude-opus-5,因为这些参数在 OpenAI 兼容协议里没有对应写法。

那到底该选哪个?

先改提示词,再考虑锁版本,换厂商放最后。 按对你的代价从小到大排:

  1. 删掉你的验证指令。 免费,一分钟的事,Anthropic 说它能减少白花的 token 且不损失质量。哪怕你对 Opus 5 挺满意,也该做。
  2. 把 thinking 重新打开(如果你之前关了),改用 lowmedium effort 控成本。这是「说做完了其实没做」那条抱怨的解法。
  3. 加上简洁和范围两段指令。 两段系统提示,对付一次有文档记录的行为变化。
  4. 锁 Opus 4.6 或 4.8,如果上面三条都做了还是更喜欢旧行为。牌价一样,公布的退役底线至少还有一年,想再试新版时改回来也只是一个字符串。想连旧分词器一起要就选 4.6,需要 fast mode 和 xhigh 就选 4.8。
  5. 换 Sonnet 5,如果真正的抱怨是成本。它输入输出都比 Opus 便宜 60%,而且是同一个提示词家族。
  6. 换厂商,只在这份活儿确实更适合另一个模型时才做,不要因为一个帖子在发火就换。反正提示词你都得重写。

r/claude 那个帖子是一个关于真实行为变化的真实信号。它只是不能证明模型变笨了,而且那个帖子里每六个投票的人就有一个已经不同意这个标题。

参考信息来源

常见问题

现在还能用 Claude Opus 4.6 代替 Opus 5 吗?
能。Opus 4.5、4.6、4.7、4.8 在 Anthropic 的模型弃用页上状态都是 Active,都没有弃用日期。Opus 系列里最早的退役底线是 4.5 的「不早于 2026 年 11 月 24 日」,4.6 是「不早于 2027 年 2 月 5 日」。Anthropic 还承诺公开发布的模型在退役前至少提前 60 天通知。API 上模型 ID 是 claude-opus-4-6,走 ofox 则是 anthropic/claude-opus-4.6。
为什么 Claude Opus 5 说修好了,其实根本没修?
最常见的机械原因是关掉了 thinking。Anthropic 文档里写明,thinking 关闭时 Opus 5 偶尔会把工具调用写进可见正文,而不是发出结构化的 tool_use 块。这一轮对话正常结束,调用从未执行;在 agent 循环里,泄漏出来的文本还会留在历史里影响后面几轮。修法是重新打开 thinking,改用 low 或 medium effort 控成本。
锁回 Opus 4.6 比 Opus 5 便宜吗?
同样一段文本的输入 token 上便宜大约 23%。两者牌价都是每百万输入 $5、每百万输出 $25,但 Opus 4.7 及以后换了新分词器,Anthropic 说同样的文本会多出约 30% 的 token。我们用同一段 4,365 字符的 payload 实测:Opus 5 是 1,541 token,Opus 4.6 是 1,185,差 1.30 倍。但这不是净胜:Opus 5 的 tool-use 系统提示只有 286 token,Opus 4.6 是 497,工具重的请求会把省下的吃回去一部分。
该锁 Claude Opus 4.6 还是 Claude Opus 4.8?
想连输入 token 一起省就选 4.6,只想要回旧行为就选 4.8。Anthropic 是在 Opus 4.7 换的分词器,所以 4.8 数输入的方式和 Opus 5 一模一样,锁它在 token 上一分不省;4.6 是旧分词器上最新的一代 Opus,同一段 payload 实测 1,185 对 1,541。代价是 4.6 没有 xhigh effort 档,fast mode 也会被静默忽略;4.8 两样都保留,退役底线更晚(不早于 2027-05-28,4.6 是 2027-02-05),而且 tool-use 系统提示只有 290 token,4.6 是 497。流量偏工具重时,这项开销会盖过分词器省下的那点。
把 effort 调低能让 Claude Opus 5 说话简短点吗?
不能,而且这是最常见的白费功夫。Anthropic 明确说 effort 控制的是思考量,不是可见回答的长度,在 Opus 5 上改 effort 并不能可靠地让回答变短。要短就直接在提示词里写清楚。effort 仍然是控 token 成本和延迟的正确开关,只是管不了啰嗦。
该把提示词里的「再检查一遍」删掉吗?
在 Opus 5 上,该删。Anthropic 的提示指南写明这个模型不用你交代就会自己验,从早期模型沿用下来的验证类、自检类指令反而会造成过度验证。删掉能省下白花的 token,质量不降。同理,harness 里额外加一遍验证的脚手架也该拆。
Claude Opus 5 真的比 Opus 4.6 差吗?
能力基准上没有,但「对你的活儿更难用」是另一个问题。r/claude 上的吐槽集中在 Anthropic 自己写进文档、并且认为可以靠提示词调的行为变化上:默认回答更长、过程叙述更多、更爱开 subagent、更爱把自我更正说出来、还会自行扩大任务范围。如果你的提示词是为 4.6 或 4.8 调过的,原封不动搬过来,那多半是调优债,不是能力退步。
写代码的话,Claude Opus 5 有哪些替代选择?
三条路,按折腾程度从小到大。留在 Anthropic 锁一个更早的 Opus(价格一样,提示词不用重写)。往下走一档换 Claude Sonnet 5,$2/$10,输入输出都便宜 60%。或者干脆换家,GPT-5.6 Sol($5/$30)或 Kimi K3($3/$15)。锁版本是成本最低的一次实验,因为它只改一个字符串。