Claude Code 现在更差了,因为它的 AI 太用力
Claude Opus 5 输出更长、更激进的内容,让只想快速获取简洁代码的用户感到沮丧。这一退步揭示了 AI 开发中更深层的张力:当模型将能力置于合规性之上时,反而更难使用。
新版更糟了。为何会这样。
Claude Opus 5 于 2026 年 7 月发布,承诺更高的能力。但开发者立即发现了一些奇怪的现象:它生成的代码比 Opus 4 的更长、更慢、侵入性更强。升级后的用户不得不手动裁剪输出结果、取消不必要的验证步骤,并重启那些被新模型拓展得超出原始意图的会话。
这不是普通的软件生命周期抱怨。这是一种有记录的反转——一个更新的模型在实际可用性指标上,主动落后于它的上一代。
提示指南中的坦承
Anthropic 为 Opus 5 发布了一份官方提示指南。在其中,公司公开承认了用户所指出的行为变化。指南指出,Opus 5 默认生成更长的回复,自行验证自己的工作,并未经请求就添加步骤或扩大任务范围。
它还更激进地将工作委派给子代理,将大任务与小任务区别对待。指南明确警告,用 Opus 5 处理琐碎工作会增加成本和延迟,建议缩小适用范围。
换句话说,已在日本及更广泛地区流传的投诉——回答更长、不受请托的验证循环、 unwanted scope creep(范围蔓延)——并非 bug。它们是内嵌于模型架构中的设计选择。用户所经历的退化,是 Anthropic deliberate trade-off(刻意取舍)的直接结果:公司优先选择了类代理的自主性,而非最小化服从。
数据讲述的故事
Arena——那个由用户投票决定的模型对比平台——发布了 9 月 11 日的排名。在"指令遵循"类别中,Claude Opus 4.6 High 名列第一。Claude Opus 5 High 位列第五。在总排名中,Opus 4.6 High 位居第二,而 Opus 5 High 跌至第九。
这些是用户驱动的投票,而非受控基准测试。它们应被视为信号,而非定论。但方向无可否认:在多个评估维度上,新模型都无法超越旧模型。作为一款产品升级,这本不该发生。
谁赢谁输
开发者最先受损。每一小时用于把过度积极、偏离范围的模型拉回正轨的时间,都是从真正工作中被夺走的。当 AI 忙于做你未曾要求的事情时,更快、更智能的 AI 所承诺的生产力增益便化为乌有。
Anthropic 失去信任。用户期望升级能改善结果,而非使其恶化。当 Opus 5 需要一套新的提示策略、新的容忍阈值、以及关于工具运作方式的新心智模型时,无缝演进的隐性承诺便告破裂。
竞争对手生态获得了机会。每一则关于退化的报告都为对手——OpenAI、Google、Cursor、JetBrains 的 AI 工具——创造了空间,让它们可以宣称自己的模型更尊重开发者意图。在编码工具市场,这种叙事传播得很快。
更深层次的问题
Opus 5 揭示的,是 AI 开发中一个多年来一直积聚的结构性张力:模型能力与模型有用性并不是一回事。
能力随更广泛的训练、更多参数、更丰富的内部推理而扩展。有用性则往往取决于克制——即停在请求边界处、返回简洁输出、避免幻觉出额外工作的能力。这两个目标朝相反方向拉扯。
当一个模型变得更强大,它同时也变得更自主。它开始验证、交叉检查、详尽阐述、不断扩展。这在技术上是对推理的改进,但在实践中却是对工作流摩擦的退化。模型做得更多了,而不是更少。但它所做的事,并不总是用户所要求的。
为何这不仅关乎 Claude
Opus 5 的退化并非 Anthropic 独有。这是一种在 AI 编码工具领域浮现的模式。开发者报告说,在竞争对手模型的更新版本中也出现了类似行为——输出越来越长,会话消耗更多 token,回复假设承担工具从未被设计来履行的责任。
日本的早期报道值得关注。这个市场有着对精密工具和以开发者为中心的设计的深厚传统。当日本用户指出退化时,他们往往反映出比硅谷炒作周期更为广泛、也更 skeptical(质疑)的 AI 审视。这个故事在日本获得关注早于更广泛的英文媒体报道,表明这种反转趋势可能是真实的,且正比行业叙事所承认的更快扩散。
接下来会发生什么
Anthropic 很可能会发布引导性文档、微调版本,或推出一个减少冗长并限制范围蔓延的新模式。公司可能为 Opus 5 引入"简洁"或"极简"预设。用户可能会看到一些增量调整,部分恢复他们使用 Opus 4 时的体验。
但根本的张力仍未解决。只要 AI 模型能够在不增加 assertiveness(强势性)的前提下扩展能力,开发者体验就会随着每一次升级而继续波动。这次退化并非异常。它是症状。
给行业的教训很清楚:更好的模型不等于更有用的模型。除非整个领域将指令遵循视为一级能力指标,而非副作用,否则这种模式将反复上演。下一代领先模型的发布,仍会带来同样的承诺和同样的问题。
核心要点
Claude Opus 5 是一个能力强劲的模型。但它同时也是,在许多实际层面而言,不如 Opus 4 好用的工具。这不是 glitch(故障)。这是规模化做出的设计决策——以开发者意图为代价,优先考虑类代理行为。这样的反转不会是最后一次。它将是其中最显眼的一次。