Claude Code 变傻了

到底是什么让模型变笨了

Claude Code 变傻了
AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI | ElevenLabs | KlingAI | ArtSpace | Phot.AI | InVideo

我从未见过一个工程师会自信地当面撒谎任务已完成而Claude Code现在每天都在这样做。

我上一篇关于 Opus 4.7重大变更的文章 收到了大量反馈。开发者们报告了同样的问题。 体验已经退步了。

不只是我的文章。Reddit、Hacker News、X上的讨论到处都是。  AMD的总监也注意到了。

None

我收到的一些反驳是"这不是就像和一个初级开发者一起工作吗"。不,一个初级开发者不会在任务完成这件事上完全撒谎。他们不会在你旁边说"哦,我刚刚读过了",而查看日志却发现他们根本没有读。

周末我深入研究了这个问题。查找资料、观看分析视频、检查第三方每日测试网站。尽可能多地与开发者交流 (我们甚至在工作时开了一个会议)。

结果是明确的。Claude Code正在让我们的工作变得更加困难。以下是你可以采取的应对措施。

1、性能退步来自哪里?

性能退步并非来自单一原因。这正是为什么这个问题如此难以定位。

当你向Claude Code发送提示时,它会经过多个不同的层你的提示经过一个外壳(harness),它会包装系统提示和工具定义。然后到达Claude API,API将其路由到GPU,最后模型生成响应。

None

其中任何一个层都会影响最终体验。

Opus 4.7发布了一个新的分词器,token数量增加了多达1.35倍每个token的价格相同,但正如所有人报告的那样,它会更快地消耗你的上下文窗口。

思考token现在默认隐藏。你仍然需要为它们付费。根据AMD的分析,思考深度下降了73%。

外壳已经发生了变化。Claude Code的系统提示随着每发布一个功能变得越来越臃肿。更多的工具、指令和冗余内容。

但其中一个因素造成的损害最大

2、外壳是最大的问题

当你使用Claude Code时,你实际上是在使用一个庞大的包装器来调用Claude。

这个包装器决定了它向模型发送什么内容。它决定了模型可以调用哪些工具以及对话历史如何组织。

Matt Mau最近构建了一个名为TerminalBench的基准测试。它衡量模型实现包含100个功能的文档的能力如何。他在不同的外壳中测试了同一个模型。

  • Opus在Claude Code中得分58%。
  • Opus在Cursor中得分73%。

完全相同的模型,只是使用了不同的外壳。

基准测试的结果令人震惊,在所有使用Claude的外壳中,Anthropic的Claude Code排名垫底

None

这可能意味着现在使用Claude的最佳方式不是通过Claude Code。

原因是什么?

  • 臃肿的系统提示系统提示越多,留给实际代码/上下文的空间就越少。
  • 文件读取机制确实坏了 — 查找文件时(仅今天我就遇到了30多次)。
  • 读取与编辑比率过低AMD报告称,Claude Code以前每次编辑读取6.6个文件,现在只有2个。
  • 默认开启1M上下文窗口Anthropic在九月发布了一份事后分析,承认将请求路由到100万token版本导致了质量下降。

3、你现在能做什么

外壳问题不是你能修复的 (使用Claude Code的情况下)。但有一些方法可以帮助缓解。

尽可能留在Opus 4.6。 将effort设为最大值并将其作为默认值,直到问题得到解决。

alias claude="claude --model claude-opus-4-6 --effort max"

通过更好的外壳使用Claude。 这是TerminalBench最大的启示。Cursor配合Claude Opus的得分高于使用完全相同模型的Claude Code。 我个人一直在这样做,目前正在逐一测试TerminalBench列表上的工具,如果你使用了其中任何一个,我很想听听你的想法。

通过Codex进行二次验证。 说实话,我个人也不想切换到OpenAI,但Claude Code在什么都没做的情况下就标记任务为完成。如果你仍想使用Claude Code,那么可以简单地使用Codex作为验证层。这正是AMD在撤销Claude Code访问权限之前所做的。

最近的报告表明,在某些情况下甚至 CLAUDE.md 的规则也被忽略了。但当它们确实生效时,以下内容可以有所帮助:

For every claim or finding, quote the exact code that proves it.
If you cannot quote the actual code, say "I need to read this 
file first" instead of making the claim.

4、是时候不再依赖单一外壳了

不要只依赖一个供应商。这是最大的教训。Claude Code可能会改善,也可能变得更糟,我们不应该受制于别人的提示词。像我一样去探索 AiderForge CodeCappy,或者自己构建一个最小化的工具。

这些工具表明,更少的冗余意味着更好的输出。

我们已经过了Claude Code是最好的、其他工具都望尘莫及的时代。

我每天都在使用Claude和Claude Code。我写这篇文章不是为了贬低它。我写这篇文章是因为依赖它的开发者们有权知道正在发生什么以及他们能做些什么。

我与Anthropic、AMD或MarginLab没有关联。所有观点均为个人意见。


原文链接: Claude Code Has A Big Problem. What You Can Do.汇智网翻译整理,转载请标明出处