凯时AG

环球热门新闻资讯
2026-07-24 05:01:15
首页 > 新闻 > 时政要闻 > 正文

全网骂Claude变笨, ,,,,Anthropic下场揭秘:坑你的不是模子

新智元报道

【新智元导读】换更大的模子就即是更智慧 ??这可能是Claude Code用户最深的误会 。。许多人为此一起换到最贵的Fable, ,,,,克日, ,,,,Anthropic, ,,,,亲手澄清了这个误区 。。

你有没有过这种时刻:Claude Code写代码写砸了, ,,,,第一反映, ,,,,就是赶忙换个更强的模子 。。

但这一招, ,,,,许多时间并不管用, ,,,,甚至是在白花钱 。。

克日, ,,,,Anthropic官方发了一篇长文专门来讲这件事 。。

因由是太多人把Claude Code里的两个选项搞混了:

一个是模子选择(Model), ,,,,一个是起劲度(Effort) 。。

已往, ,,,,各人对这两个选项的明确都很简朴:换更大的模子, ,,,,AI就更智慧; ;把Effort调高, ,,,,无非是让AI多想一会儿 。。

而就在今年3月, ,,,,这个误会还惹出了一场不小的杂乱 。。

其时, ,,,,不少开发者发明, ,,,,手里的Claude Code突然「变笨」了 。。该读的文件不读, ,,,,该跑的测试不跑, ,,,,使命干到一半就撂挑子, ,,,,反过来问你要更多信息 。。

于是, ,,,,GitHub上骂声一片 。。

最狠的一刀来自AMD的AI认真人Stella Laurenzo 。。

她在GitHub上翻出6852个会话的日志, ,,,,实测Claude的思索量比2月之前掉了67%, ,,,,撂下一句:

Claude已经没法被信任, ,,,,去干重大的工程活了 。。

早先, ,,,,各人还以为是自己的提醒词没写好, ,,,,或者那里设置错了 。。折腾半天才恍然大悟:问题基础不在自己身上, ,,,,是Anthropic悄悄改了一个设置 。。

3月4日, ,,,,为了压低延迟, ,,,,他们把Claude Code里的Effort选项, ,,,,默认档位从high降到了medium 。。

官方更新日志里也写了, ,,,,可大大都人并没注重到, ,,,,他们只是感受到, ,,,,手里的模子无缘无故似乎变蠢了 。。

扛了一个月, ,,,,Anthropic才在4月7日把默认档位调回去, ,,,,还给所有订阅用户重置了一次用量额度 。。

而大都人这时才知道, ,,,,这个开关一直就在自己手边, ,,,,它在漆黑决议着:AI究竟肯不肯为你满血干活 。。

Model换的是脑子

Effort换的是态度

Anthropic官方的拆解, ,,,,可以简朴总结为这样一句话:

Model换的是脑子, ,,,,Effort换的是态度 。。

先说Model, ,,,,它换的是脑子 。。

每个模子背后是一套「冻结的权重」, ,,,,它的能力和知识, ,,,,在训练竣事那一刻就被焊死了:只读、不可改 。。

这意味着, ,,,,你推理时喂进去的提醒词、CLAUDE.md、贴进上下文的代码, ,,,,全都改变不了它的这套权重:你可以指导它, ,,,,却没法「训练」它 。。

换模子, ,,,,实质就是换一整套权重来接你的活, ,,,,以是它解决的是「会不会」的问题 。。

一个在模子训练时还不保存的库, ,,,,你把文档整篇喂给它, ,,,,它能现学现用, ,,,,可那只对这一次请求管用, ,,,,模子自己一个字都没记着, ,,,,转头就忘 。。

它无意会一本正经地挪用一个基础不保存的API, ,,,,也是统一个原理 。。那并非查漏了, ,,,,是权重照着训练里的老套路, ,,,,硬拼出一串工具 。。

再往底层看一眼, ,,,,就更清晰了 。。你写的const x = await fetch, ,,,,在模子眼里先被切成一个个token, ,,,,每个换成词内外的一个数字 。。

你写的一行代码, ,,,,被切成token后各自对应词内外的一个整数:const是1078, ,,,,await是2597, ,,,,词表约10万个 。。模子拿到的历来不是文字, ,,,,是这串数字 。。(图源:Anthropic官方博文)

模子不是一口吻吐出整段谜底的 。。它一次只展望一个token, ,,,,接上去, ,,,,再把整串重新算一遍, ,,,,展望下一个 。。一段两百个token的回复, ,,,,就是两百次完整的运算 。。

你等的时间、你烧的钱, ,,,,大头全在这个循环里 。。

再说Effort, ,,,,替换的是「态度」 。。

许多人以为高Effort就是「多想几秒」, ,,,,错了 。。

它管的是Claude在这次使命上究竟投入几多事情量:读几个文件、跑不跑测试、要不要特殊验证、要不要把一个多方法使命一起推究竟再回来找你 。。

说白了:低Effort的Claude, ,,,,倾向于快速回复, ,,,,然后反过来问你要更多上下文, ,,,,能不下手就不下手; ;高Effort的Claude, ,,,,倾向于自己去翻信息、多调一再工具、一口吻把长使命链跑完 。。

Effort在Claude Code里分成好几档, ,,,,别把它当成一条死板的token预算线 。。

它是个行为信号, ,,,,告诉Claude这活得干到多彻底、多有掌握才算完, ,,,,文本回复、工具挪用、扩展思索, ,,,,全在它的统领规模里 。。

官方还放了一张示意图:统一条prompt, ,,,,高Effort能比低Effort多吐约莫7倍的token 。。多出来的那些, ,,,,全花在读文件、跑验证、重复确认上了 。。

统一条prompt, ,,,,高Effort路径天生的token约为低Effort的7倍, ,,,,多出的全花在读文件、跑验证、重复确认上 。。(图源:Anthropic官方博文)

这里藏着一个反直觉的结论:小模子开高Effort, ,,,,完全可醒目翻大模子开低Effort 。。

照旧不敷起劲

知道了分工, ,,,,真正有用的, ,,,,是官方给的那套判断框架 。。

官方判断框架:Claude做错了, ,,,,先问它是不敷智慧照旧不敷起劲, ,,,,再决议换模子照旧加Effort 。。(图源:Anthropic官方博文)

Claude干砸了, ,,,,先别急着动模子选项 。。

第一步永远是转头查上下文:prompt说清晰了吗 ??该给的工具给了吗 ??CLAUDE.md配对了吗 ??大大都所谓「AI变笨」, ,,,,根子都在这儿, ,,,,不在模子选项上 。。

上下文确实没问题、它照旧错, ,,,,就问自己一句:它是不会, ,,,,照旧不敷起劲 ??

「不敷起劲」, ,,,,很好判断:该读的文件跳过了、测试没跑、重构干到一半跑回来问你:它缺的不是脑子, ,,,,是投入 。。

这是Effort的事, ,,,,可以往上调一档 。。

若是「不会」, ,,,,则是另一种情形:你上下文给足了, ,,,,它也显着起劲了, ,,,,可照旧错, ,,,,换个说法再试一遍照旧错 。。

这时间任你怎么加Effort都白搭, ,,,,这是模子的事:就要换更强的 。。

官方还打了个特殊好懂的例如 。。

Sonnet, ,,,,是个有一整个下昼的万能选手 。。

它会把你的代码重新读到尾, ,,,,跑一遍、再验一遍, ,,,,最后是真把你这摊活儿吃透了 。。

Opus, ,,,,是只给你五分钟的专家 。。它带来的是你代码库里压根没有的履历, ,,,,见过的坑、该绕的雷, ,,,,全是解过一堆同类问题攒下的直觉 。 ??晌宸种泳湍敲吹闶奔, ,,,,只够它扫一眼, ,,,,不可扫遍所有文件 。。

Fable, ,,,,是所有人都卡住了才请得动的专科 。。哪怕只给五分钟, ,,,,它也能一眼揪出别人谁都没看出的那处误差 。。

虽然, ,,,,这位专家每个token也最贵, ,,,,得留给真正没人能接的硬骨头 。。

以是才有谁人反知识的结论:

一个Sonnet开高Effort, ,,,,在不少活儿上真醒目过Opus开低Effort 。。小模子配上富足上下文和高投入, ,,,,能扛下的事比你想象的要多得多 。。

长使命、多方法活上, ,,,,Fable拉开最大差别, ,,,,官方测试里有些使命Opus和Sonnet开到任何Effort都够不着 。。(图源:Anthropic官方博文)

卷完模子排行榜

给AI派活成了硬手艺

这篇官方解读, ,,,,外貌上是教你调参, ,,,,背后是一个主要的转向:

AI编程的竞争, ,,,,正在从「谁的模子更强」, ,,,,转向「谁更会调理智能体」 。。

已往很简朴, ,,,,人挑一个最强的模子, ,,,,剩下的全交给它 。。

现在纷歧样了 。。你得像个项目司理那样, ,,,,给差别的模子派差别的角色、定差别的投入档位:

简朴的改动交给Sonnet挂低档, ,,,,秒回还省钱; ;大型重构上强模子加高等; ;要长时间自己跑的智能体使命, ,,,,强模子配足Effort 。。

这些操作, ,,,,不但能把活干得更好, ,,,,省下来的, ,,,,都是真金白银的token账单 。。

Claude Code的Effort菜单里多出的那档ultracode, ,,,,就是把这套「调理」做进了产品 。。

选中它, ,,,,Claude拿到的是xhigh的火力, ,,,,外加一项授权:遇到实质性的活儿, ,,,,自己掂量要不要拉起一支智能体步队, ,,,,把使命拆下去并行干 。。

转头看3月那场「变笨」风浪 。。

它能惊动整个社区, ,,,,恰恰由于大大都人还停在「换模子」的老思绪里, ,,,,敌手边这个更要命的Effort选项浑然不觉 。。

只看模子排行的时代正在已往, ,,,,调理模子, ,,,,正在成为焦点手艺 。。

谁先学会给AI派活, ,,,,谁就能争先一步, ,,,,用上谁人真正肯为你认真的Claude 。。否则, ,,,,你手里再贵的模子, ,,,,也执偾一个更贵的搜索框 。。

这样, ,,,,你烧的每一分token, ,,,,才算真花在了刀刃上 。。

参考资料:

https://claude.com/blog/claude-model-and-effort-level-in-claude-code

https://x.com/ClaudeDevs/status/2074900291062034618?s=20

https://platform.claude.com/docs/en/managed-agents/multi-agent

编辑:元宇

当日例行记者会上, ,,,,有记者问:据报道, ,,,,日本防卫大臣小泉进次郎在7月17日的网络节目中果真提出, ,,,,日本应毫无禁忌地讨论与核武器相关的政策, ,,,,引发日本海内和国际社会强烈关注 。。针对国会中在野党对“无核三原则”和核潜艇相关问题的质询, ,,,,小泉体现:“当下我们是不是总把恪守既有框架放在首位, ,,,,把真正守卫日本摆在了后面 ??”讨教中方对此有何谈论 ??

责任编辑:王文正

【网站地图】