新智元报道
写代码这件事,,,,,,AI已经替你干了。????裳槭照饧事,,,,,,还压在你身上。。
一段代码究竟写没写对,,,,,,AI不认真,,,,,,最后还得你自己一行行看已往:这道坎,,,,,,卡住了许多人。。
最近,,,,,,Anthropic把AI验收也做进了循环。。
他们让Claude写完代码之后,,,,,,不直接交差,,,,,,而是自己接着跑四道检查:
/code-review先揪bug,,,,,,/simplify把冗余的实现整理清洁,,,,,,/verify做一遍端到端验证,,,,,,若是这次动了界面,,,,,,再用/design对着DESIGN.md核一遍视觉。。
四道跑完,,,,,,才算交付。。
7月22日,,,,,,Claude Code团队果真了这套内部的「验证循环」。。
换句话说,,,,,,Claude写完代码,,,,,,会自己先找错,,,,,,改到没问题再回来找你。。
这意味着AI最先从「会写代码」,,,,,,进化到「会检查自己写的代码」。。
智能体干活的闭环
多了一个验证
Anthropic给这套工具起了个名字,,,,,,叫验证循环(verification loop)。。
官方的界说很简朴,,,,,,它是一个Claude检查并实验修复自己事情的迭代历程。。
它改动的,,,,,,是智能体干活的闭环。。
以前是「网络上下文→执行行动→人工检查」,,,,,,最后那一步卡在人身上:AI把活儿交出来,,,,,,你得自己一行行看。。
现在这条线,,,,,,被拉长成了「网络上下文→执行行动→自动验证→修复→再验证」,,,,,,检查和修复,,,,,,被塞回了循环内里。。
Anthropic官方的智能体循环示意图:提醒进来后,,,,,,Claude网络上下文、执行行动、验证效果,,,,,,验证不过就打回重跑,,,,,,通过才返回。。
有些检查Claude原来就会做。。代码库里那些确定性的信号,,,,,,好比type checker、linter、跑测试、运行时报错,,,,,,它读得懂,,,,,,也会随手改掉。。
真正贫困的是另一类:界面改得对差池、用户流程顺不顺、这次改动有没有埋下看不见的坑……
这些已往只能靠人盯着,,,,,,同样的检查做上几十上百次。。
Anthropic的解法,,,,,,是把你每次都要手动做一遍的那些检查,,,,,,一条条写下来,,,,,,封装成Skill,,,,,,交给Claude在每次使命里自动执行。。
已往几十年,,,,,,软件工程所有的流程:写需求、做妄想、层层评审、开不完的会,,,,,,实质上都是由于:写代码太慢,,,,,,工程师的时间太值钱。。
可当AI把写代码这一环变快、变自制,,,,,,这个条件就不复保存了。。
Claude Code团队自己的判断是:瓶颈没有消逝,,,,,,它只是转移了:从「写代码」转移到了验证、代码评审、清静这些环节。。
代码天生得太快,,,,,,新的问题酿成了这些代码究竟对差池,,,,,,谁来维护,,,,,,人还跟不跟得上审代码的节奏。。
面临这个新瓶颈,,,,,,Claude Code团队先在自己身上做了实验。。
Claude Code团队
天天在用的4个自查Skill
Claude Code团队内部,,,,,,天天都在用这四个自查的Skill。。
/code-review,,,,,,专审代码改动,,,,,,把潜在的bug揪出来,,,,,,顺带给一份review意见。。
这即是给自己配了个不知疲倦的审稿人。。
/simplify,,,,,,整理这次改动的diff,,,,,,把绕来绕去的重大实现删掉,,,,,,让结构变简朴。。
它不给你加功效,,,,,,而是清掉冗余、简化实现,,,,,,把日后的维护本钱向下压。。
这一点很主要,,,,,,也最见功力。。大都人写代码都是往上堆,,,,,,能自动做减法的工具,,,,,,尤为难堪。。
/verify,,,,,,做端到端验证,,,,,,真刀真枪跑一遍,,,,,,确认功效是真的完成了,,,,,,而非「看起来完成了」。。
/design,,,,,,只在动了UI时上场。。它对着客栈里的DESIGN.md,,,,,,逐条核对你的视觉实现有没有跑偏。。
这4个Skill不是凭空长出来的。。
它们的底层,,,,,,Claude Code已铺了一层现成的验证支持:
内置的/verify能把应用跑起来视察转变,,,,,,你在CLAUDE.md里写清晰构建和测试下令,,,,,,它就照着执行;;尚有专门在PR上做多智能体审查的Code Review、能在每次提交时自动开火的GitHub Actions。。
团队那4个Skill,,,,,,即是在这层通用地基上,,,,,,又加了一道自己的工序。。
怎么写一个自己的验证Skill????
Anthropic给的步伐也很简朴:
把你每次都要手动做的那一步,,,,,,用明确话写下来,,,,,,就当你在给一个第一天入职的新同事交接注重事项。。
要是你连这步检查该怎么形貌都卡壳,,,,,,可以先让Claude给一版通用最佳实践,,,,,,再在上面改。。
你的版本或许率会在某几个点上跟通用做法纷歧样,,,,,,而那几处纷歧样,,,,,,恰恰就是最该被记下来的工具。。
检查也纷歧定非得是「感受对差池」这种模糊判断。。
举个例子:任何删掉数据库字段、却没配套数据迁徙方法的改动,,,,,,一律打回。。这是一条通用linter永远抓不到、却是你项目专属的「土规则」。。
通常你一直靠手动死盯才守得住的红线,,,,,,都值得写成一个循环。。
写完怎么办????
丢给skill-creator让它反过来采访你几句,,,,,,或者爽性自己往.claude/skills/里扔一个Markdown文件。。
最简朴的验证Skill,,,,,,就是几行说明加一段正文。。然后在一个新使命上调一次,,,,,,确认这步检查真的随着跑了,,,,,,差池再改。。
遇到那些你改不动的Skill,,,,,,好比内置的、插件托管的,,,,,,也有应对步伐:写一个外壳Skill,,,,,,让它先调原来的,,,,,,再调你的验证。。绕一下,,,,,,照样把检查嵌进去。。
验证不是一刀切
检查封装成Skill之后,,,,,,下一个问题是:这玩意儿什么时间触发????
Anthropic给了4档自动化水平,,,,,,从松到紧。。
Standalone:你自己想起来,,,,,,手动调一下。。
Embedded:嵌进某个使命流程,,,,,,随着一起跑。。
Chained:好几个验证Skill串成一条链,,,,,,一个接一个自动跑完。。
On every PR:最狠的一档,,,,,,每次提交接码都自动过一遍。。
官方管中心这层跃迁,,,,,,叫「从习惯到左券」。。
原来是「我每次都记得在/simplify后面补跑一次/verify」的个人习惯,,,,,,串成链之后,,,,,,就酿成「/simplify跑完,,,,,,自动就调/verify」的牢靠左券。。
整条链自己把开发循环走完,,,,,,只在需要你拍板时才回来找你。。
链条拉得越长,,,,,,可靠性越高,,,,,,但官方特意嘱咐了一句:链式验证会实打实地烧token。。
以是别一上来就把所有检查都设成PR gate、每次提交必卡,,,,,,准确姿势是先看它稳不稳,,,,,,再一步步往上加。。
4个Skill背后
AI编程正在换赛道
4个Skill背后,,,,,,AI编程的竞争,,,,,,正在从天生转向验证。。
Claude Code之父,,,,,,也给过统一个判断。。
今年6月9日,,,,,,他发推说:在强盛模子能长时间自主运行的时代,,,,,,自我验证是让模子跑得更久、效果更贴近你预期的要害:你不必守在一旁频仍盯着Claude,,,,,,就能把更多活儿交出去。。
说白了,,,,,,验证做得越扎实,,,,,,智能体才敢铺开了跑;;跑得越久,,,,,,人越省心。。
已往我们靠提醒词,,,,,,可它也有个天花板:只解决这一次的使命,,,,,,下次还得重新再来。。
这里先纠正一个常见的误解:Skill不是一段Markdown提醒词。。
它是一个能力????,,,,,,内里装着指令、文件结构、剧本、工具挪用、设置和一整套事情流程,,,,,,是把团队的检查方法、设计规范、踩过的坑,,,,,,沉淀成一个随叫随到的包,,,,,,Claude需要时自己去翻。。
更要害的是,,,,,,Skill正在从Claude Code的一个特征,,,,,,酿成跨厂商的开放标准。。
据业界的梳理,,,,,,GitHub Copilot、Cursor、OpenAI Codex、Gemini CLI都已经接纳统一套名堂。。
这意味着,,,,,,你为团队沉淀的那些Skill,,,,,,不会被锁死在某一家工具上,,,,,,它会把团队的履历、规范、检查流程沉淀下来,,,,,,酿成一块能重复挪用的能力。。
这也引出这样一个扎心的现实:统一个Claude,,,,,,差别团队用出来的效率,,,,,,可能差出好几倍,,,,,,造成这个差别不在模子,,,,,,而在于事情流:
你有没有把检查写成Skill,,,,,,有没有搭起验证循环,,,,,,有没有让智能体自己把反馈闭环跑通。。
说究竟,,,,,,智能体的能力,,,,,,就是一道加法题:模子,,,,,,加工具,,,,,,加验证机制,,,,,,加事情流程。。
模子这一项,,,,,,各家越来越靠近。。真正拉开距离的是后面那三项,,,,,,它们全掌握在用户手里。。
虽然,,,,,,这篇博客所展示的,,,,,,是AI辅助开发的流程优化,,,,,,而非「AI已经能自力写软件」。。它仍离不开工程师,,,,,,也没法脱离人去做生产级交付。。
因此,,,,,,它不是智能体要来抢人类工程师的饭碗,,,,,,但偏向已经很清晰了。。
已往,,,,,,我们一直在教AI怎么写代码,,,,,,现在要最先教它验证自己写得对差池。。
关于一个天天要用AI写代码的人来说,,,,,,比及「下班前还到手动复查一遍」这件事终于能放心交给AI的那天,,,,,,它才算真正最先替你扛活了。。
参考资料:
https://claude.com/blog/building-verification-loops-in-claude-code-with-skills
https://claude.com/blog/getting-started-with-loops?utm_source=chatgpt.com
编辑:元宇