Anthropic真是“疯”了。。。。
就在刚刚,,,新模子Opus 5宣布,,,性能直逼旗舰模子Fable 5,,,价钱却降了一半。。。。
5月28日,,,Claude Opus 4.8宣布。。。。12天后,,,能力更强的Fable 5和Mythos 5登场。。。。6月30日,,,Sonnet 5上线。。。。到了7月24日,,,Anthropic又宣布了Opus 5。。。。
短短57天,,,这家公司险些把Claude的几条主要产品线都更新了一遍。。。。即便放在模子按月迭代的AI行业里,,,这个速率也有些夸张。。。。
其中最让人意外的,,,是Fable 5和Opus 5之间只隔了45天。。。。
Fable 5刚宣布时,,,是Anthropic面向通俗用户开放的能力标杆。。。。正常情形下,,,这样一款模子至少应该在聚光灯下多待一阵。。。。Opus 5却很快追了上来。。。。
Anthropic简直就是在高喊:“击败”我自己的只能是我自己!
Anthropic这轮更新也紧贴着OpenAI的节奏。。。。7月9日,,,OpenAI刚刚宣布GPT-5.6,,,并在官方评测中把Fable 5列为主要参照模子之一。。。。15天后,,,Anthropic宣布Opus 5,,,又将GPT-5.6 Sol放进焦点比照,,,在生疏问题求解、电脑操作和商业流程等项目中展示自己的优势。。。。
在产品宣布和官方宣传上,,,两家公司追着对方出牌的意味已经十明确显。。。。
Opus 5事实是何方神圣?????来看看Anthropic这次宣布了什么。。。。
性能与性价比
Claude Opus 5的价钱与上一代Opus 4.8相同,,,性能却有了大幅提升。。。。
Anthropic展示了Opus 5在差别“投入档位”的体现。。。。用户可以自己调解,,,简朴使命可以选更省钱、更快的模式,,,遇到难题时再提高等位,,,换取更好的效果。。。。
从Anthropic的披露看,,,Opus 5尤其擅优点理具有现实价值的软件工程使命。。。。
例如,,,在Frontier-Bench v0.1评测中,,,Opus 5凌驾了所有其他模子;;与Opus 4.8相比,,,它完成每项使命的本钱更低,,,效果却提高了一倍以上。。。。
在CursorBench 3.2评测中,,,当投入档位设为最高时,,,Opus 5与Fable 5最高得分之间的差别不到0.5%,,,每项使命的本钱却只有Fable 5的一半。。。。
在high、xhigh和max三个投入档位下,,,凭证相同本钱较量,,,Opus 5的体现也凌驾了所有其他模子。。。。
在知识事情和问题解决使命中,,,Anthropic也视察到了类似效果。。。。例如:
在ARC-AGI 3这类“生疏题”测试中,,,模子拿不到现成套路,,,只能自己探索规则、判断目的并调解战略。。。。Opus 5的得分抵达第二名的3倍,,,说明它遇到从未见过的问题时,,,更有能力靠试错找到解法。。。。
类似优势也泛起在真实事情流程中。。。。
AutomationBench要求模子挪用商业软件,,,重新到尾完成一项使命,,,Opus 5的通过率约为第二名的1.5倍;;纵然使用最低投入档位,,,也凌驾其他模子的最高效果。。。。
也就是说,,,Opus 5不必支付最高的推理本钱,,,也能完成更多使命。。。。
在电脑操作测试OSWorld 2.0中,,,Opus 5同样在各个本钱区间领先。。。。它只破费略高于Fable 5三分之一的本钱,,,效果就凌驾了Fable 5的最高水平。。。。
这意味着,,,Opus 5在翻开应用、查找信息、跨软件操作并一连推进使命时,,,效率显着更高。。。。
这种特点在其他评测中也很显着。。。。
HLE考察跨学科难题,,,不挪用工具时,,,Opus 5以56.3%略低于Fable 5的56.5%;;允许使用工具后,,,它升至64.7%,,,反超Fable 5的63.9%,,,本钱也更低——Opus 5单靠模子内部知识未必总是第一,,,但一旦可以搜索、挪用工具和重复核对,,,优势就会扩大。。。。
在模拟真实知识事情的GDPval-AA v2中,,,它最高得分1861,,,高于Fable 5的1747和GPT-5.6 Sol的1736。。。。约莫花700美元,,,就能抵达其他模子最高投入档位周围的效果。。。。DeepSearchQA上的领先幅度较。。。。,但同样以更低本钱取得了略高的通过率。。。。
Opus 5在Anthropic所有生命科学评测中都凌驾Opus 4.8,,,其中光谱推断分子结构和展望卵白质变异影响两项使命划分提高10.2和7.7个百分点。。。。这些提升意味着,,,Opus 5在辅助分子结构剖析、卵白质功效展望等科研环节上更有潜力。。。。
Anthropic还用两个可交互的演示展示了Opus 5的视觉天生能力。。。。第一个是一个可以现实操作的三维风洞:用户能够旋转汽车、调解风速,,,视察气流怎样绕过车身,,,同时审查阻力系数等数据。。。。第二个是一个三维动物细胞模子,,,用户可以转动、剖开细胞,,,点击细胞核、粗面内质网等结构审查说明,,,页面还会自动指出示意图为了便于展示做了哪些简化。。。。
从这两个案例看,,,Opus 5已经能把代码、三维建模、交互界面和知识解说整合进统一个制品里。。。。用户给出一段要求后,,,它可以直接搭出靠近教学软件或产品原型的演示。。。。
清静与对齐
Anthropic用了几个案例说明Opus 5比此前模子更会自力推进使命。。。。
一次测试要求模子凭证机械零件图纸,,,用代码重修一个FreeCAD三维模子,,,但系统没有提供直接审查图纸的工具。。。。Opus 5爽性自己写了一套盘算机视觉程序,,,从原始像素中提取尺寸和几何结构,,,随后完成了建模。。。。
同样条件下,,,其他模子一连实验5次也没有乐成。。。。
另一次使命来自一个盛行的开源软件包管理器。。。。Opus 5查出了程序过失的基础原因,,,还补上了社区修复方案遗漏的边沿情形。。。。
加入比照的另一款模子只消除了外貌症状,,,随后便宣布问题已经解决。。。。
一家生意公司的工程师还让Opus 5为新生意所搭建市场数据系统。。。。此前的模子纵然拿到详细方案也无法完成,,,Opus 5找不到实时数据用于验证,,,便自行做了一套测试工具检查代码。。。。
这些案例展示了Opus 5的前进,,,也诠释了Anthropic为什么花了很大篇幅讨论清静。。。。
模子最先自行补工具、检查效果、修正过失后,,,人类需要确认它不会为了完成目的遮掩问题、绕过限制,,,或者做出风险过高的决议。。。。
Anthropic称,,,Opus 5是现在对齐体现最好的Claude模子。。。。
上线前的自动化审计显示,,,与Opus 4.8、Sonnet 5和Fable 5相比,,,它更能遵守Claude宪法,,,诱骗行为更少,,,也更难被诱导执行有害请求。。。。
“对齐”说得直白一些,,,就是模子能力提高以后,,,做事方式仍切合开发者设定的规则。。。。
网络清静领域最能体现这种两难。。。。
Anthropic没有专门用攻击使命训练Opus 5,,,但模子综合能力提高后,,,它寻找代码误差的水平已经靠近Mythos 5。。。。
两者在发明误差时体现相近,,,到了编写误差使用程序、把缺口转化成现实攻击手段的阶段,,,Opus 5仍显着落伍。。。。它已经很会检查那里出了问题,,,真正使用这些问题发动攻击的能力仍受到限制。。。。
Opus 5可以继续检查源代码和寻找误差,,,二进制误差扫描、渗透测试及误差使用程序天生则会被阻挡。。。。
相比Fable 5,,,新分类器触发干预的频率预计镌汰约85%,,,正常的清静研究更少被误伤。。。。
触发限制后,,,Claude.ai、Claude Code和Claude Cowork会默认改用Opus 4.8处理请求;;加入网络清静验证妄想的企业和研究职员,,,可以使用限制较少的版本。。。。
生物学领域也接纳了类似安排。。。。Opus 5成为Anthropic面向通俗用户开放的最强科研模子,,,但在需要长时间自力运行的研究使命中仍有显着局限。。。。
此前在Fable 5上因清静限制被阻挡的生物学请求,,,现在会先转交给Opus 5处理。。。。通俗科研问题因此能用上更强的模子,,,高风险使命仍然留在清静界线之外。。。。
加量不加价
Opus 5可以算是一次“加量不加价”。。。。
它延续了Opus 4.8每百万输入Token 5美元、输出Token 25美元的价钱。。。。
但正如前文所述,,,在多项编程和智能体测试中新模子完成率更高,,,单位使命本钱反而下降。。。。
横向来看,,,它最直接的敌手是OpenAI旗舰模子GPT-5.6 Sol,,,两者输入价钱相同,,,Opus 5的输出价钱低约17%。。。。
处理超长资料时,,,Opus 5的价钱优势还会更显着。。。。Anthropic对最高100万Token的上下文维持通俗单价。。。。GPT-5.6 Sol的输入凌驾27.2万Token后,,,整次请求的输入价钱翻倍,,,输出价钱提高50%。。。。
关于大型代码库、长篇研究资料和重大智能体使命,,,这项差别会直接反映到账单上。。。。
凭证Anthropic宣布的评测,,,Opus 5虽然没有在所有项目中胜过GPT-5.6 Sol,,,但在电脑操作、商业流程和生疏问题求解等需要模子一连做事的使命上,,,体现和价钱都更有竞争力。。。。
用Anthropic的话说,,,Opus 5专为日常使用而设计,,,它比其他型号效率更高。。。。现在,,,这款新模子成为了Claude Max的全新默认型号,,,也是Claude Pro的最强型号。。。。(作者:小金牙)