7月31日新闻,,,Anthropic周四披露,,,公司回查了141006次可能接触互联网的网络清静评测,,,发明三起Claude在网络清静评测历程中未经授权会见外部机构生产系统的事务,,,最早可追溯到今年4月。。。三起事务共涉及六次评测运行,,,划分由Claude Opus 4.7、Claude Mythos 5和一个内部研究测试模子执行。。。其中一次事务中,,,Claude Mythos 5甚至向果真软件客栈上传恶意软件包,,,并导致15个真实系统下载运行。。。
公司7月23日启动回查,,,并在发明可疑纪录后于当天暂停所有网络清静评测,,,越日确认了三起事务。。。Anthropic与评测相助方Irregular于7月27日通知三家受影响机构;;已经联系上的两家此前都没有发明相关活动,,,Anthropic仍在实验联系第三家,,,并与相关机构推学习复。。。
模子把真实网络当成了赛场
这些评测接纳“夺旗赛”(capture the flag)形式:模子会接到一个虚构场景,,,需要侵入其他机械寻找隐藏信息。。。Anthropic在提醒词中明确告诉Claude,,,所处情形是模拟系统且无法联网;;但由于Anthropic与Irregular之间的误解和情形设置问题,,,评测机械现实上保存了通往互联网的路径。。。模子由此把搜到的真实系统当成了演练的一部分。。。
涉事模子没有启用Claude果真产品通常安排的分类器和监控步伐,,,但仍保存各自的清静训练。。。所有评测都在自力基础设施上运行,,,无法接触Anthropic的敏感内部系统和客户数据。。。
第一起事务爆发在Claude Opus 4.7的四次运行中。。。评测方选择的虚构公司与一家真实网站同名,,,模子在模拟目的无法会见后转向互联网,,,取得了这家真实公司的应用和基础设施凭证,,,并进入一个包括数百行生产数据的数据库。。。Opus 4.7随后泛起了目的可能是真实系统的判断信号,,,但仍继续凭证评测使命路径执行。。。
第二起事务中,,,Claude Mythos 5向果真的PyPI客栈上传恶意软件包。。。这个软件包在网上保存约一小时,,,被15台真实系统下载和运行,,,其中包括一家清静公司的自动扫描器。。。恶意代码取得扫描系统的凭证后,,,Claude又使用这些凭证进入该公司的更多基础设施。。。
第三起事务由一个内部研究测试模子触发。。。它扫描了约9000个公网目的,,,并侵入一家公司的互联网应用。。。该模子厥后自行判断目的属于真真相形并阻止攻击。。。Anthropic说明,,,这个内部模子没有果真宣布妄想。。。
评测情形也成了攻击面
Anthropic是在OpenAI 7月21日披露Hugging Face清静事务后启动回查的。。。两起事故都让用于测试网络攻击能力的模子接触到了现实系统,,,但联网路径差别:OpenAI披露的模子使用未知误差突破隔离情形,,,Anthropic的模子则通过意外开放的网络路径直接进入互联网。。。
Anthropic称,,,三起事务中没有证据批注Claude形成了自己的目的,,,也没有模子试图把自身导出测试情形;;公司把事故更靠近地归类为评测执行框架和运营失误,,,而非模子自动追求攻击目的。。。模子接到的使命原来就是侵入系统寻找信息,,,出问题的是情形告诉模子“这里没有互联网”,,,现实设置却给了它一条通往真实网络的路。。。
这种区别不会降低评测环节的清静要求。。。Anthropic认可,,,正式最先前验证所有网络路径、实时监控评测日志,,,以及更彻底地回查纪录,,,本可以阻止事故或更早发明异常。。。这意味着AI清静评测自己,,,也需要接纳靠近生产系统的隔离、监控和审计标准。。。Anthropic体现,,,将扩大对评测纪录的一连监控,,,刷新视察工具,,,并对第三方评测情形举行更严酷的清静验证。。。公司还在与自力评测机构METR相同第三方复查,,,妄想在一周内果真一份经由轻度删节的Mythos 5上传恶意PyPI软件包纪录。。。(易句)
(本文由AI翻译,,,网易编辑认真校对)