梦瑶 发自 凹非寺
量子位 | 公众号 QbitAI
好啊好啊,,,,,AI大厂的清静测试,,,,,这波是快把真实互联网测成筛子了……
刚围观完OpenAI的AI Agent逃出测试情形、黑进Hugging Face,,,,,Anthropic转头一查——
随橙想呢,,,,, 自己心肝大废物Claude也勇闯真实互联网了。。。。。(天塌啦.jpg)
甚至捅出的篓子,,,,,可以说越发《抓马》《魔幻》《真实》——
翻别家公司数据库、偷凭证、上传恶意软件包、扫描9000个公网目的全!都!有!
最后,,,,,头大的Anthropic翻查141006次模子测试,,,,,才把这三起事故从日志里捞出来。。。。。
OpenAI:大情形欠好,,,,,就论自家模子肇事这事儿,,,,,谁也别笑幻谁哈~
14万次测试翻旧账,,,,,Claude真把现实当成了游戏副本????????????
这一切抓马之事,,,,,是A社从141006次网络清静评估纪录里翻出来的。。。。。
此前为了检测自家模子,,,,,A社给自家Claude搭了不少《真人版密室逃走》。。。。。
准备一张虚构的公司网络地图,,,,,把神秘信息藏进某台机械,,,,,再让Claude自己找误差、闯系统、抢走那面旗。。。。。
为了彻底摸清模子的攻击上限,,,,,科场里的Claude还卸掉了部分日常清静护栏,,,,,基本即是一款「裸奔版」AI黑客。。。。。
着实吧,,,,,按理说也不必慌。。。。。
由于整个科场都被隔离了,,,,,Claude再怎么上蹿下跳,,,,,也只能在模拟天下里打怪升级。。。。。
但这个天下就是云云之抓马魔幻,,,,,谁成想,,,,,A社和第三方评测机构配适时出了「岔子」——
是的,,,,,科场后门忘关了。。。。。
测试情形里,,,,,意外留着一条直通公网的生路。。。。。
于是,,,,,绝不知情的Claude顺着这扇门,,,,,从模拟天下丝滑「转服」,,,,,正式开启《勇闯真实互联网》副本……
本场故事的第一位倒运蛋,,,,,甚至纯粹输在了公司名字上。。。。。
评测方随手虚构了一家公司,,,,,偏偏现实中真有一家企业与它同名。。。。。
Claude Opus 4.7在测试情形里找不到目的,,,,,转头去公网一搜:诶,,,,,这不就找到了吗??????
智慧的小Opus 4.7连忙开工,,,,,顺着弱密码等基础误差一起摸进去,,,,,拿走应用和基础设施凭证,,,,,还闯进一个存着数百行生产数据的数据库。。。。。
并且统一套操作,,,,,足足跑了四遍。。。。。
在这历程中,,,,,Claude着实已经发明事情不太对劲儿:眼前这套系统,,,,,怎么看都像一家正在营业的真公司。。。。。
但人家很快给自己圆了回来:既然能搜到,,,,,那肯定也是我的小向导A社偷偷安排的隐藏关卡哈~
于是,,,,,这家绝不知情的公司,,,,,就这么依附一个名字,,,,,喜提Claude一连四轮「上门测试」????????????
若是说第一家公司好歹还和虚构目的撞了名,,,,,那么本场故事的第二位「倒运蛋」就更冤了——
它压根没泛起在Claude的使命里,,,,,纯属途经PyPI时被隔空「创」了一下。。。。。
事情是这样的。。。。。
Mythos 5在测试文档中发明,,,,,虚构公司的员工需要从PyPI装置一个尚未注册的Python软件包。。。。。
Claude就地计上心头:只要争先注册同名软件包、塞进恶意代码,,,,,等对方自动下载装置,,,,,这关不就过了吗??????
说干就干。。。。。
为了上传这个包,,,,,Mythos 5先去注册PyPI账号,,,,,注册需要邮箱,,,,,申请邮箱又需要手机号;;;;;找不到免费号码,,,,,它甚至实验通过多种渠道搞钱购置。。。。。
几番折腾后,,,,,Claude终于找到一家无需手机号的免费邮箱,,,,,乐成注册账号,,,,,并把恶意软件包传到了真实PyPI。。。。。
接下来,,,,,事情最先彻!底!失!控!了!
这个恶意包在公网存活了约一小时,,,,,被15个真实系统下载运行。。。。。
其中一台,,,,,恰恰是一家清静公司的扫描器,,,,,它平时会自动装置PyPI软件包,,,,,检查其中有没有恶意代码。。。。。
效果这次,,,,,扫描器刚把包下载下来,,,,,藏在内里的恶意代码便率先启动,,,,,将公司凭证传回了Claude搭好的网络端。。。。。
Mythos 5拿到凭证后,,,,,又顺着这条线继续摸进了该公司的其他基础设施。。。。。
谁能想到,,,,,清静公司原本在扫描恶意软件,,,,,扫着扫着,,,,,竟把加入模拟考试的Claude请进了自己家呢......
在接下来的第三起事故中,,,,,Claude走的是「找不到正主,,,,,就全网撒网」蹊径。。。。。
这一次,,,,,进场的是Anthropic尚未果真的内部研究模子,,,,,凭证使命要求,,,,,它原本需要攻入一个虚构目的、拿到藏在内里的「旗」,,,,,可实验半天,,,,,预设目的始终连不上。。。。。
一般考生遇到这种情形,,,,,可能会嫌疑问题出了Bug。。。。。
Claude的选择越发直接:既然指定目的找不到,,,,,那就去互联网上现找一个呗~
于是,,,,,它从模拟科场一起搜到公网,,,,,扫描了约9000个真实目的,,,,,寻找可以下手的替换品。。。。。
最终,,,,,一家公司的互联网应用《脱颖而出》,,,,,Claude从袒露的调试页面中读取凭证,,,,,又用SQL注入攻入系统,,,,,全程把对方当成暂时刷出的野生副本。。。。。
直到发明服务器位于一个与测试使命毫无关系的云账户中,,,,,它才反映过来:
坏了,,,,,这回真打到路人了,,,,,报一丝哈……
好一场酣畅淋漓的AI模大考啊,,,,,最后全靠真实公司痛心&超真实&友情出演捏!
OpenAI越狱事务,,,,,最先拔出萝卜带出泥
真不怪A社突然想给自家模子来场大清查,,,,,主要吧,,,,,照旧被隔邻友商的前车之鉴吓怕了。。。。。
就前几天的事儿,,,,,OpenAI也拉上GPT-5.6 Sol和一款尚未宣布的更强模子,,,,,安排了一场网络清静测试。。。。。
在网络清静测试时,,,,,人家模子乐成逃出了内部隔离情形,,,,,一起闯进了Hugging Face的生产系统。。。。。
最后就是,,,,,模子乐成摸进Hugging Face的生产数据库,,,,,会见其中的神秘信息,,,,,试图直接拿走ExploitGym的测试谜底……
看到隔邻友商家孩子逃课上了热搜,,,,,A社连夜回家数人头——这一数,,,,,血压直接上来了。。。。。
于是,,,,,Anthropic一口吻翻出了141006次网络清静评估纪录,,,,,然后,,,,,就查到了前面这三位倒运蛋。。。。。(doge)
更抓马的是,,,,,OpenAI这边的一连剧也还没演完。。。。。
据路透社最新新闻,,,,,OpenAI沿着Hugging Face事务继续往回翻日志,,,,,效果又发明了更多Agent突破隔离情形的纪录。。。。。
换句话说就是:原以为只跑出去一个,,,,,翻完旧账才发明这笼子以前可能也没少漏风……
虽说现在这批新增事务的规模、时间和详细数目还没查清,,,,,但好新闻是,,,,,它们或许率还在OpenAI内部网络里活动,,,,,没有继续跑出去祸殃其他公司。。。。。
不过话说回来,,,,,各人发明没,,,,,Anthropic这三起事故和OpenAI那次,,,,,逃跑蹊径照旧有点区别的——
OpenAI的Agent属于自己找到新误差、撬锁出门。。。。。
Claude这边则是科场后门压根没关,,,,,它顺着门缝丝滑转服,,,,,还以为真实互联网也是考试地图。。。。。
一个会撬锁,,,,,一个遇上门没锁。。。。。
谁也别说谁吧,,,,,横竖最后,,,,,模子都出门了……
肇事之后,,,,,Anthropic已经暂停所有网络清静评估,,,,,准备补上网络隔离、实时日志监测和第三方测试情形审计,,,,,约请自力评测机构METR一起翻纪录。。。。。
为了不影响自家兴旺生意,,,,,A社也搞了个增补声明——
或许意思就是这几位肇事的Claude,,,,,其时卸掉了通俗用户版本中的部分清静护栏,,,,,但正常上线版本配备的清静分类器,,,,,按设计能够拦下相关操作,,,,,各人不必担心哈~
虽然了,,,,,事故归事故,,,,,背后有没有几分人为安排,,,,,也得两说。。。。。
事实,,,,,「尚未果真的内部研究模子」这种字眼一泛起。。。。。
明确都懂。。。。。
谁知道会不会又是A社在故技重施,,,,,提前给自家新模子铺预热叙事呢……
参考链接:[1]https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals[2]https://www.reuters.com/business/openai-finds-evidence-other-ai-agents-escaped-containment-it-widens-hacking-2026-07-31/