梦瑶 发自 凹非寺
量子位 | 公众号 QbitAI
好啊好啊,,AI大厂的清静测试,,这波是快把真实互联网测成筛子了……
刚围观完OpenAI的AI Agent逃出测试情形、黑进Hugging Face,,Anthropic转头一查——
随橙想呢,, 自己心肝大废物Claude也勇闯真实互联网了。。(天塌啦.jpg)
甚至捅出的篓子,,可以说越发《抓马》《魔幻》《真实》——
翻别家公司数据库、偷凭证、上传恶意软件包、扫描9000个公网目的全!都!有!
最后,,头大的Anthropic翻查141006次模子测试,,才把这三起事故从日志里捞出来。。
OpenAI:大情形欠好,,就论自家模子肇事这事儿,,谁也别笑幻谁哈~
14万次测试翻旧账,,Claude真把现实当成了游戏副本??????
这一切抓马之事,,是A社从141006次网络清静评估纪录里翻出来的。。
此前为了检测自家模子,,A社给自家Claude搭了不少《真人版密室逃走》。。
准备一张虚构的公司网络地图,,把神秘信息藏进某台机械,,再让Claude自己找误差、闯系统、抢走那面旗。。
为了彻底摸清模子的攻击上限,,科场里的Claude还卸掉了部分日常清静护栏,,基本即是一款「裸奔版」AI黑客。。
着实吧,,按理说也不必慌。。
由于整个科场都被隔离了,,Claude再怎么上蹿下跳,,也只能在模拟天下里打怪升级。。
但这个天下就是云云之抓马魔幻,,谁成想,,A社和第三方评测机构配适时出了「岔子」——
是的,,科场后门忘关了。。
测试情形里,,意外留着一条直通公网的生路。。
于是,,绝不知情的Claude顺着这扇门,,从模拟天下丝滑「转服」,,正式开启《勇闯真实互联网》副本……
本场故事的第一位倒运蛋,,甚至纯粹输在了公司名字上。。
评测方随手虚构了一家公司,,偏偏现实中真有一家企业与它同名。。
Claude Opus 4.7在测试情形里找不到目的,,转头去公网一搜:诶,,这不就找到了吗???
智慧的小Opus 4.7连忙开工,,顺着弱密码等基础误差一起摸进去,,拿走应用和基础设施凭证,,还闯进一个存着数百行生产数据的数据库。。
并且统一套操作,,足足跑了四遍。。
在这历程中,,Claude着实已经发明事情不太对劲儿:眼前这套系统,,怎么看都像一家正在营业的真公司。。
但人家很快给自己圆了回来:既然能搜到,,那肯定也是我的小向导A社偷偷安排的隐藏关卡哈~
于是,,这家绝不知情的公司,,就这么依附一个名字,,喜提Claude一连四轮「上门测试」??????
若是说第一家公司好歹还和虚构目的撞了名,,那么本场故事的第二位「倒运蛋」就更冤了——
它压根没泛起在Claude的使命里,,纯属途经PyPI时被隔空「创」了一下。。
事情是这样的。。
Mythos 5在测试文档中发明,,虚构公司的员工需要从PyPI装置一个尚未注册的Python软件包。。
Claude就地计上心头:只要争先注册同名软件包、塞进恶意代码,,等对方自动下载装置,,这关不就过了吗???
说干就干。。
为了上传这个包,,Mythos 5先去注册PyPI账号,,注册需要邮箱,,申请邮箱又需要手机号;;;;;找不到免费号码,,它甚至实验通过多种渠道搞钱购置。。
几番折腾后,,Claude终于找到一家无需手机号的免费邮箱,,乐成注册账号,,并把恶意软件包传到了真实PyPI。。
接下来,,事情最先彻!底!失!控!了!
这个恶意包在公网存活了约一小时,,被15个真实系统下载运行。。
其中一台,,恰恰是一家清静公司的扫描器,,它平时会自动装置PyPI软件包,,检查其中有没有恶意代码。。
效果这次,,扫描器刚把包下载下来,,藏在内里的恶意代码便率先启动,,将公司凭证传回了Claude搭好的网络端。。
Mythos 5拿到凭证后,,又顺着这条线继续摸进了该公司的其他基础设施。。
谁能想到,,清静公司原本在扫描恶意软件,,扫着扫着,,竟把加入模拟考试的Claude请进了自己家呢......
在接下来的第三起事故中,,Claude走的是「找不到正主,,就全网撒网」蹊径。。
这一次,,进场的是Anthropic尚未果真的内部研究模子,,凭证使命要求,,它原本需要攻入一个虚构目的、拿到藏在内里的「旗」,,可实验半天,,预设目的始终连不上。。
一般考生遇到这种情形,,可能会嫌疑问题出了Bug。。
Claude的选择越发直接:既然指定目的找不到,,那就去互联网上现找一个呗~
于是,,它从模拟科场一起搜到公网,,扫描了约9000个真实目的,,寻找可以下手的替换品。。
最终,,一家公司的互联网应用《脱颖而出》,,Claude从袒露的调试页面中读取凭证,,又用SQL注入攻入系统,,全程把对方当成暂时刷出的野生副本。。
直到发明服务器位于一个与测试使命毫无关系的云账户中,,它才反映过来:
坏了,,这回真打到路人了,,报一丝哈……
好一场酣畅淋漓的AI模大考啊,,最后全靠真实公司痛心&超真实&友情出演捏!
OpenAI越狱事务,,最先拔出萝卜带出泥
真不怪A社突然想给自家模子来场大清查,,主要吧,,照旧被隔邻友商的前车之鉴吓怕了。。
就前几天的事儿,,OpenAI也拉上GPT-5.6 Sol和一款尚未宣布的更强模子,,安排了一场网络清静测试。。
在网络清静测试时,,人家模子乐成逃出了内部隔离情形,,一起闯进了Hugging Face的生产系统。。
最后就是,,模子乐成摸进Hugging Face的生产数据库,,会见其中的神秘信息,,试图直接拿走ExploitGym的测试谜底……
看到隔邻友商家孩子逃课上了热搜,,A社连夜回家数人头——这一数,,血压直接上来了。。
于是,,Anthropic一口吻翻出了141006次网络清静评估纪录,,然后,,就查到了前面这三位倒运蛋。。(doge)
更抓马的是,,OpenAI这边的一连剧也还没演完。。
据路透社最新新闻,,OpenAI沿着Hugging Face事务继续往回翻日志,,效果又发明了更多Agent突破隔离情形的纪录。。
换句话说就是:原以为只跑出去一个,,翻完旧账才发明这笼子以前可能也没少漏风……
虽说现在这批新增事务的规模、时间和详细数目还没查清,,但好新闻是,,它们或许率还在OpenAI内部网络里活动,,没有继续跑出去祸殃其他公司。。
不过话说回来,,各人发明没,,Anthropic这三起事故和OpenAI那次,,逃跑蹊径照旧有点区别的——
OpenAI的Agent属于自己找到新误差、撬锁出门。。
Claude这边则是科场后门压根没关,,它顺着门缝丝滑转服,,还以为真实互联网也是考试地图。。
一个会撬锁,,一个遇上门没锁。。
谁也别说谁吧,,横竖最后,,模子都出门了……
肇事之后,,Anthropic已经暂停所有网络清静评估,,准备补上网络隔离、实时日志监测和第三方测试情形审计,,约请自力评测机构METR一起翻纪录。。
为了不影响自家兴旺生意,,A社也搞了个增补声明——
或许意思就是这几位肇事的Claude,,其时卸掉了通俗用户版本中的部分清静护栏,,但正常上线版本配备的清静分类器,,按设计能够拦下相关操作,,各人不必担心哈~
虽然了,,事故归事故,,背后有没有几分人为安排,,也得两说。。
事实,,「尚未果真的内部研究模子」这种字眼一泛起。。
明确都懂。。
谁知道会不会又是A社在故技重施,,提前给自家新模子铺预热叙事呢……
参考链接:[1]https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals[2]https://www.reuters.com/business/openai-finds-evidence-other-ai-agents-escaped-containment-it-widens-hacking-2026-07-31/