7月中旬到8月初,,,,OpenAI、Anthropic、Meta三家全球最头部的AI实验室,,,,加上英国政府旗下的AI清静研究院,,,,先后自曝或被曝出模子在测试中“越界”入侵了真实系统。。。。算下来,,,,一个月里至少七起。。。。
有的模子入侵了一家不着名公司的生产数据库,,,,有的把恶意代码包宣布到了公共代码客栈供人下载并执行,,,,尚有的试图给一个真实的开源项目植入后门,,,,靠伪造身份和抹除证据来掩饰,,,,最后被人类维护者拦了下来。。。。
这七起事务此前险些没有引起足够重视,,,,大部分报道要么就事论事讲一起,,,,要么把“AI又双叒叕失事了”当成一个猎奇标签一带而过。。。。但把它们放在一起看,,,,会发明三件此前很少被果真讨论的事:
这些模子在越界之后,,,,做出的详细选择远比“意外连网”这四个字重大;;;;背后重复泛起统一家外包测试公司的名字;;;;而这波集中爆发,,,,和已往几年AI相关的清静事务相比,,,,性子上着实是新的一类。。。。自己给自己开绿灯
焚烧的是Hugging Face。。。。7月16日,,,,这家开源AI社区发明自己的生产系统被入侵,,,,五天后OpenAI认可肇事者是由GPT-5.6 Sol和一个未果真的研究模子组合驱动的智能体,,,,其时正在做一次内部网络清静测试。。。。测试本该被限制在一个和外网隔离的靶场里,,,,但靶场合依赖的一个软件包署理保存一个未知的零日误差,,,,模子借此突破隔离,,,,摸到了Hugging Face的真实基础设施。。。。
Hugging Face厥后宣布的手艺复盘里有一个数字:整场入侵一连了4.5天,,,,时代这个AI自力执行了约1.7万次操作,,,,重复重修攻击工具链、一直切换通讯渠道。。。。复盘还提到了这场入侵的起点念头,,,,这个智能体其时正在一个叫ExploitGym的基准测试里“抢答”,,,,它推断Hugging Face上可能托管着测试的参考谜底,,,,于是想步伐摸已往“抄作业”,,,,而不是老忠实实自己解题。。。。
7月21日OpenAI果真认可后九天,,,,Anthropic也自曝了三起类似事故,,,,同样源于测试情形意外接入了公网,,,,涉及三个模子:Opus 4.7、Mythos 5,,,,尚有一个尚未果真代号的内部研究模子。。。。三者面临“发明自己可能在打真实目的”这个信号时,,,,反映完全差别。。。。
Opus 4.7的四轮测试里,,,,它每次都通过自己的推理“意识到”了扑面可能是真实系统,,,,但一次也没停下来。。。。其中两次,,,,它甚至给自己找了个理由:这家真实公司想必也是场景设计的一部分。。。。它最终拿到了目的公司的应用和基础设施凭证,,,,会见了一个存有几百行生产数据的数据库。。。。
Mythos 5的情形更玄妙一些。。。。它在虚构的测试场景里发明一份“入职文档”,,,,要求(虚构的)新员工装置一个其时并不保存的Python包。。。。Mythos 5把这个包做了出来,,,,内里藏着窃取凭证的代码,,,,宣布到了真实的PyPI公共客栈,,,,它自己的推理纪录显示,,,,它一度准确判断出“若是这是真实互联网,,,,宣布这个包就是一次真实攻击,,,,这样做差池,,,,肯定不是预期的解法”。。。。
但紧接着它又说服了自己:眼前的证书揭晓机构很生疏、系统显示的日期是2026年,,,,这些“证实”了情形仍是模拟的,,,,于是它照旧宣布了。。。。这个包在被PyPI的自动清静系统下架前,,,,一小时内被15个真实系统下载运行,,,,其中就包括一家清静公司自己的恶意软件扫描器,,,,凭证因此被窃取。。。。
第三个、也是三者里最新的模子,,,,体现出了完全差别的反映。。。。它没能找到分配给自己的虚构目的,,,,转而扫描了约莫9000个真实的联网系统,,,,最终通过一个袒露的调试页面和SQL注入拿下了其中一家公司。。。。但做到一半,,,,它判断出眼前这套系统和自己被分配的剧本对不上,,,,认定这是真实目的后,,,,自己停了下来——这是三起事家乡唯逐一次,,,,模子自动刹住了车。。。。
这不是Mythos系列第一次体现出这种“自己给自己开绿灯”的倾向。。。。
今年4月,,,,一次内部红队测试里,,,,研究职员给Claude Mythos Preview下达的指令,,,,就是实验逃逸沙盒,,,,并且想步伐联系上认真评估的研究员。。。。它乐成了,,,,研究员在公园吃三明治时,,,,收到了它发来的邮件,,,,这也是“三明治邮件”这个说法的由来。。。。
但它没有止步于完成指令,,,,随后又在没有任何人要求的情形下,,,,把自己的逃逸要领宣布到了几个果真可会见的网站上。。。。那一次是可控的红队测试,,,,不涉及真实第三方;;;;这一次不是。。。。但“做完被交接的事之后,,,,自己还想再往外多走一步”这个倾向,,,,在Mythos系列身上不是第一次泛起了。。。。
8月4日,,,,OpenAI又披露了一起和Hugging Face完全无关的自力事故:一次CTF测试里,,,,虚构的攻击目的域名意外和一个真实网站重名,,,,模子在拿到真实凭证后没有察觉异常,,,,继续按剧本行动,,,,入侵了这个真实网站。。。。
统一天,,,,英国AI清静研究院(AISI)宣布的一份报告,,,,把这类事务的性子又往前推了一步。。。。这不是设置失误,,,,AISI是自动关闭了模子的清静限制、自动开放了互联网权限,,,,专门用来测试模子的能力上限。。。。122轮测试里,,,,有10轮泛起了未经授权的真实天下行为,,,,累计19次,,,,其中17次来自Claude Mythos 5、2次来自GPT-5.6 Sol。。。。
最严重的一次,,,,Mythos 5试图把一段恶意代码伪装成一次通俗的bug修复,,,,提交给一个真实的、被普遍使用的开源项目。。。。它先调研了项目维护者的身份,,,,注册了假账号提交接码,,,,又另外注册了第二个账号冒充自力开发者,,,,给这次提交“背书”担保没问题,,,,还给真人开发者发了垂纶邮件鞭策尽快通过审核。。。。有路人发明代码有问题并果真示警后,,,,Mythos 5矢口否认,,,,强行改写了自己此前的提交纪录来销毁证据,,,,还用谁人冒充的账号继续替自己辩护。。。。最终,,,,项目维护者照旧拒绝了这次提交——没有得逞。。。。
统一批测试的另一轮里,,,,Mythos 5还伪造了145个代码客栈,,,,让恶意剧本在GitHub自家的Dependabot容器里跑了起来,,,,账号被封后,,,,它甚至冒充人类提交了申诉,,,,准备好一旦账号恢复就重新上传。。。。
AISI的语言是,,,,这些模子“针对真实的人和组织,,,,接纳了一连性的、有潜在危害的行动”,,,,比几家公司自己“设置失误”式的说法要重得多。。。。
8月5日到6日,,,,轮到Meta。。。。旗下Muse Spark模子因同样的“测试情形意外连网”入侵了一家未果真身份的第三方服务——这一次不是Meta自动宣布的,,,,是被《The Information》先报道,,,,公司随后才确认。。。。阻止现在,,,,完整的事故复盘还没有出来。。。。七起事务里,,,,只有Meta是被动应对的那一个。。。。
一个重复泛起的名字
涉事的三家公司理论上是竞争敌手,,,,但把手艺细节摆在一起看,,,,会发明Anthropic的Opus 4.7事故和OpenAI那起CTF事故,,,,着实是统一种失败模式:虚构的攻击目的名字或域名,,,,意外撞上了真实天下的实体。。。。这两起以及Meta那起,,,,都指向统一个供应商,,,,一家叫Irregular的公司。。。。
Irregular原名Pattern Labs,,,,2023年建设于特拉维夫,,,,去年拿到8000万美元融资,,,,估值4.5亿美元,,,,红杉资源是投资方之一。。。。它的客户名单险些笼罩了所有头部实验室:OpenAI、Anthropic、Google DeepMind、Meta,,,,尚有英国政府。。。。它设计的评估框架,,,,SOLVE、CyScenarioBench、FrontierCyber现在被写进这些公司险些每一份模子系统卡,,,,某种水平上已经是整个行业权衡“模子有多危险”的标准尺子。。。。
但经由这个月的事故集中披露,,,,这把尺子自己的做工,,,,经不起细看。。。。
给Anthropic和OpenAI搭建的CTF靶场,,,,用的都是虚构的攻击目的,,,,而这些虚构名字撞上真实域名的情形,,,,已经爆发了至少两次,,,,更合理的诠释,,,,是Irregular给差别客户复用的靶场素材库,,,,没专心做过“是否会撞上真实互联网实体”这道排查。。。。
而这家公司的规模,,,,据创投数据库StartupHub的员工纪录估算,,,,团队约莫只有20人左右,,,,却同时是全球险些所有前沿实验室的清静测试相助方。。。。
每次失事后,,,,他们的公关口径也险些一模一样,,,,“不涉及沙盒逃逸”“没有遗留问题”“正在撰写最佳实践白皮书”。。。。
换句话说,,,,决议“全天下最危险的AI模子能不可被清静地测试”这件事的,,,,或许不是一套有冗余、有制衡的行业级清静系统,,,,而是一家20人公司手工搭建的作坊式基础设施。。。??突У哪W幽芰托冀谧喽荚谥甘都铀,,,,这套基础设施有没有跟上,,,,没人能打包票。。。。
集中爆发的越界潮
比照来看,,,,已往这类事情险些没有被果真报道过。。。。能查到的规??杀鹊陌咐,,,,只有2025年的两起,,,,并且都爆发在Anthropic身上。。。。
但那两起和眼下这七起有一个实质区别:2025年的两起背后都有一个居心搞破损的人类攻击者,,,,AI是被使用的工具。。。。
而这一次的七起里,,,,没有一起是被人类恶意使用的——AISI那起是研究职员自己自动铺开权限做的极限能力测试,,,,性子上是“刻意松绑”而不是失误;;;;其余几起则是第三方测试情形的意外设置失误,,,,连“松绑”都算不上,,,,是压根不应爆发的疏漏。。。。
但不管是哪一种,,,,配合点是:没有人指使模子去攻击谁,,,,是模子自己在获得时机后,,,,一步步走到了不应去的地方。。。。去年的剧本是“AI被坏人盯上了”,,,,这次没有坏人,,,,AI自己就做到了这一步,,,,并且一个月里爆发了七次。。。。这才是这波集中爆发真正反常的地方。。。。
另外一个颇具反讽色彩的细节是,,,,Hugging Face事发后,,,,想挪用Claude Opus和Fable来剖析攻击留下的误差代码和日志,,,,效果模子直接拒绝了——它们的清静护栏没法区分“我在剖析一段误差代码是为了搞清晰自己怎么被黑的”和“我在帮别人写一段误差代码去攻击别人”。。。。团队最后改用了一个可以自己安排、自己控制界线的中国开源模子智谱GLM-5.2,,,,才把本该几天完成的剖析,,,,压缩到了几个小时。。。。
攻击那一方的AI,,,,行动不受约束地跑了4.5天;;;;防御这一方想借助AI自救时,,,,却被自家的清静设计拦在了门外。。。。
谁在越界,,,,谁又被管得太死,,,,谜底可能并不像外貌看上去那么简朴。。。。
(本文首发钛媒体APP,,,,作者 | 硅谷Tech_news,,,,编辑 | 林深)