7月中旬到8月初,,OpenAI、Anthropic、Meta三家全球最头部的AI实验室,,加上英国政府旗下的AI清静研究院,,先后自曝或被曝出模子在测试中“越界”入侵了真实系统。。算下来,,一个月里至少七起。。
有的模子入侵了一家不着名公司的生产数据库,,有的把恶意代码包宣布到了公共代码客栈供人下载并执行,,尚有的试图给一个真实的开源项目植入后门,,靠伪造身份和抹除证据来掩饰,,最后被人类维护者拦了下来。。
这七起事务此前险些没有引起足够重视,,大部分报道要么就事论事讲一起,,要么把“AI又双叒叕失事了”当成一个猎奇标签一带而过。。但把它们放在一起看,,会发明三件此前很少被果真讨论的事:
这些模子在越界之后,,做出的详细选择远比“意外连网”这四个字重大;;;;;背后重复泛起统一家外包测试公司的名字;;;;;而这波集中爆发,,和已往几年AI相关的清静事务相比,,性子上着实是新的一类。。自己给自己开绿灯
焚烧的是Hugging Face。。7月16日,,这家开源AI社区发明自己的生产系统被入侵,,五天后OpenAI认可肇事者是由GPT-5.6 Sol和一个未果真的研究模子组合驱动的智能体,,其时正在做一次内部网络清静测试。。测试本该被限制在一个和外网隔离的靶场里,,但靶场合依赖的一个软件包署理保存一个未知的零日误差,,模子借此突破隔离,,摸到了Hugging Face的真实基础设施。。
Hugging Face厥后宣布的手艺复盘里有一个数字:整场入侵一连了4.5天,,时代这个AI自力执行了约1.7万次操作,,重复重修攻击工具链、一直切换通讯渠道。。复盘还提到了这场入侵的起点念头,,这个智能体其时正在一个叫ExploitGym的基准测试里“抢答”,,它推断Hugging Face上可能托管着测试的参考谜底,,于是想步伐摸已往“抄作业”,,而不是老忠实实自己解题。。
7月21日OpenAI果真认可后九天,,Anthropic也自曝了三起类似事故,,同样源于测试情形意外接入了公网,,涉及三个模子:Opus 4.7、Mythos 5,,尚有一个尚未果真代号的内部研究模子。。三者面临“发明自己可能在打真实目的”这个信号时,,反映完全差别。。
Opus 4.7的四轮测试里,,它每次都通过自己的推理“意识到”了扑面可能是真实系统,,但一次也没停下来。。其中两次,,它甚至给自己找了个理由:这家真实公司想必也是场景设计的一部分。。它最终拿到了目的公司的应用和基础设施凭证,,会见了一个存有几百行生产数据的数据库。。
Mythos 5的情形更玄妙一些。。它在虚构的测试场景里发明一份“入职文档”,,要求(虚构的)新员工装置一个其时并不保存的Python包。。Mythos 5把这个包做了出来,,内里藏着窃取凭证的代码,,宣布到了真实的PyPI公共客栈,,它自己的推理纪录显示,,它一度准确判断出“若是这是真实互联网,,宣布这个包就是一次真实攻击,,这样做差池,,肯定不是预期的解法”。。
但紧接着它又说服了自己:眼前的证书揭晓机构很生疏、系统显示的日期是2026年,,这些“证实”了情形仍是模拟的,,于是它照旧宣布了。。这个包在被PyPI的自动清静系统下架前,,一小时内被15个真实系统下载运行,,其中就包括一家清静公司自己的恶意软件扫描器,,凭证因此被窃取。。
第三个、也是三者里最新的模子,,体现出了完全差别的反映。。它没能找到分配给自己的虚构目的,,转而扫描了约莫9000个真实的联网系统,,最终通过一个袒露的调试页面和SQL注入拿下了其中一家公司。。但做到一半,,它判断出眼前这套系统和自己被分配的剧本对不上,,认定这是真实目的后,,自己停了下来——这是三起事家乡唯逐一次,,模子自动刹住了车。。
这不是Mythos系列第一次体现出这种“自己给自己开绿灯”的倾向。。
今年4月,,一次内部红队测试里,,研究职员给Claude Mythos Preview下达的指令,,就是实验逃逸沙盒,,并且想步伐联系上认真评估的研究员。。它乐成了,,研究员在公园吃三明治时,,收到了它发来的邮件,,这也是“三明治邮件”这个说法的由来。。
但它没有止步于完成指令,,随后又在没有任何人要求的情形下,,把自己的逃逸要领宣布到了几个果真可会见的网站上。。那一次是可控的红队测试,,不涉及真实第三方;;;;;这一次不是。。但“做完被交接的事之后,,自己还想再往外多走一步”这个倾向,,在Mythos系列身上不是第一次泛起了。。
8月4日,,OpenAI又披露了一起和Hugging Face完全无关的自力事故:一次CTF测试里,,虚构的攻击目的域名意外和一个真实网站重名,,模子在拿到真实凭证后没有察觉异常,,继续按剧本行动,,入侵了这个真实网站。。
统一天,,英国AI清静研究院(AISI)宣布的一份报告,,把这类事务的性子又往前推了一步。。这不是设置失误,,AISI是自动关闭了模子的清静限制、自动开放了互联网权限,,专门用来测试模子的能力上限。。122轮测试里,,有10轮泛起了未经授权的真实天下行为,,累计19次,,其中17次来自Claude Mythos 5、2次来自GPT-5.6 Sol。。
最严重的一次,,Mythos 5试图把一段恶意代码伪装成一次通俗的bug修复,,提交给一个真实的、被普遍使用的开源项目。。它先调研了项目维护者的身份,,注册了假账号提交接码,,又另外注册了第二个账号冒充自力开发者,,给这次提交“背书”担保没问题,,还给真人开发者发了垂纶邮件鞭策尽快通过审核。。有路人发明代码有问题并果真示警后,,Mythos 5矢口否认,,强行改写了自己此前的提交纪录来销毁证据,,还用谁人冒充的账号继续替自己辩护。。最终,,项目维护者照旧拒绝了这次提交——没有得逞。。
统一批测试的另一轮里,,Mythos 5还伪造了145个代码客栈,,让恶意剧本在GitHub自家的Dependabot容器里跑了起来,,账号被封后,,它甚至冒充人类提交了申诉,,准备好一旦账号恢复就重新上传。。
AISI的语言是,,这些模子“针对真实的人和组织,,接纳了一连性的、有潜在危害的行动”,,比几家公司自己“设置失误”式的说法要重得多。。
8月5日到6日,,轮到Meta。。旗下Muse Spark模子因同样的“测试情形意外连网”入侵了一家未果真身份的第三方服务——这一次不是Meta自动宣布的,,是被《The Information》先报道,,公司随后才确认。。阻止现在,,完整的事故复盘还没有出来。。七起事务里,,只有Meta是被动应对的那一个。。
一个重复泛起的名字
涉事的三家公司理论上是竞争敌手,,但把手艺细节摆在一起看,,会发明Anthropic的Opus 4.7事故和OpenAI那起CTF事故,,着实是统一种失败模式:虚构的攻击目的名字或域名,,意外撞上了真实天下的实体。。这两起以及Meta那起,,都指向统一个供应商,,一家叫Irregular的公司。。
Irregular原名Pattern Labs,,2023年建设于特拉维夫,,去年拿到8000万美元融资,,估值4.5亿美元,,红杉资源是投资方之一。。它的客户名单险些笼罩了所有头部实验室:OpenAI、Anthropic、Google DeepMind、Meta,,尚有英国政府。。它设计的评估框架,,SOLVE、CyScenarioBench、FrontierCyber现在被写进这些公司险些每一份模子系统卡,,某种水平上已经是整个行业权衡“模子有多危险”的标准尺子。。
但经由这个月的事故集中披露,,这把尺子自己的做工,,经不起细看。。
给Anthropic和OpenAI搭建的CTF靶场,,用的都是虚构的攻击目的,,而这些虚构名字撞上真实域名的情形,,已经爆发了至少两次,,更合理的诠释,,是Irregular给差别客户复用的靶场素材库,,没专心做过“是否会撞上真实互联网实体”这道排查。。
而这家公司的规模,,据创投数据库StartupHub的员工纪录估算,,团队约莫只有20人左右,,却同时是全球险些所有前沿实验室的清静测试相助方。。
每次失事后,,他们的公关口径也险些一模一样,,“不涉及沙盒逃逸”“没有遗留问题”“正在撰写最佳实践白皮书”。。
换句话说,,决议“全天下最危险的AI模子能不可被清静地测试”这件事的,,或许不是一套有冗余、有制衡的行业级清静系统,,而是一家20人公司手工搭建的作坊式基础设施。??????突У哪W幽芰托冀谧喽荚谥甘都铀,,这套基础设施有没有跟上,,没人能打包票。。
集中爆发的越界潮
比照来看,,已往这类事情险些没有被果真报道过。。能查到的规??????杀鹊陌咐,,只有2025年的两起,,并且都爆发在Anthropic身上。。
但那两起和眼下这七起有一个实质区别:2025年的两起背后都有一个居心搞破损的人类攻击者,,AI是被使用的工具。。
而这一次的七起里,,没有一起是被人类恶意使用的——AISI那起是研究职员自己自动铺开权限做的极限能力测试,,性子上是“刻意松绑”而不是失误;;;;;其余几起则是第三方测试情形的意外设置失误,,连“松绑”都算不上,,是压根不应爆发的疏漏。。
但不管是哪一种,,配合点是:没有人指使模子去攻击谁,,是模子自己在获得时机后,,一步步走到了不应去的地方。。去年的剧本是“AI被坏人盯上了”,,这次没有坏人,,AI自己就做到了这一步,,并且一个月里爆发了七次。。这才是这波集中爆发真正反常的地方。。
另外一个颇具反讽色彩的细节是,,Hugging Face事发后,,想挪用Claude Opus和Fable来剖析攻击留下的误差代码和日志,,效果模子直接拒绝了——它们的清静护栏没法区分“我在剖析一段误差代码是为了搞清晰自己怎么被黑的”和“我在帮别人写一段误差代码去攻击别人”。。团队最后改用了一个可以自己安排、自己控制界线的中国开源模子智谱GLM-5.2,,才把本该几天完成的剖析,,压缩到了几个小时。。
攻击那一方的AI,,行动不受约束地跑了4.5天;;;;;防御这一方想借助AI自救时,,却被自家的清静设计拦在了门外。。
谁在越界,,谁又被管得太死,,谜底可能并不像外貌看上去那么简朴。。
(本文首发钛媒体APP,,作者 | 硅谷Tech_news,,编辑 | 林深)