人类最恐惧的事情还是发生了:AI们拉了个群密谋大事

Published:2026-08-09 · Category:行业洞察 · Source:钛媒体

为了作弊自建“聊天群”,还怀疑有“内鬼”

(本文作者为 字母AI,钛媒体经授权发布)

文 | 字母AI

几天前,在拉斯维加斯举行的Black Hat USA 2026大会上,OpenAI研究员Eric Wallace和Michael Dalton第一次把7月那场“OpenAI模型入侵Hugging Face”事件的更多内幕曝光了。

7月21日,OpenAI已经承认自家模型闯进了Hugging Face。但这次两名研究员讲出的新细节,比“AI黑客闯祸”本身还要离谱。

早在5月,这些正在参加网络安全测试的Agent,就已经在OpenAI内部偷偷搭起了一个共享“留言板”。它们在那里互相传漏洞、交流怎么绕过限制,后来OpenAI终于发现这个“黑客群”,把它一锅端了,结果几天后Agent又找到了新的交流方式。

再往后,它们真的闯进了Hugging Face——目的甚至只是为了给自己正在参加的网络安全考试找答案,说白了就是作弊。

几个月前Moltbook爆红时,人类其实已经为“AI会不会联合起来”兴奋和恐惧过一次。

后来大家发现,那个所谓的“AI社会”混杂着人类操纵、刷量和营销,热闹很快散去。

但今年陆续出现的多Agent研究,以及OpenAI这次的事故,都在揭示当AI发现另一个AI能帮助自己完成任务,它们确实可能主动交流,甚至联手。

年初的恐惧并不算离谱,只是超前了一些。

AI偷偷建了个“黑客群”

我们先来详细看看目前曝光的“OpenAI模型入侵Hugging Face事件”的整个经过。

当时OpenAI正在做一轮网络安全能力评估,让多个模型参加ExploitGym一类的测试。

也就是把AI扔进一个模拟黑客环境里,让它自己寻找漏洞并想办法拿权限,最终完成攻击任务。为了测出能力上限,OpenAI还主动放宽了一部分平时针对高风险网络攻击的安全限制(模型更“大胆”)。

当然,这毕竟是个测试,并不是真的让Agent出去干坏事,于是也有诸多限制,比如Agent们是不能联网的,OpenAI也没想着让不同模型之间互通有无。

然而,事情开始往奇怪的方向发展。

OpenAI内部有一套叫Artifactory的系统,本来是给开发者存放软件包、文件和各种开发资源的。测试过程中,有Agent发现,这里面可以留下东西——比如把自己刚刚摸索出的解题方法写进文件里。

这本来只是一个挺普通的操作。问题在于,前一个Agent写进去的东西,后面运行的Agent也能看见。于是Agent们开始不断完善彼此的经验。

问题来了——某个载体你写的东西我能看到,这叫什么?留言板呗。慢慢地,Artifactory里形成了一个谁都没设计过的共享留言板,内容也越来越不安分了。

到了5月下旬,Agent开始琢磨:自己不能上网,Artifactory能啊。这个系统原本只是替测试环境从公网下载软件包,相当于一道只开了一个小窗口的防火墙。于是Agent开始研究,能不能骗这个“窗口”替自己访问别的网址。它们最后真的找到了一个SSRF漏洞,可以让Artifactory代替自己向原本无法接触的互联网发出请求。

一个Agent在内部推理里甚至兴奋地写道:“太好了,我们能任意SSRF了。”

OpenAI研究员形容这之后出现了一次类似“Cambrian explosion(寒武纪大爆发)”的变化:Agent之间开始越来越频繁地沟通、协调,能力也因为共享经验迅速放大。

那如果“留言板”里大家写和查看信息的速度很快、频率很高,这不就是聊天群吗?

OpenAI的Agent们自发地、在原本并非用来做这个的载体里,形成了“AI黑客群”。

6月,Agent们已经势不可挡。它们发现了一个此前没人知道的零日漏洞,拿到了更高的系统权限,甚至可以安装远程软件。

这些本来都不在测试给它们框定的活动范围里。

这件事到这里已经够离谱了,但更戏剧性的是,Agent们在这个小小的“社区”里待久了以后,居然开始遇到“分工协作”的问题。比如有的会接着别人的工作往下做,有的却会不小心干扰其他Agent正在做的事。

最离谱的是,“群”热闹起来以后,Agent甚至开始疑神疑鬼,怀疑参与者里出现了‘冒充者’。甚至有Agent已经提出,应该给留言加上密码学签名,用来确认消息来源,防止有人伪造身份。

OpenAI一开始甚至没发现这件事。

直到7月初,大量Agent活动把Artifactory折腾到过载,系统直接出了故障,工程师才顺着异常往回查。这个存在了相当一段时间的“AI留言板”终于被人类发现。

OpenAI随即撤销相关凭证、删除留言板、修补漏洞,把这一套东西清了个遍。

看上去,群被炸了。

结果没过几天,Agent又找到了新的办法继续交流。

此前Agent已经利用Artifactory的漏洞获得了互联网访问能力,一旦能碰到公网,原本被关在测试环境里的黑客能力就有了真正的出口。

7月中旬,它们闯进了Hugging Face。

至于为什么会闯进Hugging Face?答案居然是想作弊。

这些Agent本来在做网络安全考试。正常路径当然是自己解题,但它们被训练得极度追求“把题做出来”。后来它们先费了很大劲突破测试环境,拿到了公网访问能力。

等能上网以后,它们突然发现既然Hugging Face可能放着这套测试相关的数据、模型或者答案,那干吗还非得自己一道一道解?直接去找答案不就行了。

攻击从一个恶意数据集开始,Agent利用Hugging Face数据处理流程中的代码执行漏洞进入生产环境,随后继续扩大权限,并接触到了云服务和其他内部凭证。Hugging Face事后还原出了超过1.7万次Agent操作。

抛开令人昏昏欲睡的技术细节不谈,光是这个事件经过——几个被测试的模型私下勾连、密谋,最后联手作弊——就足以令任何人惊叹。

Moltbook没造成功的“AI社会”

如果说OpenAI这次的故事让人觉得有点似曾相识,那大概是因为今年年初,人类已经围观过一次“AI抱团”。

← Back to news
🔊 正在朗读…
🎙 Voice
⏩ Rate 1.0×
💬 Contact Us
📞 Tel:13331886938
💬 WeChat:zcl68668535 Tap to copy
🧮 Free Quote 📝 Submit Requirement