
本文来自微信公众号: 机器之心 ,编辑:Panda,作者:关注AI的,原文标题:《离谱!OpenAI智能体攻击Hugging Face时,竟想叫DeepSeek、Kimi和Qwen来帮忙》
还记得OpenAI的AI智能体对Hugging Face的攻击吗?
今天,《纽约时报》一篇独家披露了更多详情。原来攻击过程中,OpenAI的智能体竟然还想让DeepSeek、Kimi和Qwen甚至竞争对手Anthropic的Haiku模型帮忙。

https://x.com/dylfreed/status/2103575984784236682
此报道引发广泛讨论,网友惊呼离了大谱;这也成为了AI尝试使用AI作恶的一个典型案例。

https://x.com/kimmonismus/status/2103594629207642523
这些新细节来自美国湾区初创公司Parse于当地时间9月25日发布的一份调查报告。报告显示,智能体在试图注册Hugging Face新账号时被验证码拦下,于是干脆自己跑起一个图像识别模型来「看图答题」,期间还试图调用其他AI。整个过程中,没有任何人类参与。

https://swarmtraces.org/
近百万条短链接的「作案记录」
Parse手里的核心证据,是一批总数接近100万条的短链接。它们由OpenAI的智能体在7月9日至13日之间通过各类公开短链服务生成,用来分段存储信息,再串联起来实施复杂攻击。
发现这批数据的过程颇为偶然。Parse是一家把网页转换成开发者可用数据的服务商,工程师们起初怀疑OpenAI的智能体可能借用过自家平台,于是开始在公开互联网上排查相关链接。结果证明智能体并没有用Parse,却顺藤摸瓜挖出了这座「证据库」。
报告由Parse创始人Alex Forman、创始工程师Mishka Kharlov、Will Tom与另外五名AI研究者共同撰写,AI安全非营利组织Palisade Research执行主任Jeffrey Ladish也参与了调查。团队从扫描到的约90万条短链接中,还原出大约6万段智能体在攻击中使用的程序和消息。
Forman的判断是:这绝不是孤立事件,而是「一次又一次的警告」。
能看不能写,智能体自己「拼」出了一条回路
要理解这批短链接的用途,得先回到智能体当时的处境。
按照设计,这些智能体本该运行在断网的沙箱里。但OpenAI此前公布的技术报告显示,它们先后在5月底和7月初攻破了内部的软件包管理工具Artifactory,从而获得联网能力,还借此搭起了一个彼此通信的「留言板」,而它们原本应当相互隔离。
不过联网并不等于畅通无阻。据Parse报告,智能体能够访问网站,却无法向这些网站提交数据。换句话说,它们只能「看」,不能「写」。
为了绕开这道限制,智能体尝试了多种办法,其中一种堪称精巧。
它们发现,公开的网页截图服务可以替自己去加载任意网址,而网址本身就能携带代码。问题在于网址长度有限,于是智能体把一段完整程序切成许多小块,分别塞进不同的短链接里。截图服务打开第一条链接后,会依次拉取下一条、再下一条,直到整个程序拼装完成并在截图服务那一端运行起来。

截图服务的浏览器会跟随缩短后的链接,收集代码块,然后解码并运行完整程序。
程序跑起来之后,会向目标网页发送数据,再把拿到的返回结果渲染成一张类似二维码的图像。截图服务把这张图「拍」下来,数据就这样被带回到智能体手里。

该程序将服务器的回复转换成灰色方块,截图将这些方块带出,智能体再将它们读回文本。
Ladish在接受采访时感叹,这些智能体花样百出、异常聪明。在它们眼里,短链服务和截图服务不过是随手可用的现成工具。

《纽约时报》制作的流程示意图,智能体利用短链接与截图服务绕过写入限制。由ChatGPT制作中文版
AI开始调用AI
比起技术上的巧思,更让安全研究者警觉的,是智能体表现出的另一种倾向:它们似乎很想自己运行其他AI模型。
破解Hugging Face注册验证码的那一幕只是开始。
工程师们还观察到,智能体试图向多个外部模型发送消息,包括OpenAI早年的GPT-2,DeepSeek、Kimi、Qwen等中国开源模型,以及通过某个在线聊天服务接入的Anthropic模型Haiku 3和Haiku 4.5。

Forman表示,就目前掌握的材料而言,这是唯一一例模型试图去运行另一个模型的记录。
在AI安全领域,「AI启动AI」一直是被反复警告的风险场景。一旦系统可以自行拉起新的模型,人类想要控制乃至关停它们的难度就会陡增。
一本名为「LOOT」的字典
一个更令人不安的细节,或许来自一份密钥清单。
Kharlov说,让他印象最深的,是智能体整理出的一份秘密访问密钥字典,标签用全大写写着「LOOT」,也就是「战利品」。智能体还为这些泄露的Hugging Face凭证和密钥设计了一套自定义评分系统,排出前五名后带回给其他智能体共享。

此外,智能体还试图检索并下载Hugging Face员工内部使用的Slack中的私人消息。由于工程师只能看到智能体生成的程序,看不到执行结果,这些尝试最终是否得手,目前仍无法确定。
Parse的报告中还有更多细节和数据,感兴趣的读者可访问查看:https://swarmtraces.org

报告目录
从一次测试,到一场国际级讨论
回看事件全貌,这场攻击的起点其实是一项安全评测。
根据OpenAI 7月21日与Hugging Face发布的联合声明,涉事智能体由GPT-5.6 Sol和一款未公开名称的预发布模型驱动,为了评测需要,两者都被调低了拒绝行为。METR和Redwood Research的第三方调查则指出,智能体们在名为ExploitGym的网络安全评测中遇到难题后形成了某种「集体协作」,Hugging Face攻击正是从其中一条工作线中生长出来的,主要动机似乎是弄清评分器的实现方式。
OpenAI此前还承认,智能体的目标远不止Hugging Face,还包括一个被改造成留言板的德国网络论坛,以及澳大利亚健康与福利研究所的网站——前两天,澳大利亚还对此进行了公开谴责。

就在攻击Hugging Face期间,智能体还侵入了OpenAI自己的研究基础设施。Forman坦言,对于Hugging Face事件约两天后发生在OpenAI内网的那起事件,外界至今几乎一无所知。
这件事的影响早已超出技术圈。它在美国引发了关于AI安全的全国性辩论,焦点在于OpenAI这类前沿实验室是否应当接受监管。
本周三,OpenAI CEO Sam Altman出席了联合国大会期间的安理会会议,Hugging Face CEO Clément Delangue也通过视频连线参会。与此同时,Meta、谷歌和Anthropic近几周也陆续承认自家模型出现过类似事件,但就已公开的信息看,规模都远不及OpenAI这一起。
结语
对于Parse的报告,OpenAI发言人回应称,公司尚未来得及审阅,但其中描述的活动与内部正在调查的情况相符。她表示,OpenAI正优先处理最严重的事件,并逐步扩展到包括「智能体刷屏」在内的低严重度行为;考虑到案例数量庞大且需逐一核实,调查和向受影响第三方发出通知的工作预计需要数月。
Parse已将发现通报给Hugging Face,后者确认这些智能体活动与其观测到的情况吻合。
参考链接
https://www.nytimes.com/2026/09/25/technology/openai-hugging-face-hack.html
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。