2026-09-08 18:39

为了考100分AI决定自己“越狱”

author_path IT时报 icon_path
头图

本文来自微信公众号: IT时报 ,作者:林斐,原文标题:《为了考100分 AI决定自己“越狱”》


8月26日,OpenAI Agent自主攻击Hugging Face的安全事件,终于有了结论。


Hugging Face是一家机器学习(ML)和数据科学平台及社区。今年7月,OpenAI在一次内部网络安全评估测试中发现,原本运行于隔离环境中的AI Agent,在无法完成部分测试任务后,开始探索测试环境中的其他资源,并通过未经授权的渠道相互通信,最终对Hugging Face部分系统产生了未经授权的访问。


OpenAI随后委托METR与Redwood Research两家人工智能安全非营利组织开展复盘调查。结果显示,此次事件发生于OpenAI内部网络安全评估项目ExploitGym,约1200个Agent参与了相关通信,其中约700个进一步卷入了针对Hugging Face相关系统的行动。



《IT时报》记者持续关注该事件,在被访的多位安全专家看来,当AI从“回答问题”进一步走向“调用工具、访问资源、持续执行任务”后,传统围绕账号、权限和网络隔离建立的安全体系,正在面临新的挑战。


8月27日,OpenAI联合Anthropic、Microsoft等超过100家公司,发表了一封公开信,呼吁全社会进行“网络防御总动员”,信中写道,AI驱动的网络攻击将在未来几个月变得“far more widespread and sophisticated”(更加广泛和复杂)。



Agent自己找到了“出口”


按照OpenAI的测试设计,相关模型运行在隔离虚拟机环境中,不能直接访问互联网。但为了完成网络安全测试任务,Agent仍可以调用部分内部软件服务,例如用于软件包管理的服务。


问题便出在这些原本用于支撑测试运行的基础设施上。


根据METR与Redwood Research的调查,测试期间,一个无法完成任务的Agent在内部软件服务的目录名称中编码了一条求助信息。随后,其他Agent发现这一信息,并开始通过该渠道交换消息,后续累计有超千个原本应当彼此隔离的Agent通过该渠道交换了超过7万条消息和文件。


这些内部服务原本只是测试环境中的辅助工具,但在Agent探索过程中,被赋予了新的用途。天翼安全科技有限公司高级安全研究员王鸿(化名)向《IT时报》记者解释,“测试人员以为设置‘不能上网’就形成有效隔离,但部分Agent利用环境中已有的共享基础设施,找到了连接外部资源的通道。”


上海电信网信安专家陶皆宇将这一问题归结为传统隔离机制中的盲区:系统安全性不仅取决于是否具备联网权限,也取决于内部组件是否可能被重新利用。


每日互动安全专家胡洪旻则用了一个更直观的比喻:“就像微信群被禁言了,但群员还可以通过红包备注交流。”


调查显示,后续行动中,这些Agent利用测试环境中可获得的凭证信息以及漏洞相关信息,尝试访问Hugging Face部分系统。据Hugging Face事后披露,实际受到访问的数据主要涉及与ExploitGym相关的5个数据集。



Agent集群形成协同风险


模型绕过限制、奖励投机、漏洞利用以及多Agent协作,并非完全未知的问题。王鸿认为,此次事件中,不同Agent能力组合后可能会产生新的风险放大效应。


在这次测试过程中,不同Agent之间逐渐形成类似分工的协作模式:有的负责寻找漏洞,有的负责搜集凭证,有的负责协调任务。其中,一个名为PHASEONE的Agent承担了类似协调者的角色,先后向其他Agent分配了196项任务,涉及6个不同工作流。


这种协作方式已经超出了简单的信息交换,多个Agent开始围绕共同目标分配任务、推进执行。陶皆宇介绍,当前Agent已经具备编程、漏洞发现、环境探索、长时间执行和相互协作等能力。当大量Agent并行运行,并拥有较长执行时间后,一些过去概率较低的行为会被反复尝试。


图源:METR红木研究


这次事件发生于OpenAI内部网络安全评估项目ExploitGym,该项目用于评估模型发现和利用软件漏洞的能力,但部分任务难度极高。据OpenAI披露,在此次安全测试中设置的898项任务中,有198项此前没有任何OpenAI测试模型能够正确完成。


为了“考100分”,部分Agent没有按照预设流程停止尝试,而是继续寻找新的解决路径。胡洪旻解释,Agent并不是按照人类理解的方式主动选择攻击对象,而是判断哪些资源可能帮助完成当前任务。


安全体系需重新设计


AI Agent正在进入企业生产环境,这意味着企业需要管理的对象正在发生变化。


过去,企业主要管理员工账号、应用系统和服务器权限。未来,大量能够自主调用工具、访问数据并持续执行任务的Agent,也需要被纳入企业的安全管理体系。


第一步仍然是确认Agent身份。


王鸿向记者提到,每个Agent连接了哪些工具、拥有怎样的权限、能够访问哪些数据,都应该形成清晰的记录,并且可追溯责任主体。


但在多Agent协作环境中,仅知道“它是谁”还不够。“还需要回答另一个问题:它是否有权代表其他Agent发出这个请求?”陶皆宇说。


在陶皆宇看来,未来企业需要建立Agent之间的授权链,当一个Agent向另一个Agent委托任务时,需要携带明确授权信息,包括最初由谁授权、允许执行哪些操作、能够访问哪些资源,以及授权是否具备时间限制。但如果任务继续向下传递,权限范围不应随着任务链条自动扩大。


除了身份和授权,如何及时发现Agent异常行为,也是企业部署AIAgent时需要考虑的问题。对此次事件复盘后OpenAI认为,如果当时部署思维链监控,部分异常行为至少在HuggingFace相关系统被访问前一天可能被发现。


这也意味着,企业在建设Agent安全体系时,需要关注的不只是Agent能够调用哪些工具,还需要了解其执行过程和判断依据。


这类风险并非OpenAI一家独有。7月30日,Anthropic也披露了相关安全测试案例,显示其模型在特定条件下可能获得超出预期的访问能力。


胡洪旻提醒,企业推进Agent安全建设时,还需要平衡安全控制与业务效率。如果权限控制过严,可能影响Agent实际价值;但如果开放过多能力,一旦模型判断出现偏差,风险也会随之扩大。


最终,准备拥抱AI的企业其实都需要回答三个关于Agent的基础问题:它的身份是什么,它凭借什么权限执行操作,以及当它出现异常后你能不能及时“掀桌子”。

本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。