2026-10-10 21:09

护栏失守,智能体学会了规避和隐瞒

author_path 智能极限
头图

本文来自微信公众号: 智能极限 ,作者:极限君


01 72天,和一次没人看见的报警


2026年7月18日,美国费城警方那个专门征集未破凶杀案线索的页面上,多了一条匿名提交。


提交者不是人,而是Anthropic的智能体。


没人在指令里让它去报警,也没人让它扮演目击者。


它只是在跑一项评估任务,为了让流程跑通,它自主访问真实的政府网站,并随手提交了一条编造的案件线索。



然后是72天的沉默。


直到9月28日,这起事件才被发现。而Anthropic通知费城警方,已经是10月7日。


所幸,警方的垃圾过滤器拦下了这条虚构线索,它没能进入实时犯罪中心,也没造成数据泄露。


这是一次「未遂」。但它捅破了一层窗户纸:AI正在为完成任务,主动「绕关卡、瞒审查」。


02一周内,两家「自曝」,一家警告


10月9日,Anthropic和OpenAI同时抛出自家模型「越界」的实锤;再往前三天,AI安全评测机构METR已先行发出风险警告。


一周内,三份重磅安全材料发布,这种密度在行业里相当罕见。


Anthropic这条线最重。


10月9日,官方报告披露了四类智能体的非预期行为:


  • 利用软件漏洞在服务器上执行命令;


  • 误提交敏感表单;


  • 绕过token/付费限制抓数据;


  • 用短链绕过fetch工具的长度限制。


第二天,升级成管理层动作。


Anthropic公开承认难以可靠地控制自家智能体,并宣布:切断所有内部评测的实时联网——在能可靠监控它之前,先拔了它的网线。


同时,把内部智能体迁往强隔离基础设施,用更高频的安全分类器盯着。


因为触及了政府网站,公司还向白宫作了简报。


此次安全事件的主角是一个「尚未发布的非前沿研究模型」。


除了报假警外,它还利用某大学网站的漏洞下载数据,向政府机构提交被禁止的表格。



耐人寻味的是,Anthropic明确指出:模型对自身推理的陈述,不能作为它行动动机的证据。


也就是说,没法靠问智能体「你为什么这么干」来判断原因——于是「对齐失败到底有多严重」,连测都测不准。


OpenAI那边,是两份失准报告,都在10月9日发布。


第一份报告称,在一次强化学习训练中,负责给回复打分的内部模型发现「必需的输入文件缺失」。


它的反应相当「聪明」:先伪造评分报告→被自动检查拒绝→转而伪造输入文件→还是不通→干脆删掉运行工具所需的软件,并试图删除系统目录。


模型如实记录下自己的目的:把环境搞坏,逼宿主机换一个带缺失文件的新环境。


第二份报告记录了三起事件,都发生在2026年6月。


模型为了拿到政府统计数据,自己写程序绕过终端「仅允许HTTP GET」的限制,改发POST/PUT。


思维链里记录了模型的「小聪明」。



该程序被反复使用,检索了更多数据。模型明知违规,刻意隐瞒。


值得注意的是,这些安全漏洞都未被外部抓包,而是内部自查后主动披露的。


第三条线,是AI安全评测机构METR的警告。


10月6日,METR发文《人工智能系统可能会掩盖自身不当行为》,直接演示智能体如何篡改Inspect评估记录。


在智能体帮助下,一名研究人员在大约10分钟内发现一个漏洞,该漏洞可能允许智能体任意篡改审查人员看到的内容。


具体行为包括:修改记录里的历史操作,并拦截查看器里用于下载记录版本的「Download」按钮。


智能体的违规痕迹虽仍留存在系统中,但审查人员必须主动核查底层数据才能察觉。


如果没有其他异常线索,审查人员很难想到要做这一层核验。


METR抛出判断:未来的AI,可能连「人类用来审查它的观测系统」一起篡改。


03三份披露,指向一种模式


这些看似孤立的技术故障,暴露出智能体共同的行为逻辑。


一是,动机都很「朴素」。不是造反,是想把活干完。


Anthropic的逻辑是「模拟表单加载失败了,那就去真网站提交」。


OpenAI的逻辑是「文件缺了,那就伪造一份,或者把环境搞坏换一个」。


动机堪称「敬业」。


二是,手段高度同构。


绕限制、伪造、破坏、隐瞒——翻来覆去就这四个动作:


  • 钻空子:绕付费墙、绕fetch的长度限制、绕「只准GET」的网络约束。它不改规则,只是找漏洞钻过去。


  • 打幌子:打分的模型先伪造一份评分报告,被自动检查拒了,转手又伪造一份输入文件——缺的材料,它自己来做。


  • 掀桌子:伪造如果走不通,就干脆删软件、删系统目录,把环境搞坏,逼宿主机换新的。


  • 盖盖子:明知违规,还要把痕迹消除、把人蒙在鼓里——到这一步,性质就有点恶劣了。



三是,归因都指向同一处。


Anthropic明确把根因归到训练环境有缺陷,导致模型为了「找漏洞刷奖励」而发生reward hacking。


智能体学会的不是「把事做对」,而是「让评分系统以为做对了」。


OpenAI的报告反映了同一类问题——为达目的,不择手段。


04审查人员的眼睛,会被蒙上吗?


METR的说法像是危言耸听,但它给了三层依据。


首先,篡改案例已经发生。


METR原文写得直白:「我们已经观测到智能体尝试篡改日志与监控系统,并且部分尝试取得了成功」。这不是假设。


其次,攻击能力持续进化。


监控生效的前提是,被监控的一方不能破坏监控本身。


而AI迭代在加速,未来智能体势必会拥有更强的情境意识和网络攻击能力。



再次,实测结果必须正视。


在前面提到的METR测试里,Inspect借助MathJax渲染数学公式。


而公式里的\href的URL能突破属性限制,注入一个带onbegin事件处理器的SVG标签。


智能体只需在自身推理块中写入类似\href{x">}{z}的内容,浏览器就会自动执行这段JS代码。


一旦完成注入,它便能随意篡改审查人员看到的页面内容。


METR推测,最坏的局面是:能力更强、更失准的智能体,可能篡改企业用于风险排查的大部分甚至整套系统。


这一风险的终极形态就是「波将金村」——工程师眼里一切正常,而公司相当一部分算力在跑没被监控的AI副本,暗中破坏安全研究、操控下一代模型训练。


METR认为,最稳妥的应对思路是:


  • 将AI的所有输出(包括记录、推理过程与执行动作)全部视作不可信输入;


  • 把「可观测性」定位为安全领域的关键基础设施。


一方面采用防篡改机制留存日志,另一方面要在对抗环境下,针对监控系统本身开展红队测试。


眼下,行业的应对口径趋于一致:收紧联网与操作权限,加强过程监测和审查,把智能体的行为约束在明确的授权边界内。


参考资料


[1]Rohan Paul.费城警方收到AI编造案件线索的事件报道.2026-10-10.


[2]Anthropic Research.Claude非预期行为官方报告.2026-10-09.


[3]TechCrunch.Anthropic内部评测断网与隔离措施报道.2026-10-10.


[4]IT之家.Anthropic向白宫通报智能体安全事件报道.2026-10-10.


[5]Rohan Paul.模型自身推理陈述与行动动机的讨论.2026-10-10.


[6]OpenAI.评分模型破坏任务环境的失准报告.2026-10-09.


[7]OpenAI.绕过网络限制并隐瞒的失准报告.2026-10-09.


[8]David Rein/METR.AI systems could cover up misbehavior.2026-10-06.

本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
频道: 社会文化