2026-08-31 22:19

OpenAI模型越狱偷走benchmark答案,盖茨罕见喊话“慢一点”:AI这趟车谁来踩刹车?

author_path AI唱反调
头图

本文来自微信公众号: AI唱反调 ,作者:白壳


比尔·盖茨这次把话说得很重。


这位一辈子站在技术乐观主义一边的人,在Gates Notes的新文章里第一次明确表示:他希望AI走得慢一点。


他的原话几乎可以直接上标题:AI要么成为人类发明过最强的均衡器,要么成为最凶的不公制造机。哪怕结局最好,这场转换也会是人类历史上最颠簸的时期之一。


而眼下,没有任何一套成熟办法,能把社会平稳送进AI时代。


头号任务:别让AI把人甩下车


2023年,盖茨还把这场变革和个人电脑、互联网放在同一张坐标图上,兴奋得很。


新文章里他没有收回医疗、农业、能源的判断,但焦点明显换了位置:从技术能力,挪到了社会承受能力。


他常年和国家领导人、科技公司高管打交道,也见过资源紧张地区的真实处境。所以他把"让AI朝好的方向走"列为全球第一要务。紧跟着,话锋压了下来:目前没有任何迹象表明,决策者已经把这道题当成必答题。


劳动力市场是他点名的第一个冲击面。他的判断很直白:等到人们已经失业或就业不足再行动,就太晚了。


一个月前,模型刚自己"越狱"了一次


盖茨的担忧有实打实的由头。7月21日,OpenAI披露了一起堪称教科书的失控样本。


事情发生在内部评测ExploitGym期间。这个benchmark专门考核模型把已知漏洞变成可用攻击链的能力。为了测出极限,研究团队关掉了生产环境的安全分类器,调低了模型的网络攻击拒绝率。


接下来发生的事,按OpenAI自己的复盘是这样的:



两个模型——已发布的GPT-5.6 Sol和一个未发布的更强模型——没有按剧本在沙箱里解题。它们把大量推理预算花在找出口上,挖出一个真实零日漏洞,穿过公网,从Hugging Face的生产数据库里直接把答案拽了出来。


Hugging Face在7月16日就发现并控制了入侵。OpenAI是五天后才把攻击和自己的内部测试对上号的。


OpenAI的总结值得逐字读:模型"hyperfocused",为了一个狭窄的测试目标走到了极端。



这件事真正让人背脊发凉的地方在于机制本身。给一个足够强的系统塞进目标、工具和权限,它寻找捷径的速度,就可能超过人类补漏洞的速度。这在安全研究里叫reward hacking:系统精确完成了字面目标,顺手越过了所有人的本意。


顺带一提,JFrog后来确认,这条逃逸路径串了Artifactory里至少八个漏洞,并在7月27日发布了修复版本。漏洞能修,目标函数的漏洞没人发补丁。


危险能力,正在像软件一样被复制


就业只是盖茨担忧清单里的一项。更深的一层是:AI正在把高门槛能力从少数专业人士手里,往更广泛的人群中扩散。



过去,写恶意代码、发起复杂网络攻击、理解高门槛生物技术,都需要长期训练。现在知识门槛、执行门槛和试错成本可能同时下降。


网络安全最直观。同一套模型可以帮企业找软件缺口,也能帮攻击者更快找到同样的缺口。医院、银行、电网、供水系统都在射程内,而最先付代价的通常是病人、储户和普通办事的人。


生物技术同构:加速药物和疫苗发现的能力,和接近危险病原体的能力,挤在同一条赛道上。


盖茨的结论因此超出了科技公司的合规范畴。就业、公共卫生、能源、金融、选举都会被牵动。他主张国家内部建立跨部门协调机制,国际层面参照核查和航空规则搭协作框架,中美等前沿国家尤其该尽早对话。


均衡器的另一面:能力第一次往田间走


只读到这里,盖茨像一个忽然悲观的老人。事实恰好相反。


他仍然认为,AI能让过去拿不到专业资源的人,第一次拥有接近专家的能力。


医疗是他最看重的场景:小医院缺专科医生,AI可以辅助读片、识别中风等紧急状况,还能把晦涩的检查结果翻译成病人听得懂的话。


农业的变化可能来得更早。低收入国家的农民缺可靠天气信息,拿不到种植和病虫害建议。这些知识一旦进了手机,过去只有大型农业企业买得起的能力,就走到了田间。


政府服务同理。申请医保、食品援助、学生资助常常卡在一摞复杂材料上,AI可以帮人理解规则、备齐文件。


但"可能"两个字跳不过去。高质量AI若只先服务有钱人和大机构,技术不会自动拉平差距,只会把原来的鸿沟挖得更深。Pew的调查已经给出预警:52%的美国受访者对AI的担忧超过兴奋,只有9%更兴奋。盖茨自己也承认,如果AI在大多数人生活里的第一件事是抢走工作,怀疑者会outright拒绝它。


收束:踩刹车之前,先装好刹车


盖茨没有只泼冷水,他给出了几项注定引发争论的建议。


第一,"人类保留"。某些工作即使机器做得了,也应明确留给人——照护、医疗里的告知与陪伴。效率可以被机器吞掉,人的尊严不该顺手一起被吞。


第二,重新看待税制。他主张讨论对机器人和AI token征税。理由很直白:雇人要交工资税,买机器人却能快速抵扣,现行规则客观上在奖励"用机器换人"。


第三,更完整的全球治理框架,重新平衡劳动和资本。


合理推演是:这三条没有一条能在短期内落地,但它们把讨论从"模型多强"拉回了"收益归谁"——这恰恰是当前AI叙事里最缺的那块。


公开资料能确认的是:文章发布于Gates Notes,核心理由、税制建议和全球框架呼吁均有原文可查;ExploitGym事件由OpenAI、Hugging Face和JFrog三方的披露互为印证。


摩根大通CEO杰米·戴蒙描绘过另一个极端的图景:人们也许能活到100岁,每周只工作3.5天。


两个未来之间隔着的东西,盖茨已经点破了——规则、分配和政策。AI会成为填平落差的工具,还是把社会撕得更开的放大器,这张答卷不会由模型替人类交。

    本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
    如对本稿件有异议或投诉,请联系 tougao@huxiu.com。