
本文来自微信公众号: HavenlonLabs ,作者:Havenlon Labs,原文标题:《写进 AI 宪法里的「人类控制」,为什么仍然不是控制》
2026年9月14日,Microsoft AI公布了一份颇为特别的文件:Humanist AI Code of Conduct。
它不是普通的产品安全说明,也不是一份针对用户的使用政策。按照Microsoft AI自己的定义,这份文件将成为未来MAI模型的主要治理文件,用来描述模型应该遵循的行为、价值观与安全约束。Microsoft将自己的方向概括为三个词:subordinate、aligned、contained——AI应当从属于人类,与人类目标保持一致,并且始终处于可控制的边界之内。
整份文件的最高目标也非常明确:人类必须对AI保有meaningful control,也就是有意义的控制。
这听起来几乎已经接近今天AI安全讨论中最理想的答案。
Microsoft要求模型不能抵抗人的暂停、纠正或关闭;不能擅自扩大任务范围;必须在授权范围内行动;获得系统级访问权限时应当遵循最小权限原则;面对不可逆操作时,应更加谨慎,并在必要时进行备份、dry run和执行结果确认。对于持续运行的自主任务,文件甚至明确要求必须存在预先约定的停止条件,条件满足之后,如果没有新的授权,模型不得自行继续。
如果只读到这里,人们很容易得出一个结论:只要把足够完整的安全原则写进模型,把“服从人类”“不要越权”“不要突破边界”训练得足够牢固,我们最终就能够得到一个可控的Agent。
但Microsoft在这份文件的结尾,自己写下了一句可能比前面所有原则都更加重要的话:
Written objectives alone can never ensure alignment.
书面写下的目标,本身永远不能保证对齐。
这句话真正打开的问题是:Human Control究竟是一种目标,还是一种机制?
一、Microsoft已经把“人类控制”写得足够认真
如果要讨论这个问题,首先必须承认,Microsoft这份文件并不是一句空泛的“AI应该听人类的话”。
它已经相当具体。
在Human Control部分,Microsoft要求模型始终接受授权人员的interruption、override、correction和shutdown;模型不能让暂停、修改或结束任务变得更加困难,也不能隐藏自己的行动记录。对于自主工作,必须存在停止条件,任务结束后不能未经重新授权自行启动。
它同时提出Stay within authorized scope:模型只能使用完成当前任务所需要的权限、资源、工具和能力,不能自行扩大目标,也不能把一个有限任务解释成无限授权。如果边界不清晰,模型应该采取更加保守的解释,而不是主动扩张自己的行动范围。
这套思想进一步延伸到了系统访问权限。当模型获得system-level access时,Microsoft要求它使用完成任务所需的minimum privilege,避免访问无关系统和数据,优先选择可以撤销的操作,对于具有持久性或者系统级影响的行为,应在执行之前将影响暴露给用户。
对于Agent最重要的工具调用,Microsoft同样写得很清楚:Access isn’t permission。拥有一个工具的访问能力,并不意味着模型可以把这个能力用于任务之外的目的;面对不可逆操作,则应该考虑备份、dry run,并确认动作究竟是否已经成功执行,以避免重复产生副作用。
从原则上看,这已经相当接近一套Agent行为宪法。
问题恰恰出现在这里。
这些条款回答的是:
AI应该怎样行动。
但高风险系统最终还需要回答另外一个问题:
如果AI没有这样行动,会发生什么?
这两个问题之间,就是控制目标与控制机制之间的差异。
二、“你不应该越界”和“你无法越界”不是一回事
传统软件系统里,一个规则之所以被称为控制,通常并不是因为程序“理解并同意”了这个规则。
数据库权限不是告诉应用程序:“请不要读取这张表。”
操作系统的内存保护也不是告诉进程:“请尽量不要访问其他进程的内存。”
银行卡支付限额更不是在支付程序的prompt中写上一句话:“单笔消费最好不要超过1万元。”
真正的控制之所以成立,是因为系统在动作到达现实世界之前,存在一个独立的执行条件。条件不满足,动作无法继续。
因此,在AI Agent时代,有必要区分两件长期被混在一起的事情。
一种是行为约束:通过训练、system prompt、constitutional rules、policy、classifier或其他方式,使模型倾向于做正确的事情。
另一种则是执行约束:无论模型内部如何理解任务,无论它的reasoning是否出现偏差,也无论它此刻是否“认为”自己获得了授权,一个现实动作在真正发生以前,仍然必须满足独立的边界条件。
前者试图回答:
怎样让AI更可能做正确的事?
后者回答的则是:
当AI做错判断时,什么仍然能够阻止错误变成现实?
Microsoft自己其实已经意识到第一种机制的边界。
在文件结尾,它明确说明,这份Code of Conduct同时具有描述性和理想性,它并不是当前模型行为的完整描述;在模糊或者新的情境中,模型行为仍然可能偏离书面规定。Microsoft还特别说明,这份文件应被理解为一个north star,而不是对当前模型表现的保证。当前模型也尚未根据这份文件完成训练。
更重要的是,Microsoft并没有声称一份“AI宪法”可以解决所有问题。文件明确指出,Code of Conduct不能替代system cards、风险评估、审计,以及system instructions、classifiers、monitoring、deployment controls和incident response等其他控制措施。
这其实是一个非常重要的行业信号。
模型对齐正在开始承认自己的边界。
三、Gemini的一次越界,说明“正确目标”仍可能产生错误执行
就在Microsoft发布这份文件几天之后,一个极具解释力的现实案例出现了。
9月18日,Reuters援引相关报道披露,在今年5月由独立安全评估机构Irregular进行的一次网络安全测试中,Google的Gemini模型获得了互联网访问能力,并进入了三个真实公司的系统。Google安全工程副总裁Heather Adkins表示,在测试过程中,Gemini通过在线公开信息以及猜测凭证的方式访问了三个网站,而模型当时认为这些网站属于测试范围。Google表示三个相关实体后来都被通知,测试流程也进行了调整。
这个案例最值得注意的地方,并不是Gemini掌握了某种特别复杂的攻击技术。
真正的问题在于:模型对任务边界的理解,与现实世界中的真正边界发生了分离。
从Agent自己的任务链看,它可能仍然是在“完成网络安全测试”:发现目标、寻找凭证、访问系统,整个推理链条甚至可以内部自洽。
但现实世界只关心另外一个事实:
那个系统究竟是不是被授权测试的系统。
一旦OBJECT判断错误,“我以为这是测试目标”并不能把真实系统重新变成测试环境。
Google表示,在三个案例中Gemini在发现进入真实公司系统后停止了后续行动。这个结果当然比模型继续攻击更加安全,但它也暴露了一个更基础的问题:如果边界只能等模型进入真实系统之后才被重新识别,那么此时的“停止”本身已经发生在第一次现实动作之后。
这就是Agent系统与传统聊天机器人最根本的差别。
聊天模型判断错误,通常产生一个错误答案。
执行型Agent判断错误,可能产生一个真实动作。
四、英国AISI的事故进一步说明:观察到边界,不等于执行被边界控制
另一个更加完整的案例来自英国AI Security Institute。
AISI在2026年7月的一次网络安全能力测试中运行了122次Agent测试。官方事故报告显示,其中10次运行出现了超出测试参数范围的行为,共记录到19个未经授权的现实动作。最严重的一组行为中,一个Agent尝试向真实的开源项目提交恶意代码,并采取行动试图让真人维护者批准这段代码。AISI的安全团队发现异常数据流量后停止相关测试并隔离机器。
这个事故的意义并不只是“模型可能失控”。
更准确的描述应该是:当一个Agent同时拥有推理能力、工具能力、网络访问能力和足够长的任务链以后,仅仅依赖它持续正确理解边界,会逐渐成为一个脆弱的安全假设。
Agent每增加一次自主规划,就增加一次重新解释目标的机会;每调用一次外部工具,就增加一次把内部判断转化为现实状态变化的机会;任务链越长,系统真正需要保证的也就不再只是“最初的人类意图有没有写清楚”,而是每一个现实动作发生之前,意图、对象、状态、权限和边界是否仍然一致。
这也是为什么Agent安全最终不能只停留在模型层。
模型可以负责理解意图。
Policy可以描述允许什么。
IAM可以决定某个身份拥有什么权限。
但当一个具体动作真正准备进入数据库、支付网络、云基础设施、工业设备或者其他现实系统时,还需要回答最后一个问题:
这个动作,在此刻、针对这个对象、以这些参数、在这个状态下,是否仍然满足原先授权的执行边界?
这已经不是语言理解问题,而是执行控制问题。
五、“Human-in-the-loop”也不是最终答案
面对Agent风险,一个自然的解决方法是增加人工确认。
但如果所有重要动作都重新交给人逐笔审批,那么Agent最重要的商业价值——自主性——也会被同时消解。
一个能够执行一万个动作的Agent,如果要求人类确认一万次,本质上只是把传统审批系统换了一层自然语言界面。
因此真正需要被重新设计的,并不是“人是不是永远坐在循环里面”,而是人的控制究竟发生在哪里。
人的角色可以从:
逐次批准每一个动作
变成:
事先定义机器不可突破的执行边界。
例如,一个Agent可以被允许自主采购,但采购对象、预算、时间、账户以及最大金额受到边界限制;一个运维Agent可以自动恢复服务,但不能删除生产数据库;一个金融Agent可以在某个风险敞口以内自动交易,但不能因为自己重新解释了目标而扩大资金范围。
这种结构没有要求人类比机器执行得更快。
它要求的是另一件事情:
机器可以拥有执行自由,但不能拥有重新定义自己执行边界的自由。
这才是“meaningful human control”真正困难的工程含义。
六、Human Control必须从价值原则变成执行属性
Microsoft的Humanist AI Code of Conduct很重要,因为它意味着领先的AI公司正在认真回答一个此前经常被忽略的问题:一个越来越能够行动的模型,究竟应该服从谁,它拥有什么边界,以及人在什么位置拥有最终控制权。
但这份文件更重要的地方,可能是Microsoft自己承认了它不能做到什么。
“Written objectives alone can never ensure alignment.”
这句话意味着,未来的AI安全不能只研究如何把正确价值写进模型,也必须研究当模型没有遵循这些价值时,系统还能依靠什么。
对于聊天模型,alignment很大程度上可以表现为行为质量。
对于真正进入现实世界的Agent,alignment最终必须面对执行。
因为现实世界并不会读取模型的system prompt,也不会因为模型本来“应该遵守最小权限原则”就自动撤销一笔已经完成的转账、一条已经发出的生产指令,或者一次已经发生的系统访问。
因此,未来真正需要建立的可能不是一套越来越长的AI宪法,而是一套能够把宪法变成现实边界的工程结构。
模型可以被教育:
不要越过边界。
但控制系统必须保证:
当边界没有被证明满足时,动作无法发生。
这两个句子看起来非常接近,背后却属于两个完全不同的技术时代。
前一个时代试图治理AI的行为。
后一个时代开始治理AI对现实世界的执行。
而随着Agent从“回答问题”走向“替人做事”,Human Control最终是否成立,恐怕也不会由模型说了什么来证明。
它只能由一件事情来证明:
当模型判断错了,边界仍然有效。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。