
本文来自微信公众号: AIGC从0到1 ,作者:王零壹,原文标题:《当 AI 开始替你行动,界面开始不再像界面》
过去几十年,计算机界面一直在解决同一件事:
人怎样操作机器。
你打开App,找到功能,点击按钮,输入参数,确认执行。
你知道文件在哪,知道功能在哪,知道哪一步该由自己完成。
但2026年开始,很多新产品正在把这个前提一点点拿掉。
Meta Muse、OpenAI Dots、Microsoft Project Solara,以及一批企业Agent产品,表面上看依然有聊天框、卡片、侧边栏和设置页;但它们共同在做的事情,已经不是“给Chatbot找一个更漂亮的UI”。
它们开始让机器在你离开之后,继续替你行动。
OpenAI对Dots的描述非常直接:它是一个可承担持续责任、拥有云电脑、可跨连接应用工作的常驻Agent;Meta Muse也把长期目标、后台行动、跨应用执行和权限控制放进了同一个产品定义里。
这意味着,未来人机交互最重要的问题,是:
“机器什么时候可以替我行动?”
“它能做到哪里?”
“它凭什么这样做?”
“什么时候必须回来找我?”
“如果它做错了,我怎样把权力拿回来?”
这不是简单地UI风格的变化,这是计算机第一次开始把“执行权”从界面里抽走。
而未来界面的任务,也会从“让人操作机器”,变成“让人委托、限制、监督并收回机器的行动权”。
一、未来的电脑首页,可能只剩三件事
想象一下,几年后的某个早晨。
你打开电脑。
它不再先给你二十个App图标,不再先给你几百封邮件,也不一定先给你一个空白聊天框。
它可能只给你三类东西。
第一类:
我在替你推进什么。
“你的竞品研究正在进行,两个新的市场变化已经进入待判断状态。”
“客户流失预警已启动,有三位客户满足介入条件。”
“下周的商务出差已经完成初步安排,有一项航班选择需要你确认。”
第二类:
昨天什么发生了变化。
“竞争对手更新了定价策略,影响分析已生成。”
“项目预算减少10%,原计划中的两项工作被重新排序。”
“一个此前成立的研究假设,被新的数据推翻。”
第三类:
哪些地方必须由你决定。
“两个供应商都符合条件,但成本和交期存在取舍。”
“需要一次性付款2600美元,超过了当前授权上限。”
“任务看似完成,但系统无法确认订单是否真的提交成功。”
可以把它压缩成三个词:
Goals—Changes—Exceptions。
这看起来像一个更聪明的Dashboard仪表盘。
但它其实不是。
Dashboard的前提是:人看数据,再操作系统。
而这个新界面的前提是:机器已经在替人行动,人只在关键处重新出现。
这才是Agent Interface和传统软件界面的根本差别。
二、2026年发生的,不是Chatbot找到了下一种皮肤
如果只看视觉,这一轮变化很容易被低估。
还是输入框,还是聊天记录,还是文件上传,还是侧边栏。
但底层交互的基本单位,已经开始移动。
过去是:Message
你问一句,机器答一句。
接着是:Task
你不再问“这个行业最近有什么新闻”,而是说“帮我把这个行业过去三个月的重要变化理一遍”。
机器会自己搜索、筛选、调用工具、保存中间状态、整合信息,然后过一段时间把结果交回来。
再往前一步,正在出现的是:Responsibility责任
不是:“帮我查一下今天发生了什么。”
而是:
“持续关注这个领域,真正重要的变化出现时告诉我。”
不是:“整理今天的邮件。”
而是:
“管理我的收件箱,只把我必须亲自处理的事交给我。”
这三者的差异,不只是任务长度。
| 过去 | 正在发生 | 更远的未来 |
|---|---|---|
| Message | Task | Responsibility |
| Session | Project | Relationship |
| 操作 | 委托 | 长期授权 |
| App | Capability | Agent-managed world |
Task会结束。
Responsibility不会。
Task的状态是Done。
Responsibility的状态更接近:
Active、Suspended、Escalated、Revoked。启用、暂停、升级、撤销。
这也是常驻Agent最重要的变化。
它开始拥有长期目标、工作历史、权限边界、事件订阅、世界状态和待履行的职责。
于是,真正重要的问题变成:
它现在负责什么?
它承诺了什么?
它在等待什么事件?
它拥有什么权限?
它做了哪些动作?
它在什么情况下必须回来找我?
我怎样暂停它、收回它的权限,或者把它交给另一个人管理?
这已经不像在使用一个软件功能。
更像是在管理一个被长期委托的数字角色。
三、执行权正在离开界面
传统GUI的伟大之处,在于它把机器的复杂功能,变成了人可以逐步操作的对象。
窗口、菜单、文件夹、按钮、鼠标指针,本质上都在回答一个问题:
我怎样让计算机完成这件事?
路径通常是这样的:
打开App→找到功能→点击按钮→填写参数→确认执行→看结果
这套路径的前提是:人负责导航、选择、执行和确认。
但Agent正在把其中越来越多的环节接过去。
未来的路径会逐渐变成:
表达结果→系统理解意图→Agent选择工具与路径→机器行动→人只在关键处介入
微软Project Solara对这轮变化的表达很激进:从“打开的软件”走向“被调用的智能”,从按钮和图形界面走向意图表达,设备则成为进入长期运行智能的窗口。它提出的“just-in-time UI”,本质上是在设想:同一个Agent可以根据设备、上下文和交互方式,临时生成适合此刻的界面。
这意味着,最先消失的可能不是屏幕,而是mode selection模式选择。
今天的用户还常常需要判断:
我现在应该搜索,还是问Chat?
应该开Deep Research,还是开浏览器?
应该调用Agent,还是自己操作网页?
应该进入哪一个App?
应该选择哪一种工作流?
未来这些选择会越来越多地变成系统内部的问题。
人表达Outcome结果,机器决定Execution执行。
与此同时,App不会真正消失。
它会从过去的“人类导航单位”,逐渐降级成未来的“机器能力容器”。
过去是:人知道功能藏在哪个App。
未来是:Agent知道哪个App、工具、网站、协议、模型或服务可以完成这件事。
这不是App消失。
而是App从前台入口,退到后台能力层。
四、人类没有失去控制权,只是控制权换了位置
当机器开始接管执行,最自然的担忧是:
AI越强,人是不是越失去控制权?
这其实把“操作权”和“行动权”混在了一起。
传统GUI给人很强的过程控制。
点哪个菜单、打开哪个文件、选哪条路径、填写什么参数、执行哪个动作,都是人决定。
Agent拿走这些过程操作后,表面看,人类似乎失去了一部分控制。
但更准确的描述是:
人类的控制权,正在从“如何做”迁移到“要做什么、做到哪里、什么情况下必须停下来”。
过去,人控制:
每一步操作;
每一个菜单;
每一次输入;
每一个执行动作。
未来,人更可能控制:
最终目标;
可接受的代价;
优先级;
时间边界;
金额边界;
数据边界;
对外沟通边界;
例外处理规则;
是否接受结果;
是否继续授权。
以商务出差为例。
传统UI下,你需要:
打开订票App→搜索城市→选择日期→对比航班→看价格→填个人信息→确认支付。
Agent-native的表达可能是:
“按我过往的商务出差偏好处理。超过3000元、涉及改签风险、红眼航班或签证问题时再问我。”
前者是Control every step。
后者是Control policy and boundary。
人不再是亲自移动鼠标的人。
人开始变成Principal:定义目标、授予有限权力、处理价值冲突、接受最终结果的人。
这也是未来界面最深的一层变化:
Human agency不等于human operation。
人不必亲手操作每一步,仍然可以拥有结果、边界和责任。
五、反直觉:AI越强,界面未必越少
一种流行想象是:
AI越可靠
→人越不需要操作
→UI越少
→最终只剩语音,或一个聊天框。
这只说对了一半,人确实会越来越少参与连续执行。
但这不等于人应该什么都看不见。
因为如果Agent一天完成几千次动作,让人逐条看几千条日志,没有任何意义。
人不需要知道:
它点了哪个按钮。
它打开了哪个网页。
它复制了哪一段文字。
它调用了第几个工具。
人真正需要知道的是:
它为什么相信这个结果;
哪个假设发生了变化;
哪个动作不可逆;
哪个结果无法验证;
它动用了什么权限;
它为什么认为自己有资格这样做;
它在哪里触及了默认规则的边界。
因此,未来UI既不会简单走向“更多透明”,也不会走向“完全黑箱”。
它会走向:
Just enough transparency恰到好处地透明
低风险、可逆、确定、短任务,UI可以越来越隐形。
高风险、不可逆、不确定、涉及真实价值取舍的任务,UI不但不能消失,反而会变得比今天更重要。
可以把未来交互写成一个简单函数:
Interface=f(Risk,Reversibility,Uncertainty,Duration)
它大致会导向几种不同制度:
低风险、可逆、确定、短任务:Invisible Automation;
风险略高:Act→Inform;
涉及付款、对外沟通、重要修改:Prepare→Approve;
高不确定性、创造性任务:Shared Workspace;
长期、多Agent、高责任任务:Role/Policy/Exception UI。
所以,未来UI会从continuous interaction持续互动,变成selective intervention选择性干预。
平常,机器自动流过。
到了真正需要人类判断的地方,机器停下来。

六、未来界面真正要管理的,不是页面,而是行动权
如果一个Agent要替人行动,人和机器之间究竟需要被明确管理什么?
答案是一套新的关系对象。
1.Goal:人想让世界变成什么样
Goal不是一句Prompt。
Prompt是表达方式。
Goal才应该是持续存在的系统对象。
比如:
“完成一本关于AI时代技术品味的书。”
这个Goal下面,未来可能天然挂着:
Context;
相关文件;
Research;
Deadline;
Budget;
Success criteria;
当前状态;
Agents;
Decisions;
History;
Constraints。
它可能持续几个月,甚至几年。
你离开电脑之后,它依然存在。
所以,Goal很可能成为File、Folder、Project之上的新抽象。
因为文件终于开始被放进一个更接近人类意图的结构里。
2.Responsibility:谁长期负责这件事
Task是:
“查一下今天发生了什么。”
Responsibility是:
“持续关注这个领域,出现真正重要的变化时告诉我。”
Task是工作的分解单位。
Responsibility才是长期委托的单位。
这也是为什么“AI员工”这个词虽然粗糙,却抓到了一点什么:未来的关键不只是某个Agent能否做完任务,而是它是否拥有明确、持续、有限的职责域。
但“数字员工”仍然不够准确。
Agent不应该被赋予无限责任。
它应当是一个受限角色。
它有职责,也有权限边界;能主动行动,也必须接受暂停、撤权和接管。
3.State:我们共同面对的现实是什么
未来复杂协作的中心,是双方共同面对的State状态。
它可能是:
代码库;
文档;
表格;
设计稿;
客户状态;
供应链数据;
订单;
日程;
数据集;
研究资料;
一个正在变化的世界模型。
所以未来复杂知识工作最稳定的形态,很可能不是Shared conversation。
而是:
Shared state共享状态
人和Agent围绕同一个Artifact工作。
聊天退到边缘,负责澄清、协商、批评、重定向。
真正的“共同事实”,存在于Artifact和State里,而不是聊天记录里。
AG-UI这类新协议之所以值得注意,因为它开始把Agent状态、UI intent、工具调用和用户交互视为同一条实时交互边界上的对象。
4.Trigger:机器什么时候可以主动行动
传统GUI的核心时间结构是:
now。
点击以后,现在执行。
常驻Agent的时间结构则是:
if/when/until。
如果价格低于某个阈值;
收到某个人的邮件时;
如果项目三天没有进展;
一旦竞品发布新产品;
如果一个研究结论被新证据推翻;
每周五生成一次简报;
当客户流失风险达到某个等级时。
Trigger触发器不是高级版日程。
它是:
机器何时获得Initiative的条件。
没有Trigger,所谓“全天候Agent”大概率仍然只是一个后台Chatbot。
5.Authority:机器能做到哪里
传统软件权限问的是:
App能不能访问相机?
Agent世界的问题是:
这个Agent在什么条件下,可以代表我做什么?
这完全不是一个层级。
未来的授权会越来越像:
可以读邮件,但不能发送;
可以草拟合同,但不能签署;
100美元以下的采购可以自行处理;
公开发布必须人工确认;
可以与供应商协商,但不能承诺价格;
晚上十点以后,只有P0风险可以打扰;
可以访问项目资料,但不能把数据带出组织边界。
过去软件有Settings。
Agent时代,越来越重要的对象会是:
Policy规则
Settings管理软件如何运行。
Policy管理机器可以代表谁行动、行动到什么程度。
Workday已经把Agent Interaction Policy作为独立安全对象,用来定义哪些用户可以调用哪些Agent技能。
这只是很早期的形态,但方向已经出现了。
6.Exception:机器在哪里必须把权力交还给人
Notification说的是:
Something happened。
Exception说的是:
Machine agency stops here.Human agency required.
这是完全不同的东西。
未来的Exception可能包括:
两个方案都可行,但成本和时间存在不可自动化的取舍;
付款超过预算;
某个高风险动作需要扩大权限;
先前成立的假设被新数据推翻;
结果看似完成,但无法验证;
Agent遇到与既定目标冲突的新情况;
Agent无法继续推进,需要重新定义目标。
Exception是权力交接点。
也是未来Agent Inbox最值得关注的地方。
过去的Inbox是:别人希望我做什么。
未来的Inbox更可能是:
机器在哪些地方不能替我做决定。
7.Verification:我怎么知道它真的做对了
AI越强,人越不应该逐步盯着它做事。
人应该看证据。
未来最重要的迁移,可能是:
Reasoning visibility→Evidence visibility。
我们今天经常观看:Agent做了什么。
未来更重要的会是:有什么证据证明它做对了?
这会带来一批新对象:
Receipt;
Evidence;
Source;
Test;
Provenance;
Diff;
Outcome verification。
人不需要重读整个系统。
人需要知道:
它改了什么。
为什么改。
哪些地方仍然不确定。
什么证据支持它说“完成了”。
W3C最新的《Web User Agents》草案也已经把软件“代表用户行动”放到更严肃的位置:它把保护、诚实和忠诚视为user agent对用户的基本职责。这个草案,说明浏览器、助手和Agent正开始共享一种更本质的定义:它们不是单纯呈现信息的工具,而是代表用户与外部世界交涉的软件。
8.Recovery:如果不对,我怎样把权力拿回来
传统Ctrl+Z撤销的是:一次编辑。
Agent世界需要撤销的是:一条自主行动轨迹。
这可能意味着:
Pause;
Cancel;
Rollback;
Revoke;
Restore;
Fork;
Compensate。
你不只是撤销一封邮件,可能需要暂停整个持续责任,收回权限,恢复到某个检查点,取消后续计划,甚至要求系统对已经发生的动作做补偿。
所以Recovery恢复比Undo撤销更像Agent时代的基础能力。
行动能力越大,可恢复性越重要。
这不是因为模型不够聪明。
而是因为“替人行动”这件事本身,就要求人始终保有收回行动权的能力。
七、GUI之后,是一门新的交互语法
GUI时代,Window、Icon、Menu、Pointer的意义,在于它们把复杂计算函数,变成了用户可以理解和操作的对象。
Agent时代真正对应的,不太可能是一组新的视觉控件。
它更像一组新的关系原语:
Goal
Responsibility
State
Authority
Trigger
Exception
Verification
Recovery
以及一组新的动词:
Define
Delegate
Grant
Observe
Act
Escalate
Verify
Override
Revoke
Accept
把它们连起来,就得到一条新的交互语法:
人定义Goal。
人委托Responsibility。
人授予有限Authority。
Agent观察State。
Trigger激活行动。
Agent在边界内执行。
出现Exception时升级给人。
人做价值判断或重新定向。
Agent提供Verification。
人接受结果,或暂停、撤权、恢复。
注意,这里已经很少出现传统GUI的核心动词:
Click、Open、Scroll、Navigate、Launch app。
它们没有完全消失,但正在退到更底层。
GUI把机器的功能变成可操作对象;
Agent Interface要把机器的行动权变成可操作对象。
八、Chat、生成式UI、共享工作区和眼镜,不是在争同一个终局
今天关于未来界面的讨论,常常把很多不同层的东西混在一起。
Chat、Canvas、Generative UI、语音、眼镜、Agent OS、Shared Workspace,看上去都在竞争“下一代界面”。
其实它们解决的不是同一个问题。
1、Chat:未来的语言化控制通道
Chat不会消失。
它仍然是人表达模糊意图最自然的入口。
但它不太适合承载一切。
Chat更适合:
发起委托;
澄清目标;
协商取舍;
质疑结果;
中断任务;
重新定向;
追问“为什么”;
Debug Agent的判断。
它更像:
语言化的Command Line+Negotiation Channel。
重要,但不等于整个操作系统。
2、Shared Workspace:复杂创造的真正中心
当人和Agent真正一起写代码、做研究、改文档、设计产品、分析数据时,最重要的并不是聊天记录。
而是共同操作的对象。
Conversation at the edge,Artifact at the center。
聊天负责协商。
Artifact承担共同事实。
这也是为什么未来所有界面不会都缩成一个输入框。
复杂工作必须有共同状态、结构化对象、差异视图、验证机制和可恢复历史。
3、Generative UI:把语义临时编译成最适合当前任务的界面
Generative UI很重要,但它解决的是:
这一刻,机器应该给人呈现什么操作表面?
同一个Exception,有时适合两个按钮。
有时适合一张比较表。
有时适合地图。
有时适合一段Diff。
有时适合一个模拟器。
Google A2UI的思路很有代表性:Agent不直接交付一张任意生成的网页,而是用结构化数据表达“应该渲染什么”,再由宿主应用用自己的组件系统生成界面。
这意味着:
UI开始从application property,变成runtime output。
但Generative UI不是终局。
它只是Presentation Layer的突破。
真正决定一张临时界面该长什么样的,是更底层的语义对象:这是授权、异常、验证、恢复,还是目标取舍。
所以:
Generative UI的终局不是没有原语的UI。
恰恰相反,它需要更稳定的语义原语,才能每次生成不同但正确的界面。
4、Ambient Interface:屏幕不会消失,它会变成信心表面
眼镜、耳机、戒指、手机、桌面设备,都可能成为Agent出现的入口。
低风险任务当然会越来越无界面化。
提醒、记录、导航、整理、环境感知,很多动作会在你没有主动打开软件时发生。
但这不意味着屏幕消失,更准确的描述是:
Screen将从execution surface,变成confidence surface。
平时,它不必出现。
当你需要比较、验证、授权、复盘、撤回或处理风险时,它出现。
不是为了让你操作机器。
而是为了让你确认自己仍掌握局面。
九、未来的桌面,不是App首页,而是注意力路由器
回到开头的三块未来首页。
经过前面的拆解,它们不再只是一个漂亮猜想。
它们是Agent-native计算最自然的结果。
1、What I care about
Goal/Responsibility目标/责任
什么在被持续推进。
什么被暂停。
什么需要重设边界。
什么长期由谁负责。
2、What has changed
State/Results/Verification状态/结果/验证
世界发生了什么变化。
Agent做了什么。
它留下了什么证据。
哪些结果已经验证,哪些仍然不确定。
3、What needs me
Exception/Decision/Authority request例外/决定/权限请求
哪些地方到了机器行动的边界。
哪些地方必须由人做价值判断。
哪些地方需要扩大、收回或修改授权。
这其实就是未来的Agent Inbox。
它不再是Email Inbox,是:
Human Attention Router人类注意力路由器。
当Agent足够多以后,人类最稀缺的资源不再是输入命令的能力。
而是注意力。
不是“怎样让机器开始做事”。
而是“在什么时刻,什么事情值得我亲自出现”。
十、多Agent时代,界面最终会像组织结构
如果未来一个人不再只拥有一个AI,而是拥有:
研究Agent;
编码Agent;
日程Agent;
财务Agent;
招聘Agent;
个人Agent;
公司Agent;
以及一群临时Subagents;
那么“和二十个Agent逐一聊天”,不可能成为稳定界面。
人也不会愿意观看二十个Agent的完整内部协作过程。
未来人真正需要管理的是:
Role;
Responsibility;
Authority;
Budget;
Policy;
Escalation;
Evidence;
Ownership。
这也是为什么Agent UI最后会越来越像Organization UI。
Salesforce已经在产品层面呈现了很早期的形态:一个任务可以同时分配给AI Agent与人类审核者,Agent先填充内容,再停下来等待人类审阅;无法完成时,也可以转交给预设的fallback assignee。
它说明,软件开始第一次以一种可委托、可约束、可追责的角色,进入组织结构。
过去的组织图只安排人和部门。
未来的组织图会开始安排:
人;
Agent;
工作流;
权限;
预算;
审批;
责任边界;
例外升级路径。
十一、界面将成为人类意图、机器行动权与责任交接发生的地方
未来不会只有一种“AGI的iPhone界面”。
不会所有事情都变成Chat,不会所有屏幕都消失,不会所有任务都交给AI。
真正稳定下来的,是不同风险、不同责任、不同不确定性之下的几套交互制度。
低风险任务,自动化会隐形。
复杂创造,人和AI会共同编辑同一个世界状态。
高风险行动,会需要结构化授权、证据、验证和确认。
长期多Agent系统,会要求我们管理角色、责任、预算与升级路径。
所以,未来UI的问题不再是:“我怎样让机器做这件事?”
而是:
“我想让世界变成什么样?”
“谁来持续负责?”
“它可以做到哪里?”
“它什么时候可以自己行动?”
“什么情况下必须回来找我?”
“我怎样知道它做对了?”
“做错以后,我怎样把行动权拿回来?”
过去,界面让人学会操作机器。
接下来,界面要让人学会把机器的行动权交出去,又在必要时拿回来。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。