2026-09-07 00:06

生成式AI 的中局范式:从Harness 到Experience Loop

author_path AIGC从0到1

本文来自微信公众号: AIGC从0到1 ,作者:王零壹,原文标题:《生成式 AI 的中局范式:从 Harness 到 Experience Loop》


过去几年,生成式AI行业一直在寻找下一个足以改写叙事的大词。


有人说是更大的模型,有人说是推理,有人说是Agent,有人说是世界模型,也有人已经把目光投向“自我改进”“递归自我提升”。


但如果把这些概念拆开,会发现:2026年的行业未必已经出现了“Transformer 2.0”式的新底座;真正逐渐收敛的,是一套比“模型能力”更完整的系统观。


它大致包括三个层面的变化:


  • 在产品上,AI正从“帮你用软件”,走向“替你交付工作”;


  • 在系统上,模型不再独自构成产品,模型之外需要一个持续运行、可行动、可验证的Runtime;


  • 在学习上,行业开始从“依赖人类数据训练模型”,走向“让系统在环境中积累经验,并把经验转化为能力”。


如果一定要写成一个公式,今天越来越多AI系统接近的是:


AI System=Model+Persistent Runtime+Environment+State/Memory+Verification+Learning Loop


或者更直白一点:


Goal→Act→World→Feedback→Update→Act Again


ChatGPT时代的基本链路是:提示词,生成答案。


成熟Agent系统的链路则变成:目标,执行,进入环境,获得结果,接受评估,沉淀经验,再次行动。


讨论的是:AI如何从一次性推理,变成一个持续存在于真实世界里的系统。


一、先别把五层问题混成一场路线之争


今天关于Agent、Harness、Agent OS、Continual Learning、World Model的争论,常常显得混乱。原因不复杂:大家讨论的根本不是同一层问题。


层级讨论的问题代表性方向
模型层智能从哪里来Scaling、推理、多模态、世界模型
系统层模型如何真正行动Model+Harness/Runtime
学习层系统如何变得更好经验、记忆、技能、持续学习
产品层用户究竟买到什么Copilot、Agent、AI Worker
产业层AI在经济中扮演什么角色软件工具、数字员工、软件即劳动力


这五层会相互影响,但不能互相替代。


例如,腾讯WorkBuddy、阿里QwenWork、Grok Bot等产品的意义,在于它们把AI产品的交付单位,从“回答”推进到了“任务成果”。


微软对Copilot的表达也经历了类似变化:从“帮我找到”,到“帮我选择”,再到“替我完成”。


这是一种很重要的产品迁移:软件开始从工具,走向劳动力。


但“软件即劳动力”不是模型自动出现的结果。模型能思考、能生成,不等于它拥有身份、权限、记忆、工作现场、操作记录与责任边界。那些问题,属于运行时。


二、Agent的关键,不只是模型,而是它运行在哪个世界里


DeepSeek在DSH中给出了一个非常清晰的表达:


Agent=Model+Harness


其中,模型负责智能;Harness负责让智能能够完成任务。


DeepSeek的做法尤其值得注意:模型、工具、技能、会话、沙箱、存储、循环、调度和UI,都可以被视为可替换的插件。核心保持很薄,外围不断替换和组合。


这意味着,Harness不是一个写死的Agent工作流。


它更像一个可以持续被检验、替换、重放、恢复、分叉和优化的运行环境。Agent不只是“调用几个工具”,而是在一个可观察的系统中工作:它有轨迹,有日志,有状态,也需要面对失败。


Anthropic在其面向托管Agent的实践中,也提出了一个很现实的判断:许多Harness本质上编码了“模型做不到什么”的旧假设。模型变强后,这些经验性补丁可能反而成为约束。


这正是当下系统设计最微妙的地方。


模型能力增强,会吞掉一部分Harness。


但它不会吞掉全部Harness。


会被模型逐渐吞掉的,是认知层的脚手架:


  • 硬编码的规划逻辑;


  • 提示词技巧;


  • 固定决策树;


  • 简单的工具路由;


  • 机械式重试;


  • 为弱模型设计的大量上下文补丁。


模型越强,越不需要人类替它规定“应该先想什么、再想什么”。


但另一部分东西,不会因为模型更聪明而消失:


  • 身份与权限;


  • 沙箱与隔离;


  • 长期状态;


  • 外部记忆;


  • 工具契约;


  • 审计日志;


  • 成本控制;


  • 验证机制;


  • 安全与治理边界。


这些不是认知问题,而是现实世界的问题。


模型可以决定“下一步应该做什么”;但模型不能自己决定“它是否有资格做这一步”。


所以,未来更可能发生的变化是:


认知脚手架会逐渐消失,行动基础设施会越来越厚。


也可以写成一句更短的话:


Cognitive Harness变薄,Operational Runtime变厚。


很多所谓Agent OS,最后未必会成为“AI的Windows”或“AI的Android”。它更可能变成非人类行动者的运行环境:管理状态、身份、权限、资源、工具、沟通、记录和评估。


它不是智能本身,但它决定智能能否被安全、稳定、长期地使用。


三、Harness是今天最成熟的答案,但它还不是终局


如果只看2026年已经被证明有效的部分,Model+Harness几乎是最清晰的系统范式。


因为模型再强,也需要被接入环境。


一个能完成复杂工作的Agent,至少需要回答这些问题:


  • 它能看见什么?


  • 它可以调用哪些工具?


  • 它有没有权限修改数据、发邮件、下单或部署代码?


  • 中途失败后,能否恢复?


  • 多轮任务结束后,是否还记得此前发生过什么?


  • 它的动作能否被追溯?


  • 谁来判定它完成得对不对?


这些问题的答案,构成了Runtime。


所以,今天的Agent成熟度,不只看模型benchmark,也要看运行时是否具备“持续工作的条件”。


一个较完整的Agent系统,可以写成:


Agent=Model+Runtime+Environment+Memory+Verifier+Learning Loop


其中:


  • Model提供通用智能与推理能力;


  • Runtime提供编排、身份、权限和持久状态;


  • Environment提供任务、工具、资源与现实反馈;


  • Memory保存可复用的信息;


  • Verifier判断结果是否可靠;


  • Learning Loop把一次次执行转化为系统能力。


前四项,已经逐渐成为工业实践。


真正仍未定型的,是最后一项:Learning Loop。


也就是,AI获得经验之后,到底改变什么?



四、真正的问题是“经验更新哪里”


在传统模型叙事里,能力提升的路径相对清楚:更多数据,更多算力,更长训练,更强模型。


但Agent进入环境后,系统开始产生另一类数据:不是人类提前写好的语料,而是行动产生的经验。


它完成一次任务,失败一次操作,收到一次用户纠正,通过一次评估,都会留下轨迹。


问题是,这些轨迹最终应该流向哪里?


一个很有解释力的更新栈是:


Experience→Memory→Skill→Context Strategy→Harness→Model Weights


这条链路把许多看似不同的技术路线放回了同一张图里。


一次经验,最轻量的处理方式,是进入记忆。


再进一步,经验可以被提炼为技能:下次遇到类似任务,不必从零开始。


继续往上,它可以改变上下文策略:什么信息应被优先召回,什么历史应被压缩,什么证据必须在行动前出现。


再往上,它可能改变Harness:工具如何组合、任务如何分解、失败后如何恢复、哪些步骤必须经过验证。


最重的一层,才是更新模型权重。


因此,“Harness会不会自我进化”“技能会不会自动优化”“记忆是不是下一代壁垒”,其实都是同一个更根本问题的不同回答:


AI获得经验以后,究竟应该修改系统的哪一层?


这也解释了为什么不少所谓“自我进化Agent”,并不一定真的在训练模型。


有些系统在更新技能文件,有些在优化提示词,有些在重写工作流,有些在调整工具策略,有些则从历史轨迹中抽取下一轮可执行的规则。


它们的共同点不是“已经实现通用自我进化”,而是开始把经验视为可被处理的生产资料。


不过,这条路的门槛很高。


微软关于Agent演化的研究综述提出了一个很务实的结论:如果缺少确定、独立的验证器,系统依赖模糊的自我评价,反而可能越优化越差。


这很符合工程直觉。


让AI自动改进一段代码、一个工作流或一个技能,本质上是在让它修改生产系统。没有稳定的测试、评估和回滚机制,所谓“学习”很容易退化成随机漂移。


因此,自我优化最先适合的领域,往往不是最开放的任务,而是结果可验证的任务。


例如:


  • 能否通过测试;


  • 是否完成表单;


  • 价格、库存或字段是否正确;


  • 代码是否运行;


  • 任务是否在约束内完成;


  • 输出是否满足明确标准。


先有验证,才可能有可靠的改进。


五、经验和环境,可能成为下一条能力曲线


关于下一代AI,最值得重视的变化:“经验”开始被当作独立变量讨论。


DeepMind与强化学习路线的长期判断一直很明确:如果系统不能在长期环境中积累、保留和迁移经验,它很难拥有真正持续的能力增长。


Demis Hassabis多次强调,持续学习、长期记忆和长周期推理仍是关键缺口。Agent的重要性,不在于它是一种产品皮肤,而在于它让模型真正进入环境。


模型只有进入环境,才能获得后果。


有后果,才有反馈。


有反馈,才可能形成经验。


字节Seed发布的EdgeBench,是这类讨论中很有代表性的信号。该基准包含134个真实任务、约3.8万小时Agent与环境交互;单个任务通常要求持续操作12小时以上,部分任务延续到72小时。


报告中最值得注意的,是其提出的观察:在特定任务集合中,Agent的表现曲线呈现较稳定的增长趋势;团队还观察到,Agent在部分任务上的学习速度似乎正以大约每三个月翻倍的速度提升。


但它提出了一个值得严肃对待的问题:


过去,行业主要讨论参数、算力和token。


未来,能力曲线会不会多出一个横轴:


Environment Interaction Time


也就是,系统究竟在真实环境中经历了多少次行动、失败、纠正、验证与再尝试。


如果这个变量成立,环境就不再只是模型部署的终点,而会成为能力生产的一部分。


世界不只是供AI使用的工具集合,它也可能是AI获取新数据、形成新策略、积累新技能的训练场。


六、OpenAI的RSI,意味着什么?


围绕“递归自我改进”的讨论,很容易滑向戏剧化叙事:AI开始自己造AI,然后能力爆炸。


现实版本要克制得多。


OpenAI组建RSI团队,重点并不是宣布“我们已经拥有AGI”,而是尝试自动化高质量研究工作:让系统参与研究流程、构建评估、处理反馈、发现缺失能力、生成数据,并帮助改进下一代模型。


这更像一个AI研发飞轮:


研究任务→Agent执行→产生轨迹与反馈→评估→数据与方法改进→更好的模型与系统→更复杂的研究任务


字节Seed等团队也在让模型参与评估、数据、训练、研究和基础设施工作,并探索小时级、天级的长任务。


这里真正值得观察的指标,


是:


AI对AI研发的有效贡献,占整个研发流程的比例是否越过某个临界点。


当AI只能辅助写代码、总结论文时,它是工具。


当AI能持续完成可验证的研究与工程任务,并把结果重新送回训练、评估和系统优化链路时,它才开始成为研发能力的一部分。


这距离“递归自我提升”仍然很远,但方向已经很具体。前两天,山姆奥特曼宣称在年底之前可以内部实现。


七、未来三到五年,分歧会落在哪儿?


如果把今天看作生成式AI的“中局”,未来不会只剩一条路线。


较大的共识是,2026—2027年,持久化Agent Runtime会继续普及。更多系统会拥有工具、权限、长任务状态、日志、记忆与可恢复能力。


2027—2029年,外部学习机制可能成为标准配置:记忆更有效,技能会优化,工作流会重写,上下文策略会调整,Harness会逐渐适应环境,验证器会参与改进。


更远一点的分歧,才是模型权重是否需要持续在线更新。


一条路线是:底层模型相对稳定,但外部Runtime、记忆、技能和环境策略持续适应。


另一条路线是:模型本身也进入更高频、更连续的学习过程。


前者的工程可控性更强,后者的想象空间更大,但安全、遗忘、能力漂移和评估难度也更高。


因此,未来几年最值得追踪的,是几个更朴素的问题:


  • 什么样的经验,真正能转化为能力?


  • 什么样的反馈,足以驱动可靠优化?


  • 经验应该写入记忆、技能、Harness,还是模型权重?


  • 新能力能否长期保留,并迁移到别的环境?


  • 谁有能力提供高质量、可验证、可持续的环境?


  • 当AI获得更多权限时,验证、审计和治理如何同步变厚?


八、Harness是今天的答案,Experience Loop可能才是明天的范式


今天,最成熟的系统答案已经相当清楚:


Model+Harness


模型负责理解与推理,Harness让它拥有工具、状态、权限、记忆、日志和工作能力。


但如果把时间拉长,真正决定系统上限的,是Harness能否把行动转化为经验,又能否把经验转化为下一轮更好的行动。


所以,生成式AI的中局,不是模型和Agent的二选一。


更像是一场从“预训练模型”走向“持续运行系统”的迁移:


Intelligence=Model×Environment×Experience Loop


模型提供潜力,环境提供后果,经验闭环决定潜力能否持续变成能力。


Harness是今天的答案。


Experience Loop,可能才是明天的范式。

本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。