
本文来自微信公众号: 曼谈AI ,作者:曼谈AI
“如果一个医疗Agent的准确率是80%,你敢不敢让它给你看病?”
前段时间和几位做模型、服装电商、医疗、投资和企业管理的朋友聊AI落地。聊到医疗时,讨论逐渐落到这样一个问题上。
另一个人马上接了一句:“很多线下医生的准确率也未必有80%,但------医生可以负责。”
这句话把问题说透了一半。
企业当然关心准确率,但真正决定一个AI能不能进入业务的,不仅仅是准确率这么简单的衡量标准:它能不能把任务做完,企业能不能及时发现它做错了,以及出了问题以后由谁处理、谁负责。
这三个问题,分别指向了AI落地中经常被混在一起的三件事:Harness——也就是承接模型、让AI进入工作流程的外部系统——以及验收机制和责任设计。
| 模型决定一件事能不能做,Harness决定它能不能持续做,验收和责任决定它能不能进入生产。 |
模型会做,不等于系统能跑起来
模型更新越来越快,新工具和新能力也不断出现,但行业落地并没有以同样的速度发生。原因并不难理解:一台功率强大的发动机,不会自动耕地,也不会自动开矿。模型提供了能力,但把能力变成工作,还需要另一套系统。
让模型回答一个问题,和让它连续完成一项任务,是两件不同的事。在一个实际任务中,Agent曾经连续运行五天多;而在另一个案例里,平台底层发生变化,十几个日常任务就同时失效了。两边使用的模型都不弱,差别在于外部环境能不能接住任务。
一项任务交给AI以后,系统要不断回答几个很具体的问题:这一轮应该让它看到什么信息,可以使用哪些工具,任务已经进行到哪里,行动以后又发生了什么。上下文、工具、状态、边界和反馈,决定了AI是偶尔答对一次,还是能够持续工作。
这些才是Harness要处理的问题。
| Harness不是某个固定产品,而是为AI完成工作搭建的一整套外部环境。 |
它可以管理上下文、工具、状态、流程、权限、评价和人工接管,但不存在适用于所有行业的标准组合。Harness也不是把功能和插件不断堆上去。任务越长,系统越需要保持简单、稳定,并且清楚地限制AI能做什么、做到哪一步应该停下来。
模型决定能力的上限,Harness为持续执行提供条件。但能运行只是开始。AI能不能进入生产,还要看企业能否及时、低成本地判断它做得对不对。
决定行业落地速度的,可能是验收成本
代码Agent是较早取得明显进展的领域之一,一个重要原因是它拥有相对便宜的验收器。
代码能否编译、测试是否通过、页面能否运行,通常很快就能得到结果。AI每完成一步,都有机会知道自己错在哪里,并据此继续修正。
服装电商就没有这么轻松。
一家做服装电商AI的团队,已经能把同一件衣服换到不同模特身上。面向消费者时,用户只是想大致看看上身效果,八十多分可能已经有用。进入品牌客户的生产流程后,标准完全变了:珍珠扣不能变成塑料扣,V领不能变成圆领,布料纹理也要保持一致。一处细节错误,就可能让整张图无法交付。
团队在生成模型外又增加了视觉检查,识别纽扣材质、比较领型、判断纹理是否一致。这套规则能够发现一部分问题,却无法穷尽所有细节。品牌客户要求接近99分,模型做到80分或85分,依然不是可以稳定交付的生产结果。
这里首先存在模型能力不足:它还不能稳定保持纽扣、领型和纹理等细节的一致性。但进入生产以后,问题又多了一层——系统能不能及时识别哪些结果可以交付,哪些需要重新生成、人工修正或直接放弃。
如果每张图仍然要由人从头检查,即使模型偶尔能达到要求,也很难形成规模。更好的模型可以提高一次生成的合格率,验收机制则要发现剩余的错误,并把失败案例重新变成系统改进的反馈。两者缺一不可。
这也是为什么,一个看起来不错的平均分,并不等于可以进入生产。错误能够自动暴露、修复成本很低,当前的模型表现就可能成为起点;错误隐蔽、后果严重、只能依靠专家逐项检查,看起来再高的分数也很难转化为生产力。
| 判断一个行业会不会被AI快速改造,不能只看模型能力和数据量,还要看结果能否被低成本验收。 |
这是一条容易被忽略的行业分界线。模型能力决定上限,验收成本则在很大程度上决定这种能力能否被大规模使用。
行业专家真正稀缺的,是定义什么叫“做对”
谈行业AI时,人们常把行业专家的作用理解为提供知识:整理文档,建立知识库,再让模型检索。
但专业领域真正困难的地方,往往不是找不到资料,而是一个结果看起来头头是道,专家却能迅速发现它理解偏了。
服装专家能看出纽扣、领型和纹理的细微变化,医生知道哪些症状意味着风险升级,投资人能够判断一条逻辑链是否完整,管理顾问则能发现一套方法论虽然语言上说得通,实际上没有抓住问题。
这些能力不只是“知道得更多”。它们是一整套长期形成的判断:什么结果可以接受,什么错误绝不能放过,什么情况必须停下来,哪些边缘案例需要交给更有经验的人。
这恰恰是许多行业AI最缺的部分。
如果这些标准只存在于专家的直觉里,AI做完以后就只能请专家从头再检查一遍。工作并没有消失,只是从“做”变成了“审”。当这些经验被拆成检查项、风险等级、中止条件和升级规则,其中能够明确表达的部分,才可能进入Harness,成为机器可以执行的验收机制;无法形式化的部分,则需要进入人工判断和升级流程。
行业专家在AI落地中的角色也因此发生了变化。他们不只是向模型补充知识,更要和工程团队一起定义任务、边界和验收器:哪些工作可以自动完成,哪些结果需要抽查,哪些信号一出现就必须交还给人。
行业经验真正变成系统能力,通常不是多上传了几份资料,而是把一句“我看着不对”,逐渐变成系统知道哪里不对、严重到什么程度、下一步应该怎么办。
AI放在什么责任位置,可能比准确率更重要
再回到开头那个问题:80%准确率的医疗Agent,能不能给人看病?
如果让它独立诊断并开出治疗方案,这个数字显然令人不安。但如果它负责整理病历、发现缺失信息、提示风险、给医生提供辅助判断,同时把不确定和高风险案例主动升级,80%所代表的价值就完全不同。
改变的不是数字,而是AI在工作流程中的位置。
投资也是如此。投资本来就没有一个即时、唯一的正确答案。让AI直接决定买什么,很难通过一次回测证明它真正有效;让它扩大信息覆盖、检查论证链条、寻找反例,并持续搜集能够推翻现有判断的证据,却可能立刻改善决策过程。
AI从决策者变成证伪工具以后,仍然深度参与决策,但被放在了一个更合适的位置:它处理人难以覆盖的信息规模,人保留价值判断和最终责任。
这并不意味着AI永远只能做辅助工作。随着模型、数据和验收机制变得成熟,它承担的范围可以继续扩大。关键是每扩大一步,都要说清楚:哪些错误系统能够发现,哪些决定可以撤回,什么情况必须中止,以及最后由谁承担后果。
准确率描述的是模型平均表现,责任设计决定的却是企业敢不敢使用它。
很多行业的突破口,不是继续等待一个接近满分的模型,而是重新设计AI在流程中的位置:让它先承担擅长且可检查的部分,把例外、价值判断和最终责任留给人。这样,现有能力也可能产生真实价值。
从一件有验收器的事开始
“企业大脑”“自动投资”“独立诊断”很有想象力,但输入、输出和责任边界都不清楚,最后往往只能依赖人从头到尾兜底。
换一个起点,很多问题会简单得多:先选择一项高频发生、边界明确、结果能够检查、错误可以补救的任务。它可能没有那么宏大,却能让AI第一次真正进入业务。下面并不是一套适用于所有企业的标准答案,只是几个更容易启动的例子。
| 行业 | 不建议一开始做 | 更合适的起点 |
| 投资 | 自动做投资决定 | 信息覆盖、证据整理、逻辑链和主动证伪 |
| 医疗 | 独立诊断和治疗 | 分诊、病历整理、医生培训、随访与辅助判读 |
| 企业管理 | AI直接制定战略 | 识别矛盾、补充证据、模拟方案和追踪执行 |
| 电商 | 通用内容生成工具 | 从素材到发布、审核和转化反馈的完整流程 |
| 科研 | 自动发现重大成果 | 文献分析、实验设计、数据处理和假设证伪 |
| 3D/工业 | 开放世界通用Agent | 有物理规则、边界明确、能够验收的仿真任务 |
任务选定以后,可以先用历史案例检验系统,观察错误集中在哪里;随后进入影子运行,让AI参与真实任务,但暂时不直接影响业务;等失败方式和风险边界逐渐清楚,再把低风险、可撤回的部分交给它。
走到这一步,准确率只是一个数字。更重要的问题是:AI究竟减少了多少人工工作?哪些结果仍然需要检查?错误多久能够被发现?失败以后能否恢复?最终有没有带来成本、收入或质量上的改善?
每一次失败、人工修改和业务结果,再回到Harness中,继续调整上下文、工具、流程、权限和验收方式。系统由此不再是一次性交付的软件,而会随着真实工作持续生长。
最终形成的不是“一个很聪明的AI”,而是一条能够运行的生产线:
| 真实任务→正确上下文→稳定执行→结果验收→人类担责→反馈回流→经济收益 |
模型还会继续升级,今天需要专门开发的功能,明天可能成为基础能力。更难被替代的,是模型之外逐渐积累的行业数据、工作流程、验收标准、责任机制和业务反馈。
Harness让AI能够持续工作,但只有当结果可以被验证、风险有人承担,并且最终产生经济价值时,它才真正成为生产力。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。