
本文来自微信公众号: Founder Park ,编辑:万户,作者:Founder Park
过去一年,Agent已经能接通电话、投放广告,甚至转账付钱。但能执行,不意味着企业敢完全放手。话说出口能撤回吗?广告预算花超了算谁的?钱转错了又该谁负责?
能不能把一项工作从头到尾做完,才是Agent落地的真正分水岭。如果最后10%仍然必须由人接手,它就可能成为整个流程的瓶颈,自动化带来的效率也会大打折扣。
8月3日,在新加坡的AGI Playground 2026舞台上,四位面向企业提供Agent服务的创业者展开了一场讨论:WIZ.AI董事长兼联合创始人陆剑锋、Ateve创始人兼首席执行官Eileen Weng、易点天下zMaticoo Demand VP Bill Cao,以及Airwallex空中云汇全球首席营收官吴恺。他们从各自正在经历的真实业务出发,讨论了Agent落地最具体的难题。本次对谈,我们邀请了Stealth Startup创始人胡少阳作为Founder Park的客串主持人。
四家公司切入的场景并不相同。WIZ.AI用语音Agent服务大型企业,Ateve为Agent构建搜索引擎,易点天下正在用Agent改造数字营销工作流,Airwallex希望把AI接入全球支付、资金与支出管理。
但他们的判断指向了同一件事。Agent的下一阶段,不再取决于它看起来有多聪明,关键是能否在企业环境里持续、可靠、低成本地交付结果。
以下为对谈实录,经Founder Park编辑整理。
01
从财务到客服,
Agent正在进入真实工作流
Founder Park:从你们的视角来看,Agent领域发生的最重大变化是什么?
吴恺(Airwallex):我们是一个AI原生的全球金融平台,帮助企业端到端地管理支付、资金和支出。我们看到两项尤其相关的趋势,并围绕它们推出了两款产品。
第一个叫T0,定位是为创业者担任AI财务总监。我们创业之初,很难招到优秀的财务总监。财务背景的人对加入早期创业公司往往比较谨慎,找到合适的人对我们而言曾是一个真实痛点。有了T0,现在可以帮助初创公司处理记账、财务报告、税务申报,包括资金管理、企业信用卡和员工工资发放在内的所有金融运营。我们希望,在公司规模还很小时,AI财务总监可以支持创始人,把团队从一两个人扩展到二三十人。而且随着公司进一步成长,T0仍然可以更深度地嵌入他们的财务工作流。
第二个趋势是Agentic Commerce。目前体量还很小,但随时可能爆发,就像很多AI应用一样。所以我们推出了「Airi」,本质上是一种面向消费者的Agent银行服务,支持消费者钱包以及由Agent驱动的交易流程。
未来,消费者想通过ChatGPT或任何其他AI工具购物时,我们可以把他们的支付方式嵌入这些工具,让Agent代表他们完成支付。起点是一键结账,未来可能变成零键结账,完全由Agent操作,当然需要用户事先授权。
Bill Cao(易点天下):吴恺刚从金融角度做了分享,我从营销角度来谈。我们为营销人员提供全栈营销解决方案,尤其面向中国出海的数字营销市场。程序化广告本质上是一个硬核工程问题,需要应对高并发、超低延迟,并把海量数据整合到同一个系统中。我们正在用Agent改造整个营销工作流。
回看六七年前,我们还处于大数据时代,不是AI时代。数字营销是个重度数据驱动的市场,海量数据不断涌入,营销人员基于纯数字指标来衡量绩效。行业的核心问题一直是:大家用不同的工具、在不同渠道投放广告、有多个数据触点,但没有一个统一的接入点把所有数据整合在一起。
大约一年半前,数字营销行业刚开始采用AI时,企业主要让它完成单项任务,例如检索和格式化数据、汇总和分析数据,或生成广告创意。这些功能彼此分散,AI只是一个接一个地完成任务,任务之间没有连接起来。
现在,我们把这些功能组合成一套Agent工作流。AI可以贯穿营销人员的整个流程,从数据检索、数据分析,到智能决策,再根据结果继续优化。过去12到18个月,我看到行业正在向越来越复杂的端到端工作流演进。
Eileen Weng(Ateve):我们正在为Agent设计一款搜索引擎,目标是让AI能够找到一切信息,从底层为AI而非人类打造,因为我们发现人类搜索和Agent搜索有根本区别。
首先是搜索频次。传统人类搜索通常只搜一次,比如用Google。但Agent搜索是一个迭代推理的过程,Agent会根据上一次查询的结果生成下一个查询,所以Agent的查询远没有人类查询稳定。
人类搜索可能形成容易识别的趋势,但Agent的查询经常出现在中间推理或验证假设的过程中。离开Agent正在执行的任务后,其中许多查询本身几乎没有意义。这会改变搜索的优化方式,目标不再只是把人的查询与相关结果匹配起来,而是判断检索到的信息能否帮助AI完成任务。
其次,Agent的需求与人类不同。人类用户可能主要看重相关性和时效性,Agent还需要结构化输出、低延迟、可控成本和token效率。
基于这些,我们看到Agent搜索正在从一款简单产品,演变为持续运行的认知基础设施。
陆剑锋(WIZ.AI):我们为大型企业提供语音Agent,主要用于客户服务和客户互动。客户大多位于东南亚,也覆盖拉丁美洲及全球其他地区。
从今年开始,无论在东南亚还是其他市场,我们都看到了越来越多的语音Agent公司。其中一个原因是,开源技术和大语言模型的能力都得到了大幅提升。但做出Demo很容易,真正打造一款企业可以使用的应用很难。
对我们而言,最重要的问题是可靠性。所谓可靠的对话,是指AI Agent能够像熟悉客户业务的专家一样解决问题、完成互动。效率和成本当然重要,但要排在可靠性之后。
首先需要控制的是响应时间,用户停止说话后,Agent能不能在两秒内开始回应?这里指的是开始回答,而不是在两秒内说完。
这个问题出乎意料地难,我们在这上面投入了很多时间。我们的语音流量大多通过公共交换电话网、手机或企业电话系统传输。如果延迟像一些聊天机器人那么长,用户会直接挂断电话。
企业还非常关注首次呼叫解决率。企业把业务外包给BPO服务商时,会考察客户满意度以及问题有没有得到解决。如果AI Agent无法在这些结果上与人工坐席竞争,多数企业就不会采用。这就是我们今年初推出多Agent语音系统的原因,可靠性是第一优先级。
Founder Park:最近OpenAI推出了新的GPT-live语音实时模式,挺出乎意料的。它只是一个Demo,还是已经真正实用?语音会不会成为人与Agent交互的主要方式?
陆剑锋(WIZ.AI):我们也在和OpenAI合作测试。使用语音到语音模型做一个Demo并不难。但我们为客户提供的不只是语音Agent系统,还有配套的评测系统。
如果把整套方案从一个模型切换到另一个模型,我们会用真实对话进行测试:它能完成多少任务,问题解决率是多少,对用户意图的识别准确率如何。通过这类A/B测试,我们才能判断一个模型能否正式上线。
这个问题没有简单的是或否。它取决于如何约束和驾驭整个Agent,以及还需要哪些辅助技术帮助它完成任务。可靠性归根结底就是把事情做成。客户并不太关心我们用了哪种技术,他们关心的是结果。
02
Agent进入复杂业务,
需要不断进化的工程能力
Founder Park:机会越大,工程挑战也越大。Bill,你们的营销Agent要实现闭环,还要同时处理高流量和大量操作,这样的工作流是怎样搭建的?
Bill Cao(易点天下):把所有分散的工具和数据源整合在一起。这是我们面临并解决的最大问题之一。
在易点天下,我们已经通过MCP对运营工作流中几乎所有工具和数据源进行了标准化。这样一来,Facebook、Google、内部工具、数据看板等不同来源的数据就能汇集到一起,为Agent提供更丰富的上下文,帮助它做出更好的决策。
第二,Agentic工作流是有成本的,特别是LLM成本和token成本。我们的解决方案是对所有SOP进行分类。对于需要深度推理的复杂场景,用高能力模型。高频、常规的场景,比如数据检索和分析,用更便宜的模型。在智能决策与成本之间取得平衡,让整套系统在经济上可持续。
Founder Park:能描绘一下未来营销人员与Agent团队协作的场景吗?
Bill Cao(易点天下):我设想,数字营销会变成一个Agent对Agent的网络。
现在,每家公司都有自己的Agent工作流。无论是Google、Meta这样的平台还是程序化广告公司,Agent工具基本都在各自系统内部运行。但未来一两年,行业会逐步走向Agent对Agent的网络——其实已经有公司在推进了。
今天的程序化广告依赖OpenRTB等协议,也就是很多系统共同遵循的API标准。未来,一部分交互可能不再需要僵化的固定协议,一家公司的Agent可以直接与另一家公司的Agent沟通。例如,SSP的Agent可以直接与DSP的Agent对话。我认为,数字营销的转型会在这里发生。
Founder Park:Eileen,你们在研究「自我进化」这个前沿方向,在产品中如何实现它?
Eileen Weng(Ateve):自我进化可以在很多层面发生,Agent层、Harness层,或者模型层。我们开始研究它,是因为传统的搜索优化方法并不适合Agent。
Agent发出的查询可能只是中间步骤,也可能是为了验证一个抽象假设。在这个搜索过程中,可能完全没有人的信号,没有点击,也没有直接反馈。你所拥有的,可能只有最初的Prompt和最终结果,也就是任务到底成功还是失败。
在这种情况下,我们无法彼此独立地优化排序器、检索模型和其他组件,它们必须整体一起进化。搜索引擎也不能独立演化,必须与Agent一起演进。
Founder Park:基础模型的自我演化很可能是大公司的事情。对于一家产品创业公司来说,应该从什么时候开始考虑Harness的自我演化?
Eileen Weng(Ateve):刚开始开发产品时,你需要找到模型公司或Meta、Athrophic和OpenAI这样的大平台不会做的事情,并选择一个能够持续深入的领域。现在仍然有很多困难、专业的工作是模型公司不愿深入的,尤其是具体行业的Know-how。
举个例子,我们服务很多医疗公司,他们的搜索需求和通用搜索完全不同,他们需要搜索论文,而不是通用问答。创业公司应该深入这类行业,找到模型公司不愿做的工作。
03
Agent自主权越大,
责任边界越要清楚
Founder Park:Agent开始执行任务之后,信任和权限就变成了关键问题。什么时候需要human in the loop,什么时候human on the loop就够了?吴恺,你的业务直接涉及资金,这一点尤为重要,怎样在Agent能力和权限之间取得平衡?
吴恺(Airwallex):这是所有Agent公司都要面对的问题,对金融服务尤其重要。我们的方法基于两点。
第一,重要决策的控制权仍然属于用户。有些操作不可逆,比如让Agent为员工发工资,或者向供应商转账。钱一旦转出,就不能简单撤回。面对这类决策,我们一定会要求Agent获得人的授权。授权可以有不同形式,比如把一批交易统一提交审批,但控制权始终掌握在用户手中。
另一些决策可以撤销。在这些场景里,我们希望尽量减少对人的打扰。比如Agent做记账工作,在账簿中添加一笔会计分录,就没有必要让人介入每一次操作,否则整个工作流都会慢下来。
第二是可追溯性。Agent执行的每项操作都应该可以追溯,用户能看到它做了什么、改了什么,也可以通过工具撤回。我们还在建立操作的反馈闭环,让Agent从错误中学习,未来避免类似失误。
消费者交易会更复杂。如果Agent代表消费者购物,一旦出现退款争议或欺诈,最终由谁负责?目前,答案仍然是用户,因为用户是持卡人,也是交易的授权者。我们正在与卡组织和其他支付方式提供商合作,研究Agentic Commerce场景中的拒付和授权争议该如何处理。
Founder Park:未来,交易会不会主要通过对话完成?比如我只要告诉ChatGPT或另一个Agent,向吴恺转账30美元,它就能直接执行。
吴恺(Airwallex):从技术上说,现在已经可以做得很好。在Airwallex的网页应用里,你可以告诉Kai Agent,自己想向某个人发起一笔转账。它会在后台创建转账,你确认之后,款项就会发出。
更有意思的问题是,我们究竟应该给Agent多大的自主权。它只负责创建转账,还是收到指令后也可以直接把钱发出去?我们对完全自主仍然比较谨慎。目前采取的是相对保守的方式,Agent在后台创建转账,但真正执行前,用户必须点击确认。
从技术上说,实现完全自主并不难,真正的问题是责任归属。
Founder Park:剑锋,你们面对的是实时语音对话。Agent说出口的话无法撤回,怎样控制它的边界?
陆剑锋(WIZ.AI):智能的本质是解决问题。人类智能同样会犯很多错误,因此,信任来自你能多好地控制和减少错误。
AI和人有不同的优势。比如,我们有些客户一小时要处理超过100万通电话,AI可以稳定地避免违规回应,无论是监管机构禁止的话,还是容易激怒客户的措辞。这种一致性,用AI比用人更容易做到。
但AI仍然有很多薄弱点。我们需要设置护栏,阻止Agent回答职责范围之外的问题。也有人会尝试通过语音进行Prompt越狱,因此系统必须先识别和过滤这类攻击,让Agent忽略这些指令。与普通人工工作流相比,AI系统需要更多保护层。
我职业生涯最初15年都在做网络安全,攻防从来是一场持续的较量。针对AI系统的威胁已经出现,但我们也不能为了所有假设中的威胁过度提前建设,否则防御机制会推高延迟和成本。
我们的做法是持续监控新威胁,针对真正出现的问题建立防御。信任因此包含两个层面,一是在现有方案中控制已知风险,二是在新威胁出现时开发新的应对技术。否则,整个业务都可能陷入危险。
04
做到什么程度,
企业才愿意把人的工作交给Agent
Founder Park:对公司而言,怎样判断一个Agent真的有效?客户为什么会使用它?
吴恺(Airwallex):我会用一个2×2矩阵来理解Agent的成功。一个维度是执行能否形成闭环,另一个维度是智能是否构成瓶颈。
最理想的情况是,执行能够闭环,同时智能是主要瓶颈。AI Coding是最典型的例子,系统可以完成整个执行闭环,最终交付代码,效果主要取决于智能水平。全世界都在寻找下一个像AI Coding一样有吸引力的用例,但目前还在探索。
第二类场景也是包括Airwallex在内的很多公司正在做的,即智能并非瓶颈,但执行可以形成闭环。我把它称为自动化。对账或代表客户完成财务操作,未必需要最前沿的智能,但Agent可以完成工作,把整个流程自动化。Agentic Commerce往往属于这一类。
衡量这类Agent的关键,是它能不能端到端完成工作流。90%和100%之间存在巨大差距。如果Agent能完成100%的流程,采用速度会快得多。Agent化改造必须渗透到每一个环节。如果最后一公里仍然由人完成,这一步就可能成为整个流程的瓶颈,大幅降低自动化效率。
我还经常思考另一个问题,让AI关注那些过去被人忽略的决策,工作流真的会变得更好吗?比如,一个过去每月只复盘一次的决策,现在AI可以每天甚至每小时复盘,能不能因此带来实际改善?
最后一类是执行无法闭环,同时智能又是瓶颈。在金融领域,很多操作都是这样,因为我们不希望AI对不可逆的操作做出确定性决策。这类产品通常被称为AI助手或Copilot。人仍然要完成一部分步骤,AI负责协助操作或思考。它们同样有价值,但不会像AI Coding那种闭环场景一样具有颠覆性。
Founder Park:Bill,你用什么指标判断客户成功?
Bill Cao(易点天下):行业变化太快,不同阶段对成功的定义也不一样,六个月后可能就会完全变化。
目前,我们的目标是构建一个从识别、诊断、执行到评估的完整闭环。现在的瓶颈是评估,因为必须考虑风险。我们虽然不是金融科技公司,但如果Agent超支了广告主的预算,同样会造成严重问题。
评估环节目前仍然需要人提供输入,为Agent补充上下文。所以,我现阶段对成功的定义,是从识别到评估形成完整闭环,同时把评估阶段所需的人工输入降到最低。
另一个维度是行业层面的价值。随着越来越多企业开始采用Agent和Agentic工作流,怎样推动我前面提到的Agent对Agent网络的形成,是整个行业需要面对的问题。我们希望把自己在AI Agent上的实践经验带给行业,成为这个方向的先行者——这也是我定义成功的一部分。
Eileen Weng(Ateve):我们服务很多B端企业客户,会通过几项标准判断一个Agent是否真正完成部署。
第一,Agent是否在真实业务流程中运行,而不只是一个Demo,必须在生产环境中解决真实问题。
第二,Agent是否能访问真实数据,包括CRM、邮件等内部系统,而不只是网上的公开信息,这样才能真正进入业务闭环。
第三,Agent是否可靠到不需要有人盯着看?如果需要全程监控,就不算真正部署。
满足这些条件,才算真正部署。它的成本还必须低于所要替代的流程。Token目前仍然昂贵,如果Agent比人工更贵,它在经济上就无法成立,也不可能规模化。
陆剑锋(WIZ.AI):我们的AI Agent以100%自动化为目标,通常采用human on the loop,而不是human in the loop。对客户成功的定义有两层。
第一层,是像人一样把事情做好。首先,AI不能犯不可接受的错误。例如,在促销活动中,不能向客户作出公司没有授权的承诺。其次,它要取得与人工团队大致相同的结果。达到这条线,就意味着它能够像人一样完成工作。
第二层,是利用AI的能力把工作做得比人更好。但第一层是基础。如果AI连基本要求都达不到,即使拥有更先进的能力,企业客户也不会接受。
以外呼营销为例,一家银行可能希望向现有客户介绍另一款产品。客户会先安排五到十名人工坐席,我们测量他们的转化率,再让AI Agent在随机A/B测试中完成同样的任务,比较最终结果。
如果AI的结果不够好,我们会判断它的对话是否达到了人工团队的水平,以及怎样让它不只是像一个人,更像一名优秀的电话销售。对于先买后付的还款提醒,我们会比较AI与人工团队的最终回款率。
AI目前还不能在所有场景中与人竞争,但已经能够处理大多数对话。下一步要问的是,AI能不能做得更多?比如,它在提供服务时,能否从对话中提取客户洞察?运行一周之后,能不能告诉企业,某款产品或服务可能出了问题?
人工客服团队很难汇总这类洞察,尤其是过去大多数语音对话没有被数字化和分析。AI可以在这件事上做得更好。不过,我们目前仍然专注于解决第一层的问题,这也是为什么WIZ.AI今年的关键词是「可靠性」。
05
模型变强、成本下降,
企业离AI原生还有多远
Founder Park:Agent的未来让人期待,但为什么还有这么多企业没有真正用起来?瓶颈是Token成本、部署人才,还是企业很难转向AI原生?
吴恺(Airwallex):有两件事让我对未来保持根本性的兴奋。
第一,模型仍在不断进步。今天许多无法解决的问题,本质上仍然受限于模型智能。如果智能继续提高,很多当前无法完成的任务,就可能进入我前面提到的第一类,执行能够完全闭环。如果我们不再需要如此担心幻觉、越狱和类似风险,这件事就有可能发生。
第二,我相信AI会继续在企业内部扩散。Airwallex自身也才刚刚开始采用许多AI能力。过去12个月,外界对AI的预期被拉得非常高,所有人都担心错过机会,希望快速投入。我们甚至要求公司每一名员工都使用AI。
但很多技术和应用可能还没有准备好,应用层也存在过度投资。基础模型层面的持续投入有充分理由,因为智能还有很大的提升空间。
如果看未来18到24个月,我非常积极和乐观。但接下来三到六个月,很多公司会重新审视,自己的AI支出是否真的带来了预期回报?
Bill Cao(易点天下):六个月后,数字营销领域的每家公司都会在某种程度上使用AI。但在整个AI原生转型过程中,我认为企业组织架构才是真正的瓶颈,而不是技术或模型。
每个人都说「我们要拥抱AI」,但这究竟意味着什么?这是一句很抽象的话。像我刚才提到的,通过MCP对工具和数据库进行标准化,是其中一种方法,但真正这样做的公司并不多。我认为这才是Agent未来发展的真正瓶颈。
如果企业能让自己的系统变得更加AI原生,就能在不久的将来真正采用AI和Agent。至少在数字营销领域,我不认为Token成本是主要瓶颈,因为能力更强、价格更低的模型还会不断出现。这个领域的企业不应该害怕尝试,先试一试,看看是否有效。如果没有效果,就换一个方向。这种愿意实验的态度,也是AI原生思维的重要部分。
Eileen Weng(Ateve):关于Token成本,我有一点不同看法。目前它仍然是Agent落地的重要障碍。但日前发布的DeepSeek v4等模型非常明显地显示,Token的成本正在逐日递减,并且基本的Token消耗是可以预测的。在多Agent任务中,Token消耗可能很大,而且很难预测。未来Token或许会变得非常便宜,但今天最昂贵的是「错误的Token」。
所谓错误的Token,是指Agent探索了错误路径,以错误方式执行任务,或犯错后需要返工。之后,人还要审查它的工作,解决由此产生的问题。成本并不只是第一次推理调用。
企业仍然存在几道鸿沟。第一是信任鸿沟,人们不信任Agent去处理核心工作,也很难清晰划分Agent与人的工作边界。
第二是数据鸿沟,Agent往往没有权限访问企业的核心数据,因此无法真正完成有意义的工作。
第三是组织鸿沟。传统企业的层级结构并不是为Agent设计的。每个人都有明确权限,但Agent未必能够理解这套结构。很多公司甚至无法定义自己究竟希望Agent做什么。
在这种情况下,单纯的模型能力并不是决定因素。你可以做出一个很强的模型,但Agent能否在企业落地,可能取决于前沿部署工程师。他们需要把业务语言转换成Agent能够理解的形式,包括企业的上下文、历史和流程。
陆剑锋(WIZ.AI):我预计,可靠性问题会在未来六个月得到大幅改善。届时,大家的关注点会从单纯把事情做成,转向获得更好的成本结构。人们会开始区分,哪个是最好的推理模型,哪个模型响应最快,哪个最具成本效益。
现在大部分方案都只调用最好的模型。未来我们会像组建人才团队一样组建Agent团队,接待工作要招聘适合做接待的人,战略岗位则可能从新加坡国立大学、南洋理工大学、斯坦福或麻省理工寻找人才。不同岗位需要不同水平、不同类型的能力。
这种转变已经开始。今年年初以来,我们看到许多「Token工厂」公司的收入增长得非常快。
我同意Eileen的判断,现有的组织基础设施是为人类设计的。最困难的任务,是把它改造成适合AI Agent的形态。即使是我们相对独立的客服场景,融入企业业务流程仍然困难重重。今天是让Agent去适应为人设计的组织,未来则可能需要重新设计组织基础设施,让它适应AI。这种改变需要更多时间。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。