
本文来自微信公众号: 出海同学会 ,作者:出海同学会,原文标题:《干货|The New Interface of Workflows - AI Agent 的工作流新界面》
这是Seamate RTE主题月的第二场活动。模型能力的提升让"AI会做什么"这个问题逐渐有了答案,但"AI怎么嵌入工作流"的问题才刚刚开始被认真对待。
本场活动分为两个部分。Agora Agent Platform Lead Qianze Zhang在Keynote中提出了一个核心观察:当前AI的两大角色——"沟通脑"与"执行脑"——往往被混在一个Agent里,导致交互不自然;真正高效的协作应该是两个专门化的Agent各司其职,同步进行。Panel环节由RTE开发者社区负责人Cynthia主持,邀请了来自Google Cloud生态服务商、AI SaaS创业团队、语音访谈产品等不同视角的嘉宾,围绕工具使用现状、多模态交互的演进路径、AI硬件的物理延伸价值、跨市场增长逻辑,以及SaaS时代的终结与存续展开讨论。


Qianze Zhang|Agora
最近我做了一件挺有意思的事:用纯Vibe Coding对接Agora的Voice AI Agent,把音频编解码直接写进M5Stack的Computer硬件里,让它可以直接和AI对话,还在小屏幕上做了宠物互动。整个过程中,音频采集、播放、编解码,基本都是靠AI Coding完成的。对我这样一个从来没写过C语言的人来说,这件事本身就很有意思。我觉得在嵌入式开发领域,这会带来很多新可能。
如果回看AI交互的演进,我觉得已经经历了几次明显的跃迁。最早是ChatGPT式的一问一答;到去年Claude Code、Codex出来以后,进入了任务驱动阶段,你给它一个任务,它可以长时间去处理。就我自己的体感来说,现在我每天大概95%的工作,AI都已经能帮我解决。
但这还不够自然。因为任务执行过程中,用户其实没办法一直和它交流,也没办法边做边微调。更自然的交互,应该更像和同事协作:在执行过程中不断沟通、校准方向,随时打断、补充信息。所以我现在的判断是,未来可能需要两种Agent:一种负责沟通,一种负责执行。像Claude Code、Codex这类工具,其实更擅长执行,但不擅长沟通。它们前面应该有一个专门擅长沟通的Agent,和执行Agent共享信息。这样即使后面的执行Agent正在忙,也不会影响前面的自然交流。
我们现在有个side project,叫“new bro”。它的思路就是:用户先通过手机,用自然语言跟一个“沟通脑”Agent交流;当任务被明确之后,再把执行动作转交给后面的Codex或Claude Code去完成。这样在整个执行过程中,用户依然能够保有一种比较自然的沟通体验。
放到硬件创业里,这件事就更明显了。因为硬件场景里,语音输入本身就是刚需,很多时候根本没有键盘。但像Claude Code、OpenClaw这类工具,一方面执行时间比较长,另一方面交互方式也不够自然;而很多硬件要么根本不支持输入,要么只支持单向输入。我们想解决的,其实就是这个问题:在保留执行效果的同时,把交互也做得自然,让硬件真正把工作效率的价值发挥出来。


Cynthia RTE开发者社区负责人
今天主题是从模型能力到市场产品,集合应用层、平台层、加速层一起讨论。今年Claude Code、Hermes火了之后,大家对Agent的认知上了一个台阶。请各位嘉宾先自报一下家门,简单介绍一下现在用的是什么工具、底座模型是哪家,以及每个月大概的token用量级别。
Jason Master|Concept
我们团队在北美只有几个人,主力都在亚太,跨时区协作一直很费劲。后来我们把所有的Training、Video和产品资料都丢进“龙虾”里。这样北美同事上班时,不用等亚太团队,直接问龙虾拿结果,就可以开始做事了。
我们现在用的是Google的Token,大概30多个人在用这个系统,一个月Token量级在10亿出头,人均差不多3000多,整体成本大概每月400美金左右。对比我们拿到的Google Funding,这点成本基本是九牛一毛。
Ethan Zhang|Vm0.ai
我们团队上个月Token开销主要走API Key,五个人一共花了大概32,000刀左右,人均5000多。所以这个月准备切换到订阅制,压力确实有点大。GPT-5.5出来之后,体感上它已经能追平甚至接近opus 4.7,压力一下子小了很多,有时候甚至更倾向用5.5,因为在fast模式下响应更好。
到上个月,Claude Code的开销和AI teammate的开销已经基本接近1:1,很多开发任务已经在这个系统里完成了。Coding主要还是用Codex客户端,日常自动化和项目管理才更多用"龙虾"这类工具。不同人差异挺大,但基本都在每月3000到4000刀这个区间。
Joven Lee|Cookiy AI
我们产研团队主要用"龙虾",但销售团队set up有一定门槛,所以他们更多用Hermes。我们行业里大概有75家竞品,已经融了差不多1亿美金,而我们是去年8、9月才开始做的,必须在很短时间内追上差距。在Customer Acquisition速度上,我们让团队直接搭自己的CRM,甚至搭了一个SDR团队,现在大概6、7个销售坐在Union Square那边跑客户。我们用"龙虾"和Hermes做中间层,让它们直接跟客户对接、收集信息、整理汇总,再由我们团队做最终回复。


Joven Lee|Cookiy AI
我们现在基本不怎么打字了。因为打字会让人变累,人一旦变懒,很多context就会丢掉。现在我们大部分时候是直接用Whisper或语音转文字,先跟AI把内容聊出来,再把这些文字原封不动丢进工具里去跑。
本质上,这样是在工作流里传递了更多信息。不只是语义本身,还包括你当下的表达方式、状态,以及很多隐含的context,所以最后产出的结果质量会明显更好。AI时代很多时候已经不是“你能不能做出来”,而是“你能不能把每一个detail讲清楚”。比如picture应该长什么样,output是什么结构,颜色怎么定义,color code是什么。你表达得越清晰,AI给你的结果就越接近你真正想要的东西。
我们自己的产品在和客户交流时,也基本全部用语音。从项目设定、调研开始,就是让AI扮演Consultant的角色去做顾问式访谈,先把内容采集得差不多,再整理、翻译成访谈提纲。
如果问这个场景下的语音交互有什么特别之处,我觉得一个很关键的点是:我们的用户非常picky,甚至会关注到每一个字的spacing这种细节。所以我们更希望客户直接用语音反馈,再把语音直接喂给系统,而不是让销售先采集一遍、再总结一遍、再传给产研。因为这种多次转手,信息失真会非常严重。
Qianze Zhang|Agora
我觉得大家现在很多时候进行的其实并不是真正的多模态互动,本质上还是把音频转成文本,最终交互的还是文本模态。
Thinking Machine Labs在尝试解决的,是怎么让多模态的沟通更加自然。如果你从事这个行业,你会发现大家在拼命用各种工程方式解决这些问题:怎么判断AI什么时候说完了,怎么判断AI想打断,怎么让AI可以主动发起沟通而不是被动等待。他们的模型本质上是想更好地解决这种双向问题,让AI在整个沟通过程中更加自然。
我觉得他们的模型是一个很好的开始,但里面要做的事情还很多。他们的核心想法是,把沟通的过程理解为一个持续的状态,而不是串行的点对点判断——每隔一定时间收集多模态信息,持续积累,再带入情绪类的判断,这样的沟通模式更接近真实的人与AI交互逻辑。
多模态是未来这件事应该没有悬念,只是我们还需要探索出更符合大家认知习惯的模式。人在日常沟通里有很多很难用文字表达的东西,这些场合里多模态已经非常有帮助了。但像人一样通过多模态沟通这件事,整体上取得了一些进展,但还需要相当多的工作。


Cynthia RTE开发者社区负责人
大家除了主力开发机之外,都在做一个特别的硬件小助手,可能是为了好玩,也可能为了让Agent更像一个人。Qianze和Ethan都做了,你们认为这个物理延伸的增值部分主要在哪里?未来会不会成为主流?距离人手一个AI硬件的日常,还有多远?
Qianze Zhang|Agora
对我来说主要是两个点。第一是便携——很多场合我不想带着沉重的电脑,有这样一个硬件,随时拿出来就可以交互,即使我不在家,也能随时跟家里的Hermes沟通。
手机是第二个点——美学,也就是私人定制。我希望它带来情绪价值。手机上做远程控制不special,就很普通,不会让人觉得特别。我在硬件上可能会希望它直接展示我的Token消耗量,把这些消耗变成"经验值",有我自己定制的形象。硬件有我喜欢的也有不喜欢的,但局限在手机上就没那么有趣了。
Ethan Zhang|Vm0.ai
我做那个M5Stack小助手的出发点,是希望Agent更像一个人。一个人如果只能在你打开电脑的时候才能跟你沟通,人味儿就差了一点。所以我们做了非常多不同的触达渠道,包括Telegram和iMessage,但它们还有一个问题——你依然要打开手机才能和Agent交流,而且手机在做别的事情时会占用这个通道。
我做硬件时花了很大心思去让它变得不一样。我设计了一个特点:不管在什么模式下,只要长按上面那个键,它一定立刻能开始通话。这是专用设计,让我可以信任它——不管什么时候,哪怕我不看屏幕,摸出来就可以说话了。"我们昨天发布了什么功能?""我们上个月在AWS上花了多少钱?"什么问题都可以问,一松手它就收到,过一会儿就告诉我答案。这种reliable的感觉,会让Agent更像一个真实存在的人。
我希望有一天,我们的Agent能真的出现在一个物理空间里。

现在AI不只是管理流程的工具,而是直接的生产工具,整体呈现出去中心化、多平台的趋势。这种买单者和使用界面的转移,和以往的To B销售有什么区别?会怎样影响大家的增长策略?
Jason Master|Concept
这件事我们非常有发言权,因为我们卖的不只是Google Cloud算力,也卖Google Workspace、Google Maps这类PaaS和SaaS产品。
所以现在的形势是:如果你做的是SaaS或AI Agent,市场活动甚至不需要特别针对To B,针对To C就够了。用户用好了回到公司推,老板听说了主动来找你买企业版,自上而下就变成了自下而上。
Ethan Zhang|Vm0.ai
从产品角度,我们面临一个很大的问题:我们做的所有事情,AI都能做。市场也在往分散方向走。我们的思路是做够垂直、够sharp的功能,让终端的小用户可以真正依赖它。
他们可以自己把这个东西用起来,不需要在复杂的组织里让管理员批准这批准那。我们希望用户注册完账号,可能30秒甚至15秒就能立即run起来,直接就是全功能Agent的状态。对终端用户最友好的体验是:足够轻便好用,有各种各样的渠道可以触达,不设置门槛。


Cynthia RTE开发者社区负责人
AI时代和SaaS时代相比,亚太和北美在付费意愿和商业习惯上有没有明显的不同?还是有一大部分是不变的?
Joven Lee|Cookiy AI
北美最大的问题不是订阅意愿,而是选择太多,GTM速度变成了核心挑战。东南亚的AI Awareness很高,但应用场景受限,除了新加坡和马来西亚,越南、泰国、菲律宾很多人还停留在用GPT做Chat Function和Deep Research。最大的机会在东南亚——怎么把北美验证过的idea带过去,这个时间窗口是存在的。
Jason Master|Concept
我们服务的主要是中国企业出海客户,以前卖SaaS给他们非常痛苦。
北美公司有一个很重要的观念:愿意花钱买一个已经验证过的经验。比如Salesforce,他们愿意让公司员工去适应它,因为它把CRM这件事做到了足够成熟,跟着走就行。这是北美的思维。中国出海客户不太一样,大家有自己的一套流程,想做什么就做什么,SaaS稍有不灵活就希望定制。以前这件事很难搞,能做的只是在生态里利用开放API尽量满足,最终是"尽量"而已。
但现在AI这个东西改变了局面,我卖一个Token给客户,他自己就可以捏很多东西,各种改形态。这是一个非常大的变化,中国技术能力强的出海客户反而在这波里特别如鱼得水。

这次SaaStr大会上,基本已经没有什么SaaS话题了,大家都在讨论AI和Agent。最后一个问题:在AI和Agent时代,传统SaaS哪些形态和模式会走向终结,哪些会长期存在?
Ethan Zhang|Vm0.ai
我们是个几个月的小团队,尽可能把市面上的SaaS都用了一遍,有些不再用了,有些反而坚持到现在。
最先被淘汰的,是所有的工作流处理SaaS——Linear、Zapier,通通被Agent取代了。坚挺到最后的,反而是两类工具。一类是获取内容和信息流进来的工具,比如做用户追踪的Loops活下来了;还有一类是信息输出类工具,比如Gamma。我们不需要工作流了,但我们需要一个人类可以阅读的Board。我们现在每天让Agent把事情用Gamma输出一个Presentation,作为跟人的交互界面,它活下来了。
现在大家用SaaS的方式,很多是注册进去、进Settings把API Key Copy出来就结束了,界面变得没那么重要。所以未来卖Seat(人头费)的模式会很难受,整个团队Share一个API Key花不了多少钱;但像Gamma这样按用量计费的模式可能还可以。
Qianze Zhang|Agora
以前那种用一套标品打很多不同厂商的逻辑,如果里面纯粹是一些交互和抽象,基本上就很难了。
现在SaaS比较重要的是数据资产,比如我个人的记忆、平时写的Notes。我用Superhuman或ChatGPT的时候,因为有这些历史资产在,做创作时需要额外输入的Prompt非常少,我会非常愿意继续用它——换一个工具意味着这些东西要全部重来,这就是数据粘性的问题。接下来SaaS的数据记忆这一块会比较重要。反而像Linear这种工具,如果上面没有我的核心数据,我其实不太愿意用它来做管理。没有沉淀下数据的那类SaaS,可能会比较危险。
Jason Master|Concept
我在SaaStr听了Anthropic一个产品经理的演讲,分享了内部40个销售怎么用Agent卖东西。有趣的一点是,他在各种工作流里其实串联了好几个SaaS——从聊天工具进来,传到CRM,再传到下一个。
Joven Lee|Cookiy AI
我们现在销售团队用Zoom、Figma这一堆SaaS,但从来没登录过它们的页面,都是把API Key抄出来打进Agent里就开始用了,从Lead Generation到整个后续流程全部自动化。
我们希望做出一个更擅长"提问"和"追问"的Agent。现在的AI很擅长回答问题,但它问问题的方式还是有点奇怪,不像人那样具备连续追问的能力。我们希望通过垂直行业,创建一个能主动提问的AI,然后把这个能力套到不同场景里直接跑起来。比如Jason如果明天想做个用研,直接调用、通过MCP就能把项目跑起来。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。