2026-07-23 18:52

对话极佳视界王啸峰:机器人不缺新模型,数据和评测才是关键

author_path 42号电波©
头图

本文来自微信公众号: 42号电波 ,作者:小波,编辑:James


Maker的名字取自「make everything」,对这家以世界模型为技术起点的公司而言,机器人本体是主营业务之一。王啸峰更在意的是,本体进到工厂、人才公寓和未来的家庭后,能把实验室里难以获得的失败样本、用户反馈和真实交互数据带回来。模型、本体与场景由此变成一个相互校正的闭环。


这种对「物理世界真实交互」的执着,也解释了他对当前具身智能竞争格局的判断。当行业还在为模型架构的路线争论不休时,他看到了水面之下的暗礁:模型架构固然会继续演进,但现阶段更大的卡点,其实是高质量数据和标准化的评测体系(Benchmark)。


极佳视界刚发布的GigaWorld-Policy-0.5选择世界-动作模型(World Action Model,WAM)路线:训练时把未来视觉变化和动作一起学习,推理时主要输出动作,以降低闭环控制的计算开销。王啸峰并不认为这意味着语言能力将被抛弃;在他设想的长程任务里,语言负责拆解目标,世界-动作模型负责把其中的精细操作做稳、做得更能适应变化。


在模型路线的分野、数据的有效性获取,以及机器人走向真实家庭的商业化路径上,极佳视界有着自己的一套底层逻辑。在这个具身智能从「实验室Demo」走向「真实世界泛化」的关键节点,我们在2026世界人工智能大会的现场,与极佳视界算法合伙人王啸峰聊了聊。以下是42号电波与王啸峰的对话,略经编辑。


WAM和VLA不是非此即彼


问:这次为什么把GigaWorld-Policy-0.5定义为世界-动作模型?


王啸峰:我们在2023年就开始做世界模型,积累主要在这一侧。我们想做世界-动作模型,是希望把大量互联网视频中的知识更有效地迁移到动作学习上。


一句语言指令对应的动作并不总是一一对应。比如「把笔拿起来」,中间有很多没有说出的状态与动作;但把画面、视频和动作放在一起时,对应关系会更直接。对于策略模型,我们认为视频和动作成对学习,会是更高效的数据学习方式。


VLA(视觉-语言-动作模型)从语言模型发展而来,文本跟随是它的优势。我们的判断是,面对多样场景和零样本、少样本操作时,视频知识向动作知识的迁移更关键。当然,这不是说世界-动作模型不能接语言:它可以接入语言模态,也可以外挂VLA或Agent模型。


问:所以你们认定WAM会替代VLA?


王啸峰:从我们的模型演进看,世界模型先在数据侧发挥作用:用世界模型生成的数据加上真实数据训练具身模型。之后,我们把世界模型和VLA在架构上结合;再往后,做了以世界-动作模型为主的策略模型。


但应用里不必把两条路线绝对对立。像药房这种需要和用户交互的场景,语言仍然重要。不过,语言交互只是机器人能力的一部分;它还要在不同药房、不同摆放和不同干扰下完成泛化操作。我们的倾向是:用世界-动作模型承担这部分对物理环境的学习,再把语言能力接进来。


问:长程任务是不是仍然更适合VLA?


王啸峰:我们会把长程任务拆开。最上层是语言:把很长的目标拆成第一步、第二步、第三步。到每一个子步骤里,真正需要精细机械操作时,希望这个子步骤的泛化足够好,这时由世界-动作模型来做。


换句话说,大的任务规划可以依赖语言;中程任务和具体操作,需要更强的物理交互能力。我们不把它理解成只能二选一,而是不同层级各自做更合适的事。


问:新模型为什么将视频和动作拆成两个「专家」?


王啸峰:第一代时,我们曾经想用一个统一模型,同时做视频预测和动作预测,这是我们认为更接近终局的形态。但在具身数据仍然不够多的阶段,从零开始训练一个统一模型的效率不够高。


现在,视频数据相对更丰富,可以由视频专家单独训练;动作数据则由动作专家处理。等动作数据积累到足够的量级,我们仍然认为模型会向更统一的形态靠近。


数据的价值,不只取决于采了多少


问:你们现在怎样采集具身数据?


王啸峰:我们把数据看成一个金字塔。底层是互联网视频和视觉问答等数据;往上一层是世界模型生成的数据,它不依赖机器人本体和真实场景,生成效率很高;第三层是传统仿真数据,第四层是机器人本体采集的数据、第一视角的Ego数据。最后一个在金字塔尖的是在真实场景中交互得到的rollout数据。


这些数据都会用,但作用不同。真实交互得到的rollout数据会用于强化学习等环节;长期看,Ego数据可能有更大的价值,因为它扩展得更快,采集成本也更可控。物理交互层面最基础的仍是视频—动作对。


问:你判断家庭机器人还需要多少数据?


王啸峰:我的判断是,1,000万小时高质量数据可能够用,前提是「高质量」。它要覆盖足够多样的场景,标注要准确,动作要精确;有些机器人数据还要能区分好坏、给出价值判断。


这不是单纯把时长相加。数据如果不够多样,或者没有把失败、接触和动作细节记录下来,量再大也很难让模型在真实家庭里工作。现在的数据远没有到「不再需要家庭数据」的程度:如果真的不需要了,意味着机器人已经可以在家庭里稳定运行了,但我们认为还没有到这个阶段。


问:具身模型现在最大的瓶颈是模型,还是数据?


王啸峰:是数据加评测。模型还没有完全收敛,但我不认为它是当前最大的卡点。世界-动作模型的能力,也还没有在足够好的数据和评测体系上被充分发挥出来。


如果这两块没有建立起来,大家在模型架构上反复小改,未必是最有效的方向。高质量数据是基础;模型基础设施并不是最大的难题,语言模型已经把很多相关工程问题跑通了。第三件必须补齐的事,是高效、标准、可复用的benchmark(评测基准)。


问:为什么评测会成为这么重要的事?


王啸峰:以前最直接的办法是成功率:做100次,成功多少次。再细一些,就要分析失败发生在哪一步,并给每个步骤打分。


但如果不同团队用不同的任务、不同的成功定义和不同的打分方式,榜单的排名没有可比性,算法就很难高效迭代。一个标准化、高效、可复用、成本又低的评测体系,是行业的大刚需;没有它,前面算法得到的结论有时甚至会是错的。


我们内部把benchmark团队和算法研发团队分开。每一版模型训练完后,交给独立团队评测;他们用自动化方法构造任务矩阵、评估每一个步骤的得分,尽量减少人工打分带来的主观波动。


问:评测怎样减少真机试错的成本?


王啸峰:真机评测要和算法团队隔离,防止模型「记住题目」。同时,世界模型和仿真可以先做前序关卡:先过这些关卡,再上真机。这样可以降低真机使用率、加快迭代;真机结果又会反馈回来,继续优化世界模型。


行业层面的评测也要把零样本分得更清楚:动作零样本、场景零样本等不同问题不能混在一起。语言模型能快速迭代,数据和benchmark都做得很扎实;具身智能也需要同样的基础设施。


为什么要自己做本体


问:你们的核心是模型,为什么还要做机器人本体?


王啸峰:具身智能现在还不像自动驾驶那样,本体已经没有太多机会。这个阶段做本体,可以先定义一些标准,再让模型和本体深度绑定。模型好不好,最终必须在本体上验证;如果一直在别人的本体上验证,后面更换平台或供应链变化都会带来风险。


更重要的是,自己的本体进入真实场景后,能回流一手数据。它告诉我们需要什么数据、模型该怎么迭代、本体又该怎么迭代。这些是互相耦合、相互促进的。


问:Maker H01为什么叫Maker?「机器人造机器人」在验证什么?


王啸峰:我们希望它能make everything。现阶段让机器人参与制造机器人的零件,是检验机器人进工厂能力的一个好场景。


Maker H01目前会做物体搬运、上下料和精细装配。现场可以看到两台机器人配合:一台完成精细装配,把装好的部件放进周转箱;另一台负责把零散零件送到工位,形成一个闭环。它不是泛泛的展示,关键是要把对物体、工序和动作精度的要求放进实际生产流程里检验。


问:家庭端为什么先落在武汉的人才公寓,而不是直接进入普通家庭?


王啸峰:家庭有两个相对适合先验证的泛化场景:酒店、公寓等。它们比普通家庭更标准化,但仍然比实验室复杂,适合在现阶段检验算法能力。


与光谷之寓合作有两个目的。第一,机器人进入后能获得真实使用者的反馈;第二,哪里做得不够好,就在对应场景采集一手数据。一直在实验室采数据,泛化能力一定有限。我们希望它先在真实环境里跑起来,而不是只在实验室里看起来能做。


问:机器人在人才公寓里已经能做什么?


王啸峰:我们向媒体展示过清洗和收取衣物、整理卫生间、折叠衣物以及简单烹饪。比如番茄炒蛋,它可以切番茄、把番茄放进锅里、搅拌并倒入鸡蛋、出锅后端上桌。这样的长程任务,目前可以完成。


但我们并不把人才公寓里的服务直接等同于「家庭用户已经在使用」。它的价值首先是让机器人在真实场景中接受反馈和测试。至于具体的采购、租赁或收费方式,需要由商务团队以正式口径说明。


家庭机器人真正可卖的标准


问:你期待家庭机器人到什么状态,才算真正run起来?


王啸峰:不是只为某些公寓、某些酒店做特定化,也不是只完成一段演示。我期待的是,消费者愿意买回家,它能真正帮人解决一部分家务。


我可以接受它刚到家时需要教,甚至前两天不能干活;但教过以后,它应该越来越好,在自己的家庭里把事情做好。商业化不只是能交付一台机器,还要有用户愿意为它持续解决的问题付费。


问:为什么今天还做不到像汽车一样开机即用?


王啸峰:目前家庭场景里的模型还需要算法研发人员做针对性优化和微调。理想状态是把模型标准化、产品化,告诉交付方调哪些参数就能适配哪些场景;但前提是模型能力足够强。模型不够强,产品化就无从谈起。


家庭还涉及避障、人与宠物共处、隐私和安全等问题。相关标准也还在形成。未来可能先有内测用户,再逐步扩大到更开放的测试和使用,但这不能只靠一段流畅的Demo来证明。


问:你们给模型能力提升留出的时间表是怎样的?


王啸峰:我们接下来一到两年的重点,是把模型的基础能力再往上推一个台阶。基础能力还没有接近语言模型的泛化程度时,如果过早扎进单一垂直场景,会消耗很多交付精力,也可能把模型迭代落下。


这不意味着不做场景。工业和家庭场景已经在推进,目的就是让它们先运行起来,收集真实用户反馈与需要修复的数据。等能力更强后,再把它做进更多工业和家庭场景。


问:Maker H01的交付进展如何?


王啸峰:公司的公开信息中披露,已有超100台Maker H01完成下线和交付;今年千台交付是公司的目标。我们会在工业和家庭两个方向都认真做交付,但目标不等于已经实现,最终还要看产品稳定性、客户验收和场景适配。

本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。