2026-08-24 18:11

这届机器人,开始从“秀肌肉”转向“拼脑子”

author_path 豹变 icon_path
头图

本文来自微信公众号: 豹变 ,作者:张经纬,编辑:邢昀,原文标题:《这届机器人,开始从「秀肌肉」转向「拼脑子」》


具身智能的尽头是大模型,大模型的尽头是数据采集。


又一轮机器人展示绝活的时候来了。


2026年8月19日到8月23日,世界机器人大会(WRC)在北京举行。相比以往,展示机器人各类实操应用的展台更多了。在看客眼中,这些展区像是一个个未来生活的切片:


一台人形机器人叠起了一摞T恤送进洗衣机,另一台正在模拟厨房里翻炒,还有机器人在搭积木、搬箱子……它们之中很多并不依靠“遥控器”或者固定的驱动程序,而是机器人“自己指挥自己”。


同样地,无论是论坛上的专家圆桌,还是展台上的广告语,也都频繁地提到“具身大模型”和“自主驱动”。


这些现象共同显示着一个新的行业变化:具身智能的厂商们,正在从“秀肌肉”转向“拼脑子”。


只会造“身体”,已经不够了


“现在只会做机器人本体已经拿不到融资了,需要同时做机器人大脑;只做本体和运动控制,大概率也做不过宇树、智元这些企业。”一位创投行业人士对《豹变》说。


这句话,几乎概括了今年具身智能行业最明显的转向。


过去两年,机器人公司最热衷展示的是“身体能力”:能不能走稳、能不能跑跳、会不会翻跟头、灵巧手能否抓住物品。运动控制和硬件本体,是彼时最容易被看见、也最容易拿到融资的方向。


从今年的WRC上能看到一些转向信号。


展会上,智平方机器人做咖啡,深朴智能机器人在洗衣服,星尘智能机器人在做饭,银河通用和蚂蚁灵波的机器人则在食品、药品零售区忙上忙下,加速进化机器人则上演了一场与人类小孩的点球大战……


这些动作未必更炫,但是在接近商业化真正要面对的场景,环境不标准,任务可能会变,机器人必须理解自己在做什么,并在出错时调整下一步动作。


厂商们的宣传用词也开始发生变化,其中最多的三个词是“具身大模型”“让机器人干活”和“自主驱动”。


这三个词有着深刻的内在联系。无论是商业、工业还是家庭场景,“让机器人干活”都意味着机器人需要在复杂的环境中知道自己在做什么,并独立地做出决策,而实现这一目标的技术手段就是具身大模型,也就是“机器人的大脑”。


以洗衣服为例,机器人洗衣服需要先把衣服送进洗衣机,关上洗衣机门并启动。在这个过程中,衣服如果有边缘露在外面,机器人就需要把衣服再往里挪一挪。


家庭并不是非常标准化的场景,机器人在执行任务过程中会频繁出现光线和空间感知上的变化,这意味着它需要随时调整自己的动作。如果使用固定的程序,机器人很容易因为各类干扰而无法很好地完成任务。


进一步说,机器人进入家庭,也不可能只做“洗衣服”这一件事情,需要会做多项家务,且能够有条不紊地推进这些家务的完成。


“知道自己的任务是什么(一致性/稳健性)”“做哪些动作能够完成任务(推理能力和精准动作)”“会做很多种家务(通用泛化能力)”都需要具身大模型作为“机器人大脑”发挥作用。因此,开发具身大模型是机器人商业化的必然。


对家庭、商业服务和复杂工业场景而言,这种能力比“能走”“能跳”更接近真正的门槛。


当然,资本市场早已嗅到这种必然性,风向也在发生变化。随着宇树的科创板敲钟,在一级市场环节,机器人本体及运动控制的融资竞争已接近尾声。


过去3年时间里,资本市场其实经历了关注机器人本体到关注机器人大脑的过程。2023年,国内具身项目以机器人本体和小脑(即运动控制)为主;2024年5月后专注本体的初创企业融资占比下降36.8%,到今年则完全倒向了具身大模型。


根据量子位的不完全统计,2026年上半年国内具身智能融资总额超430亿元,其中50.8%的资金投向以“大脑”为主的公司,另有18.5%的资金投向“大脑+本体”。


对于一家机器人公司而言,只做身体的空间已经越来越窄。下游需求的必然要求和融资的市场动向,共同导致行业竞争正在从谁能造出一具更灵活的身体,转向谁能让这具身体真正学会思考。


具身大模型的“护城河”


“具身大模型竞争现在本质上就是数据的竞争。”具身大模型开发者Alex对《豹变》说。


这个看法背后是对“ChatGPT时刻”再次出现的期望。所谓“ChatGPT时刻”,指的是大语言模型在数据量达到某个临界点后,突然“涌现”出训练时并未明确教授的能力,比如推理、举一反三、上下文学习等。


在具身智能领域,整个行业期待类似的“涌现”:当机器人交互数据积累到足够规模时,模型可能突然具备通用性甚至近似人类的物理直觉。


因此,对各家具身大模型厂商来说,谁先积累出足量、高质量的物理数据,谁的模型就有可能具备更强的泛化能力,从而在物理AI之争上抢先一步。


而数据则是大厂的强势领域。“现在的具身模型训练通常需要对外采购数据,大厂有资金上的优势。”Alex对《豹变》透露。


目前,蚂蚁灵波、字节跳动、京东以及小米纷纷都在推进自己的基座模型。蚂蚁灵波在2026年1月底发布并开源了空间感知模型、LingBot-VLA模型和LingBot-World模型,并在7月又各自发布了2.0版本;小米在2月12日发布并开源Xiaomi-Robotics-0,在7月发布了2.0版本;京东则在4月16日发布JoyAI-RA具身大模型。


这些模型除了应用在自己开发的机器人以外,也提供给一些本体小厂。在WRC展会上,不止一家厂商对《豹变》透露,自己的机器人用的是某家大厂的基座模型。对大厂来说,除了增加变现渠道,也能够增加数据来源,稳固自己的数据优势。


然而,现有的数据量远远无法满足应用的需求,如果说具身大模型的数据训练是一场马拉松,现在恐怕还没跑到第一个补水点。“自动驾驶实现需要10亿条数据,具身智能要想达到‘ChatGPT时刻’,保守估计需要100亿条,而现在行业里的体量大约是100万条。”展会上,某家大厂的工作人员对《豹变》说。


这也意味着,大厂的优势不是绝对的,具身大模型竞争还远远没看出谁能在下一个阶段领先。


因此,如何采集数据也就成了一个重要的问题。从方式上看,数据采集主要包括真机遥操作(人类操作机器人本体完成任务)、第一人称数据/便携UMI(人携带数据采集装备完成日常工作获得数据)和仿真数据这几种。


真机遥操太贵,模拟数据不可靠,第一人称数据成本可控且数据可靠,泛化性也有保证,是业内的主流数据采集方式。不过也有专家认为模拟数据因为不用考虑现实的时间流速,训练效率更高,未来随着拟真数据的可靠性提高,会成为主流的数据采集方式。


WRC展台上那些看似只是“让观众玩一玩”的互动,背后其实也是一场数据争夺。有厂商让观众戴上采集设备完成抓取、摆放等动作,或者通过遥操作让人类示范一段任务流程。对机器人公司来说,这些动作不只是展示,也是在为模型积累真实世界中的视觉、动作和环境反馈。


不过,机器人需要的不是单一场景里重复几百万次的抓取数据,而是覆盖不同物体、光线、空间、任务和突发情况的高质量数据。谁能更快建立起“采集、训练、部署、再采集”的闭环,谁才有可能把数据真正变成模型能力。


这也是具身大模型竞争最微妙的地方:数据正在成为新的护城河,却还不是胜负已定的答案。行业都在等待一次类似ChatGPT的能力跃迁,但没有人能确定,足够多的数据是否必然会带来那一刻。


“ChatGPT时刻”还是陷阱


由于ChatGPT时刻还未到来,具身智能产业端存在一种“壁垒分明”的状态。


“现在的具身开发中,基座模型是基座模型,主要管机器人的上半身(主要是手臂和灵巧手);运动控制则是运动控制,主要管机器人的腿和平衡。”ALex认为,运动控制和具身大模型的统一则要等到“ChatGPT时刻”的来临,到时候市场格局还会发生大的变化。


更大的问题是,ChatGPT时刻必然会来临吗?


由于数据的缺乏,目前还没有出现被证实可靠的“具身原生多模态大模型”,物理AI的技术路线呈现多元分化、尚未收敛的状态。


具身大模型的主流路线大致可分为两类:第一类是VLA(视觉-语言-动作)路线,早期通过端到端的方式将视觉感知和语言指令直接映射为动作,这严重依赖训练数据覆盖。


目前端到端VLA正在向快慢系统演进,参数规模较大的“慢系统”负责理解场景、解析指令、进行任务规划;参数规模较小的“快系统”负责实时输出具体的关节角度、手指力度等低层控制信号。


第二类是世界模型(World Model)路线,以李飞飞的Marble和Google的Genie为代表,强调先构建可推演的物理世界内部模型,再规划动作,具备更强的因果推理和泛化潜力。在本届展会上,标榜自主驱动的厂商大多采用这一路线。


VLA路线落地快、成本低,但泛化能力弱;世界模型路线更聪明,但算力耗费更高、反馈更慢。新的趋势是两者融合,但具体的融合方式、主导模型各家都有自己的判断。这些路线基于开发者的“技术信仰”,各有拥趸,行业远未形成统一共识。


技术路线之争没有定论,资本市场的情绪波动几乎不可避免。


从2023年的ChatGPT,到2025年春节的“机器人跳舞”,再到今年的Agent和机器人干活,市场上始终存在“AI和机器人像人类一样工作,从而解放人类”的美丽愿景,也经历了与之关联的市场情绪的变化。创投圈从FOMO(Fear of Missing Out,害怕错过)到冷却,再到FOMO新赛道,股票市场随着一次次Shocking而上涨下降。


对具身智能来说,距离真正“开奖”还有很长一段路。在这之前,可以预计还会经历多次乐观与悲观、狂热与恐惧的市场情绪循环。

本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。