原创
2026-08-19 12:25

拆透具身智能100万小时:真能喂出一个“聪明”机器人吗?|AI 100闭门会

author_path 虎嗅 AI 100 闭门会
头图

“普通道路跑100公里,对模型的信息增益,可能不如菜市场的一只塑料袋。”


具身智能最热的数字,是“百万小时”。


2026年以来,这个赛道融资持续升温,钱很热,但真正落地到了哪一步?


真机遥操作、第一人称视频、UMI、仿真、触觉数据轮番成为热点,行业不断出现十万小时、百万小时乃至一亿小时的规模判断,仿佛只要喂够数据,具身智能就会自然迎来自己的“GPT时刻”。


但当机器人真正进入城市、工厂和商服场景,问题没有这么简单:


数据被录下来,不等于能用于训练;进入训练,不等于能让模型获得新能力;模型在实验室变聪明,也不等于能在真实环境中稳定干活。


如果一批数据无法解释失败、覆盖长尾、迁移到不同本体,也不能在部署后持续回流,那么再庞大的规模,也可能只是一笔昂贵的成本。


在虎嗅AI100第八期闭门会中,我们邀请了:酷哇科技联合创始人、世界模型算法负责人彭湃,千寻智能预训练负责人郭俊良,光轮智能战略与生态副总裁廉和,刻行时空联合创始人、CTO郑宇靖,与虎嗅科技主笔陈伊凡,从真实机器人运营、具身基础模型、数据供应与数据基础设施四个视角,进行了一场深度对谈。


留下了5个硬核判断:


1.     所谓“百万小时”,暂时无法验证,也无法证伪——很多判断,只是从语言模型Token量换算来的。

2.     路线之争短期未必成立:数据量够大,VLA和World-Action Model未必有本质差距。

3.     “堆数据”要拆开看:视频预训练堆规模,真机后训练拼难例。

4.     人形未必先落地:轮式底盘加升降机构,可能就足以覆盖当前95%以上任务。

5.     上一代自动化是改造环境,让环境适应机器;这一代具身智能,要让机器适应人类社会。


我们把全场最有价值的共识、分歧与预判,整理成这篇真话实录。


一、普通道路跑100公里,可能不如菜市场的一只塑料袋


具身智能究竟需要多少数据,才能迎来自己的“GPT时刻”?


彭湃举了一个非常反常识的例子:


“在一条中午几乎没有行人的普通道路上连续运行100公里,对模型的信息增益可能接近零;早高峰菜市场路口的一只塑料袋,却可能暴露激光雷达与视觉路线对柔性障碍的不同判断。”


十万小时、百万小时、一亿小时,行业里存在各种判断。


彭湃认为,目前没有一个可以被验证的统一数字——很多判断来自过往经验,或者把机器人数据与语言模型的Token量进行换算,由于行业尚未到达那个阶段,这些数字也很难被证伪。


与其只谈小时,不如先看数据的有效信息密度,他拆成三个指标:


  1. 可解释性(一次失败能否归因到角度、力度还是策略)

  2. hard case密度(暴雨、人车混行等长尾情境占比)

  3. 跨本体跨场景复用性(决定数据是长期资产还是一次性成本)


郭俊良认为,讨论数据量之前,必须先定义具身模型的评价标准:


语言模型输出“看起来合理”的答案就能拿到不错分数,机器人动作偏差几毫米,最终轨迹就可能完全失控。


千寻更关注两组指标——zero-shot(进入新场景、新本体,不采新数据能否完成大部分任务)和few-shot(能否用更少的数据和训练计算快速掌握新技能)。


如果预训练规模不断增加,机器人每进一家新工厂仍要重新采集大量数据,这种Scaling Law的商业价值就非常有限。


廉和则提醒,不同客户的数据需求可能相差两到三个数量级:


做通用基模的客户与解决具体场景的客户完全不同,“把一件事干成”与“一个模型什么都能干”是两个门槛。


一个通用基模叠加少量现场数据和仿真数据,可能足以解决部分任务;

但要把成功率从60%推到99.9%,仍需要大量难例和反馈数据。


郑宇靖给出了一个相对谨慎的估计:限定在manipulation和VLA,行业可能至少需要十万到百万小时级别的数据。


他同时提醒,不能把“人类学一台新机器只要几小时”直接套到机器人身上——人学得快,是因为在二三十年的生活里早已完成了视觉、语言、触觉和动作的长期预训练。数字差异巨大,根本原因是大家定义的任务范围不同。


那么,到底什么时候算“堆够了”?


彭湃给出了干脆的答案:看经济学拐点——当新增数据带来的业务价值,低于数据的采集和处理成本,这个场景就暂时堆够了。


这个拐点因场景、因公司而异,但它比任何小时数都更接近商业真相。


二、数据金字塔变了:人类视频进入底层,真机难例站上塔尖


训练一个具身智能“大脑”,真机、人类视频和仿真数据应该怎么配?行业没有统一答案。


彭湃将当前结构概括为一座动态金字塔:


  • 底层是规模最大、跨本体能力更强的视频数据;

  • 中间是仿真和合成数据,用于扩展失败样本、重建极端情境;

  • 顶层是真机部署中产生的高价值难例。


“真正重要的不是把比例写死,而是让三层形成循环。”


他同时纠正了一个流行叙事:


第一人称视频并不是2025年才冒出来的新概念——早在视频理解时代,Something-Something等数据集和CLIP带来的图文对齐路线就已打下基础;


真正的变化是,近两年它快速进入了世界模型与具身基础模型的研发主航道。


回看行业演变:2018至2019年前后基本以真机为主;疫情后3D渲染、仿真和场景重建逐步成熟,难例可以在小时级被重建和扩展;再到今天,人类视频成为新的底层。


郭俊良也使用“数据金字塔”的概念,但千寻的分层有所不同:


  • 底层是互联网大规模人类数据;

  • 中间是UMI类设备采集的人类示范;

  • 最上层是真机数据与部署回流后用于强化学习和后训练的数据。


纯人类视频存在天然缺口——没有机器人末端与物理世界直接交互的动作和接触信息,观察分布也与机器人不同;UMI类设备用手持夹爪采集示范,与机器人末端相对同构,本体差异更小。


廉和从供应端看到了更直接的变化:2025年客户采购更多的是仿真和遥操作数据,2026年人类第一人称视频需求明显放大,金字塔底层开始变厚。


但仿真依然有它的市场价值——“egocentric data、仿真数据和UMI数据都有各自的缺口,未来长期会是一个mix。”


郑宇靖补充,不同发展阶段的公司需要的数据也不同:


刚起步的团队更需要基础、同构、能快速跑起Demo的数据;进入预训练和规模化阶段后,才会同时考虑获取难度、价格、覆盖度和模型路线。


具身数据不会有一套适用于所有公司的固定配方,需求始终取决于一件事:模型当前缺少什么能力。


三、录了8小时,真正有用的是多少?


采集时长,究竟等不等于有效数据?


廉和给出了一组数字:一名熟练采集员一天工作8到10小时,最终有效视频通常只有约三分之一到二分之一——准备时间、设备故障、错误动作和任务前后的无效片段都要被去掉。


这种折损不只发生在人类视频上,UMI、真机和仿真数据同样存在。


他认为必须区分“数据”和“信息”:模型真正需要的是additional information,重复或质量较差的数据即使体量很大,信息增量也可能接近零,甚至污染训练集。


如此庞大的数据不可能依赖人工逐条筛选。


彭湃提出,规模化数据需要强自动标注——让更大的VLM承担判别任务,过滤无关片段、识别动作类别与异常;纯机器筛选同样会有误差,因此仍需要human in the loop,人的精力应集中在模型最困惑、信息增益最高的样本上。


郭俊良将这个问题概括为:“我们追求的不只是证明Scaling Law存在,而是提高它的斜率。”


同一个动作采到一定规模后,后续数据几乎没有新增价值;标注结构还必须与模型架构匹配——如果视频预训练阶段学了丰富的场景、纹理和时序信息,后续却只配一句极简单的动作标签,模型就无法充分调用已经学到的知识。


数据效率的本质,是让每一批新增数据补上一块能力缺口。


四、触觉与仿真:真实世界里,有些数据根本采不到


机器人进入真实物理世界后,仅仅“看见”还不够:摩擦力、压力、滑落趋势和材料软硬,很多信息无法通过视频判断。


郑宇靖认为,触觉与力控数据最直接的挑战是采集设备——机器人要感知极细微的接触变化,遥操作设备也要给操作者相应反馈,但行业尚未形成成熟、标准化、可大规模复制的方案。


廉和将触觉数据从采集到被模型使用拆成三道关:


  • 传感器是否足够准确、长期使用会不会漂移;

  • 采集结果能否retarget到不同本体——人戴上传感手套的触觉与裸手不同,握住带传感器夹爪的感受也与机器人末端不同;

  • 模型能否大规模消费这些数据。


郭俊良认为,当前更大的瓶颈在设备,而不是模型能否加入触觉模态。


他提到FTP-1:约3000小时、跨多种传感器和本体的触觉操控数据,把触觉作为与视觉、语言并列的输入,设置独立的tactile expert与action expert协同——模型已经开始学习消费触觉数据,前提仍是设备可靠、信号稳定。


彭湃给出了真实部署中的工程折中:


环卫机器人必须让扫刷贴近路缘,才能清理缝隙中的落叶和烟头,但接触过度又会损坏扫盘。


酷哇用视觉观察扫刷受挤压的程度,用轻量模型估计接触状态,再通过后训练调整策略——不是终极解法,却是当前商业部署中可行的选择。


仿真解决的是另一个问题:

有些数据不是太贵,而是现实世界无法反复采集。


廉和举了极端案例:核电站不可能为了测试机器人停掉真实产线,只能先在高保真仿真中验证;机械臂内部应力分布等信息,现实传感器也很难低成本、全覆盖地采集。


他还提供了一个理解仿真价值的视角:语言是人类长期压缩形成的高密度表征,像素没有经过同等程度的精炼,而仿真中的物理量、公式与约束,反而是一种更高层的信息,能提供普通视频里没有的监督信号。


按廉和的总结:仿真不是唯一的数据来源,但会是支柱之一;而在部分极端场景里,它可能是唯一能够规模化获得的数据。


五、VLA还是世界模型?短期不是二选一


有公司押注VLA,例如Physical Intelligence的π系列;也有团队转向世界模型或world-action model。


未来会收敛为一个模型,还是长期多模型协作?


郭俊良认为这首先取决于行业阶段:任务简单、模型规模不大时,一个模型可能足够;数据和参数继续scale、同时还要兼顾端侧部署和推理时延时,多模型协作更现实。


他更看好slow-fast或agentic系统:低层模型负责抓取、旋转等明确技能,上层meta-agent负责任务拆解和调度。


更具冲击力的是千寻的实验观察:当数据量达到一定规模后,VLA与world-action model的效果未必存在本质差距——world-action model通常更依赖数据整理和增强,否则泛化同样受影响。今天就宣布某条路线成为终局,仍然太早。


廉和从数据视角给出“大脑可能收敛,小脑仍会分化”的判断。


他援引Rich Sutton《The Bitter Lesson》的规律:长期胜出的往往是能最高效利用计算和数据的通用方法;但低层模型要面对控制频率、时延、功耗和具体本体,必须与硬件深度绑定,不会只由Scaling Law决定。


“很多商业场景根本不需要one model rules them all。”廉和说。


郑宇靖举了一个行业实例:Google的Gemini Robotics就是分层系统——高层模型负责理解意图和规划,on-device VLA负责低时延执行,SLAM等现有能力被调用,而不是全部塞进同一个模型。


模型架构会直接决定数据供应商要记录什么:统一大模型时代,数据格式相对集中;分层agentic时代,数据格式必须跟着调用链一起变。


具身智能不是给传统机器外挂一个模型,而是让数据、模型、本体和控制系统共同闭环。


六、商业化落地:上一波改造环境,这一波适应社会


彭湃用城市环卫机器人的真实场景回答了“两波自动化有什么本质差别”:


上一代清洁机器人主要在商场、餐厅、园区等封闭环境运行,遇到障碍减速、绕行或停下即可;


现在进入辅道、人行道等开放空间后,机器人要面对外卖车、隔离杆、菜摊和各种临时障碍,在人流密集处清扫,还要判断是否会扬尘、扰民,必要时先喷水降尘、等行人通过再贴边清扫。


“上一波自动化更多是在改造环境,让环境适应机器;这一波具身智能,则要让机器通过数据和AI适应开放环境。”


落地先落在哪里?


廉和提醒,当前家庭数据需求很大,但家庭场景远没有形成商业闭环——家里有老人、孩子和宠物,短期落地难度远高于工业和商服场景,具身智能只能从corner case较少的小场景逐步走向复杂环境。


郭俊良建议先排除两个极端:一端是高度定制、传统自动化程度已经很高的工业场景,利润空间有限;另一端是高度自由的家庭场景,现阶段根本达不到商业要求。


更现实的是中间地带——有一定定制需求、仍需要泛化、人机交互相对稀疏的部分工业和商服场景。


人形是不是最佳形态?


郑宇靖观察到,2026年市场对whole-body control、复杂关节运动和灵巧手数据的需求明显增加,研究正在从平面移动走向三维物理交互;但轮式或特种构型在特定场景中效率更高,只有目标是general-purpose机器人时,人类构型才展现优势。


郭俊良更直接:

在当前落地场景里,我们尚未看到双足的必要性。轮式底盘加升降机构,可能就能覆盖95%以上任务。”


这与市场对人形机器人的高热形成鲜明反差:资本市场关注机器人是否“像人”,客户关注的却是任务能否稳定完成、设备是否容易维护、ROI是否成立。


郭俊良指出,To B商业化绕不开三个9、四个9级别的成功率,很难靠单一模型完成,更现实的是“模型+人工接管+数据回流+自动迭代”的系统——可以像自动驾驶一样用“一拖N”衡量:一名远程监督员能同时看护的机器人越多,ROI越可能成立。


客户最终购买的不是某种本体,也不是一个模型,而是一套能够稳定把事情做完的系统。


七、中美有代差吗?数据公司怎么活下来?


郭俊良的判断是,当前中美没有明显代差:


行业仍在早期,数据、评测和架构都在快速变化,大家都有机会;中国的突出优势是机器人供应链、工业积累和硬件人才,团队可以更快搭出本体并迭代。


但他紧接着给出了一个对数据公司并不轻松的判断:具身智能如果最终出现胜出者,大概率是一家全栈公司,或者至少必须非常深刻地理解本体。


模型从设计之初就要以终为始——部署在哪类本体、数据由什么设备采、传感器分布和控制周期如何变化,都会反过来影响训练。


郑宇靖提供了一个参照:Google可以直接利用Gemini已有的视觉、语言和推理能力延伸到具身任务,多数中国创业公司没有同等规模的基础模型资源,因此国内更现实的路径是分层组合,而不是一步到位做统一大模型。


那么,路线尚未收敛、全栈大厂环伺,数据公司该不该扩产、怎么下注?


廉和的回答是:“我们的指南针始终是数据是否包含additional information,能否提升下游模型。模型架构变化后,格式可能需要重新处理,但真正有价值的信息不会因此消失。”


光轮的方法,是尽可能生产scalable、与特定本体解耦的数据;同时数据公司不能只交文件,而要对模型训练乃至最终部署的结果负责——越靠近一线模型团队,越能理解下一阶段真正需要什么数据。


八、数据公司的护城河,不是采得多,而是让失败回得来


郑宇靖认为,数据公司最基础的两个指标是成本和数据质量,两者结合就是“能否用合适的成本获得更多有效信息”。


核心能力不只是组织更多采集员、交付更多文件,而是把采集、运营、交付和模型使用端串成工程闭环,持续获得反馈、迭代流程。


数据“完整性”也有两个尺度:


微观上,一条数据是否包含任务所需的观察、动作、语义、本体状态和上下文;


宏观上,数据集是否覆盖需求方定义的任务范围。


随着模型走向分层调用与agentic系统,数据还要记录为什么执行、调用了什么工具、在哪一步失败、如何恢复——数据需要从trajectory(轨迹)升级为experience(交互经验):


记录机器人“做了什么”只能训练模仿,记录它”为什么这样做、在哪里失败、如何恢复”,才可能训练出处理长程任务的系统。


机器人更换本体后,历史数据是不是全部作废?


郭俊良认为这是典型的cross-embodiment问题:更换夹爪、调整传感器分布后,旧数据需要重新对齐,但不等于完全失效——通过跨本体训练、表示对齐和少量新数据适配,历史数据仍可复用。


这也决定了数据公司的长期价值:采集与特定本体解耦、可迁移的数据,而不是为每一款新机器人从零开始。


四位嘉宾最后不约而同谈到同一个词:infra。


彭湃最遗憾的是没有更早把数据基础设施提到足够高的优先级:


早期先把样板跑通、解决接管和急停等运营问题,后来才更清楚地意识到,具身难例是真金白银,不能依靠故意制造事故来获得——数据infra和数据闭环,必须跑在业务扩张之前。


郭俊良同样认为,现在谈“押错技术路线的遗憾”还太早,行业尚未出现像GPT-3那样横扫一切的范式,更确定的缺失仍是data infra和training infra。


廉和强调,从仿真资产、异地采集到模型训练和工厂部署,很难由一家公司包办,产业最终需要专业分工。


郑宇靖的反思恰好相反:团队早期重视infra和工具,却较晚把注意力放到数据质量和模型反馈上——工程系统与高质量数据,缺任何一边都无法形成闭环。


数据本身不是飞轮。只有采集、筛选、训练、部署和失败回流真正转起来,数据才会成为飞轮。


结语:100万小时,仍然只是起点


两个多小时的讨论,四位嘉宾最终达成了一项共识:具身智能的数据竞争,正在从规模竞争转向效率竞争。


人类视频提供规模,真机难例提供价值,仿真覆盖无法采集、无法反复试错的场景,触觉补上视觉看不见的物理信息——没有任何一种能单独解决所有问题。


百万小时”也不能直接回答模型是否足够聪明。


真正有效的指标,是机器人换一个场景后还要补多少数据,面对失败能否解释原因,更换本体后历史经验是否仍能复用——以及最朴素的一条:新增数据带来的业务价值,是否还盖得过采集它的成本。


下一阶段的分水岭,不是谁先攒够100万小时数据,而是谁先建立持续学习闭环,把真实世界里昂贵、偶发的失败,转化为让模型下一次不再重犯的经验。



嘉宾介绍

彭湃:酷哇科技联合创始人、世界模型算法负责人

郭俊良:千寻智能预训练负责人。

廉和:光轮智能战略与生态副总裁。

郑宇靖:刻行时空联合创始人、CTO。

主持人:陈伊凡,虎嗅科技主笔。


本文基于虎嗅AI100第八期具身智能数据专场直播实录整理,观点来自嘉宾现场发言。


扫码加入虎嗅AI100闭门会社群

参与系列直播


本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。