
本文来自微信公众号: 经观感知 ,作者:DongX
具身智能行业过去两年反复讲述一个故事。数字世界里的大模型不懂物理世界,因此需要重新训练一套属于机器人的基座模型。
GPT-6 Astra出现后,这个故事第一次遇到了强烈反问。
近日,一名开发者将一张包含容器和液体的图片交给Astra,要求它生成一个可以交互的仿真环境。Astra完成了场景搭建,识别出图中的物品和空间关系,甚至将液体颜色还原得十分接近。
过去,从单张图片或视频重建可交互场景,是Real2Sim领域需要专门研究的问题。英伟达SimFoundry等项目,也在尝试把真实环境转化为可供机器人训练和评测的数字空间。
Astra没有经过针对该场景的训练,仅凭一张图片就完成了初步还原。只不过,它没有模拟出液体之间的化学反应。
这个细节划出了一条清晰的能力边界。Astra知道容器和液体长什么样,也能把它们放进一个可以运行的程序,却未必知道两种液体混合后究竟会发生什么。
它暂时没有证明自己能够可靠地与物理世界交互,但已经表现出另一种可能。即使缺少大规模真机数据,通用多模态模型也可以认识物理世界中的绝大多数常见物品。
这对具身智能创业公司的影响,可能比一次机器人演示更大。
通用的“看懂”
9月3日,OpenAI发布GPT-6 Astra,重点展示了电脑操作、浏览、软件工程、科学推理和专业工作的能力。官方没有公布机器人控制、接触动力学和力觉操作方面的评测,也没有将其直接定义为面向物理世界的具身模型。
但一个模型是否亲自操作过机器人,与它是否认识物理世界中的物品,已经成为两个不同的问题。
杯子、抽屉、门把手、螺丝刀、药盒、货架、托盘和传送带,大量存在于互联网图片、视频、产品手册和论文中。通用多模态模型从这些数据里学到的,除了物品名称,还有外观、用途、空间关系和常见使用方式。
它没有拿过杯子,却看过无数人如何拿杯子;没有进入过工厂,却能够识别机械臂、流水线和物料箱;没有真正打开过抽屉,也知道把手通常位于哪里,抽屉应该朝哪个方向移动。
从这个角度看,GPT-6未必拥有完整的物理经验,却已经建立了一本覆盖面极广的“物理世界图鉴”。
Astra此次生成仿真环境,也不只是一次简单的图片识别。模型需要判断图片中有哪些物品,理解它们的位置关系,再调用代码和图形工具,把静态画面转化成一个可以交互的数字场景。这里同时包含视觉识别、空间理解、任务规划和程序生成。
这些能力过去也被一些具身智能公司写进基座模型的技术路线。如今,通用模型开始直接提供,而且参数规模、训练数据和迭代速度都远超多数创业公司。
这使得一个问题变得难以回避。如果一家公司的预训练数据仍以文本、图片和互联网视频为主,训练目标仍然集中于物体识别、场景理解和语言指令,它与头部通用多模态模型的差异究竟在哪里?
过去,机器人能够认出桌上的苹果,可以被当作一项技术能力。GPT-6之后,识别苹果本身越来越难成为壁垒。
参数规模也很难成为答案。创业公司几乎没有条件在通用数据和算力投入上追赶OpenAI等头部企业。继续从头训练一套大而全的模型,很可能只是以更高成本重复通用模型已经完成的工作。
GPT-6挤压的,正是这部分缺少独有数据的“基座模型故事”。
分工逻辑或重塑
认识物品,不等于能够可靠地操作物品。
机器人可以准确指出杯子的位置,也可以生成“伸手、抓取、抬起”的动作步骤。但真正执行时,夹爪需要多大力度,接触点偏移两毫米是否会滑落,杯中液体晃动后如何调整速度,不同材质会产生多大摩擦力,都需要来自真实世界的反馈。
Astra可以还原液体的颜色,却没有模拟出液体反应,原因也在这里。颜色主要是视觉信息,反应涉及材料属性、物理规律和因果变化。前者可以从海量图片中学习,后者需要更精确的数据和模型。
具身智能公司的机会仍然存在,只是价值正在向后移动。
通用模型可以承担物品识别、任务理解和步骤拆解,具身模型则需要回答动作发生之后,环境会如何变化。再往下,控制模型还要解决机械臂最后几厘米的精度、力控、时延和安全问题。
这意味着,创业公司继续进行模型预训练的意义,不再取决于参数规模,而取决于数据中有没有“动作”。
一段普通视频可以告诉模型,人类拿起了杯子;机器人数据还要记录机械臂从哪个方向接近、各个关节如何运动、夹爪施加了多少力、抓取是否成功,以及失败后如何恢复。视觉、触觉、力觉、关节状态和执行结果共同构成的交互数据,才是机器人真正进入物理世界的经验。
这类数据很难从公开互联网直接获得,也很难通过参数规模自动补齐。谁能让机器人持续进入真实场景,形成部署、执行、失败、修正和再训练的闭环,谁才可能拥有下一阶段的模型壁垒。
具身智能行业的分工也可能因此重写。
最上层的认知能力由GPT-6级别的通用模型提供,中间的动作预测由具身模型完成,底层控制则与具体本体和场景深度结合。
创业公司没有必要重新制造一个无所不知的大脑,更需要补上通用模型尚未掌握的身体经验。
如果一家公司的核心能力只是让机器人认识物品、理解语言,它与GPT-6之间的距离可能会越来越大。如果它积累了大量真机交互、力觉触觉和失败过程数据,GPT-6反而可以成为其上层认知能力的来源。
GPT-6尚未真正走进物理世界,却已经可以叫出其中大多数物品的名字。
它没有终结具身基座模型,只是把行业的起跑线向前推了一步。认识世界正在成为通用能力,如何安全、准确地改变世界,才是具身智能公司接下来需要证明的价值。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。