
本文来自微信公众号: 智讯智库 ,作者:陈宥文
从上市即巅峰,到股价近乎腰斩——可能只用“12.41秒”[1]。
8月22日,第二届世界人形机器人运动会百米大型组预赛,宇树跑出12.41秒的成绩,小组垫底[1]——一年前,这项赛事的400米冠军,正是宇树。就在此前两天,王兴兴刚在WRC主论坛上重申了他对具身智能“ChatGPT时刻”的预判:快则2到3年、慢则5到10年——届时,机器人的泛化能力将使其在80%的陌生场景中,通过语音或文字指令完成约80%的任务[2]。
愿景很大,但赛场表现的巨大落差,迅速将宇树科技推上了资本市场和公众舆论的风口浪尖[3]——“具身智能骗局论”再度升温:宇树还配不配“领衔者”的位置?大模型驱动的技术路线到底走不走得通?具身智能的“ChatGPT时刻”究竟会不会来?
层层追问,最终落在一个词上——“ChatGPT时刻”。
人们翘首以盼的,或许是一个划时代的机器人横空出世,或许是一个带着英雄光环、能一锤定音整个具身智能行业未来的“中国马斯克”。
但,事实真会如此吗?
本文要点速览
定义偏差:所谓“ChatGPT时刻”,本质是能力涌现、成本骤降、病毒式传播三条曲线同时触达阈值的共振产物。具身智能的物理交互属性决定其难度远高于大语言模型,直接套用C端一夜爆红的叙事属于根本性范畴误判。
发展现状:具身智能的能力、成本和扩散三条曲线分别卡在不同节点。其中,能力卡在跨场景泛化与安全执行关,固定基准普遍逼近97%-99%,换场景后指标明显下滑,如RoboCasa成功率53.9%、VLABench得分47.4;成本卡在投入转化率关,合成数据与人类视频大幅拉低练习成本,但真机校准与上岗验证仍是不可移除的刚性锚点,全行业融资近千亿,远快于研发投入和验证转化速度;扩散卡在跨客户复制关,上半年出货量同比增长近300%,但生产级场景占比不足两成,可跨厂复制的标准化任务包尚未形成。
“时刻”形态:具身智能的“ChatGPT时刻”不会是单点爆发。慢力量(技术、成本、扩散三条曲线)决定真实进度,尽管推进缓慢且刚性,却是这一时刻的真正决定因素;快力量(资本定价、公众情绪、人才潮汐)制造短期波动与时刻幻觉,但不决定真实节点。产业发展的节点会分层落地——先形成开发者层的基座模型标准,再出现客户层的可复制任务包,最后才是公众层面的通用途径,整体是渐进式渗透而非一夜奇观。
风险提示:本文为产业阶段性观察分析,不构成针对任何具体标的的任何投资建议。具身智能整体处于技术验证向规模化落地过渡的早期阶段,跨场景泛化能力、规模化交付经济性、可复制商用扩散的成熟度可能不及市场预期;同时全球技术迭代、本体产能与场景落地均在持续推进,长期产业成长逻辑具备支撑,实际演进节奏需依据核心技术突破、成本曲线变化、行业标准落地及下游需求释放等多重变量综合判断。建议理性看待产业周期与技术规律,注意规避基于单一事件或局部数据的极端判断风险。
9月3日,OpenAI发布GPT‑6 Astra,将多模态理解、抽象推理与电脑操作进一步融入统一模型,并在ARC‑AGI‑3测试中取得99.9%的成绩。如果一次能力跃升就足以构成“ChatGPT时刻”,那么GPT‑6理应已经带来第二个这样的时刻——但这并没有发生。这恰好说明,只有当能力同时转化为足够低的使用成本、足够普适的产品接口,并触发大规模采用与认知同步,技术里程碑才会成为产业时刻。数字世界尚且如此,在本体、部署与安全成本更重的物理世界,具身智能更难以凭一次模型发布完成三条曲线的合取[4]。
被误用的“ChatGPT时刻”
2022年11月ChatGPT的发布,重新定义了什么叫技术的“时刻”——48小时内全球讨论刷屏,约5天用户破百万[5],两个月后月活过亿,成为史上增长最快的消费级AI应用[6]——“取代论”“奇点论”“泡沫论”随之轮番上演。
然而,构建这个“ChatGPT时刻”的底层架构,并非OpenAI首创。2017年诞生的Transformer架构,摒弃了以RNN、GRU为代表的循环神经网络逐词递归的计算范式,转而以自注意力机制对整段序列做并行建模,再通过位置编码补入序列顺序信息[7]。GPT系列沿用这一架构开展大规模自监督预训练,再经指令微调、RLHF(基于人类反馈的强化学习)两步对齐,其作为自回归语言模型的核心训练目标始终是:给定上文,预测下一个词元(Token)。也正是这条技术路径,第一次让数亿普通人直观感受到:机器的对话自然度已经逼近真人。
从架构论文正式发表,到ChatGPT之作为产品真正击穿公众认知,隔了整整五年。
事实上,技术史上的“时刻”,也从来不是单一技术突破的自然结果,而是技术本身跨过奇点级成熟度,同时产业与公众集体确认“它来了”——“时间的刻度”本身就是一种社会认知的产物。由此看来,如果给“ChatGPT时刻”一个精确的标准,那可能就是三条曲线同时触及阈值:①能力涌现、②边际成本骤降、③病毒式传播扩散。三者是合取关系,缺一不可——GPT-3早在2020年6月就已具备粗糙可用的能力,可直到两年半后,三条曲线才完成共振[8]。
如果用这把尺子衡量具身智能(本文主要围绕人形机器人),王兴兴在WRC上提出的“双80%”是目前行业传播最广的量化标准之一,但它其实也只覆盖了“能力涌现”这一条曲线,边际成本与传播扩散两个维度仍在视野之外。
可即便只看能力这一条曲线,具身智能的难度也比ChatGPT所代表的大语言模型高出整整一个量级——概言之,一个是词元,一个是多维力矩:语言模型预测下一个词,离散、容错,说错了重生成即可;机器人输出每一个力矩,连续、零容错,错一个就摔碎杯子,代价是真实的物料、时间与安全风险。前者每秒输出几个词,后者每秒输出几十到上百次动作,频率与容错率差着几个数量级。
拆解来看,语言模型的任务本质上只有一个动作:预测下一个词元。具身智能则要跑通感知、理解、拆解、规划、执行的五步闭环,技术栈从VLM、VLN、VLA一路延伸到世界动作模型,每一级都要新增一个此前不存在的能力模块。
幸运的是,具身智能的技术推进,可以直接继承大语言模型五年的技术积淀——同一个Transformer骨架,同一条scaling路线。主流VLA架构更是把动作离散成词元,让机器人像“说”一句话一样输出动作序列——动作即语言,机器人控制就此转化为序列生成问题。除此之外,自动驾驶趟出的真机采集方法论、快速成熟的本体制造产能,也分别为数据回流和物理落地提供了基础——当然,这几者有一个共同点:没有一件是这四年里从零突破的。具身智能过去四年的加速,本质上依托的是人类上一个产业周期攒下的存量资产——模型、数据、本体三条线咬合转动,才是真正的加速飞轮。
也正因此,过去四年具身智能以极度压缩的节奏走完了语言模型从Transformer到ChatGPT的五年路径:2022年SayCan与RT-1范式奠基[9][10],2023年RT-2为VLA正名[11],2024年π0与OpenVLA完成开源与数据基建[12][13],2025年进入模型元年,2026年迎来路线融合与考场迁移。(“四年走完五年”是结构类比,非严格定量结论。)
这条时间线的首尾,刚好框定了一场贯穿四年的架构路线之争:2022年SayCan走分层路线(大模型思考、小模型执行),RT-1走端到端路线(单网络直接输出动作),分歧根源是慢速推理与高速控制的时延差着两三个数量级,硬塞进同一网络必然互相拖累。到2026年,答案已经不是简单的路线纷争抑或合流,而是多时间尺度的混合——分层没有消失,而是向更细的时间尺度下沉。路线之争尚未终结,但行业已进入更具当下实操意义的“把多条路焊在一起”的融合阶段,路线争议本身正在被更复杂的系统工程问题收编。
但是,技术演进可以压缩,能力、成本、扩散三条曲线的合取却无法单方面实现压缩——我们逐条来算。
三条曲线,逐条算账
事实上,具身智能的三条曲线卡在三个不同位置:能力卡在跨场景,成本卡在真机闭环,扩散卡在跨客户复制。
先看能力
同一届运动会闭幕时,人形机器人百米纪录已推至8.64秒[14],原地跳高达到3.40米[15],首次在专项指标上跑赢、跳赢人类。但冠军冲线后撞上防护设施的细节,恰好暴露了另一半问题:百米成绩只计算到达的速度,却并不计算减速、停稳与恢复的完整动作链[14]。
换言之,人形机器人能把单一封闭目标优化到超越人类极限,却还没把任务完成、安全执行、异常恢复稳定地压进同一套系统。这场比赛照出的本质,是专项能力与系统能力的发展不同步——运动控制(小脑)已经跨过“能到达”的门槛,操作泛化(大脑)仍停留在“能不能完成”的初级阶段——但市场习惯拿第一张成绩单,给整个系统定价。
操作能力的完整可用性,归根结底要看五项指标:看懂环境、听懂指令、规划步骤、执行动作,以及换场景后持续安全稳定运行。最容易被高分掩盖的,恰恰是最后两项。
在固定测试基准中,头部VLA的表现已逼近满分。OpenVLA-OFT在LIBERO四套任务上平均成功率97.1%[16],智元GO-2达98.5%[17],2026年的Being-H0.5更是达到98.9%[18]。不同团队、不同架构的模型先后进入97%~99%区间,说明固定任务场景下的性能已趋于饱和。在既定本体、既定任务、既定数据分布的边界内,VLA已经能把一套动作练得非常熟。
但能力曲线真正的考验,在于换了考卷之后成绩不跳水。
但现实是,考场一换,分数立刻分层。GO-2进入加入环境扰动的LIBERO-Plus后,零样本成功率86.6%;面对陌生物体类别、更复杂操作关系的VLABench,得分仅47.4[17]。Being-H0.5在LIBERO拿到98.9%,进入包含陌生物体、陌生厨房布局的RoboCasa后,成功率落到53.9%[18]。这些测试口径存在差异,不能直接横向对比,但都指向同一个结论:熟悉场景里接近“会做”,一旦环境、物体、指令、任务长度同时变化,能力还无法完整迁移。
再把考验从“环境变化”推进到“任务逻辑变化”,断点就更加明显了。
2026年4月的BeTTER预印本做了更极端的测试:π0.5、GR00T N1.6、Being-H0.5三款模型分别学会“A→B”和“A→C”两套动作序列后,被要求重组为“B→C”,最终成功率分别只剩5%、15%和0%,较原序列下降42.5~52.5个百分点;真机实验也复现了同类失效[19]。动作都会,顺序一换,能力几乎归零。
VLA已经积累了丰富的“技能库存”,但调用技能、重排技能、根据任务状态动态调整技能,完全是另一个层面能力。会执行,和会在陌生条件下组织执行,中间隔着一层真正的具身推理能力。
产业端的数据,标出了同一道断层的另一端。
据优必选2026年中期业绩报告披露,其VLA在工业上下料任务链的实验室环境中成功率为75%[20]。这个数据和LIBERO的近满分放在一起,恰好标定了能力曲线的两端:固定基准测的是“能不能学会动作”,产业场景还要叠加动态来料、连续工序、真机控制的复杂度。75%这个数字,说明VLA已经摸到工业任务链的门槛,但远没到可以只谈效率、不谈失败的阶段。
而“做完任务”,仍不是物理世界的最终及格线。
2026年的SafeVLA-Bench显示,一些任务成功率较高的桌面操作策略,仍有13%~15%属于“完成了,但过程不安全”;在RoboCasa厨房任务中,36%~56%的成功轨迹至少违反一项安全约束[21]。成功率只回答“有没有到终点”,而安全测试还要继续追问,沿途有没有撞人、碰物、损坏东西?有没有执行本应拒绝的危险指令?否则,人形机器人无法基于现有社会制度与人有机共存。
另外值得一提的是,多模态模型强,和机器人动作不稳定,二者完全可以同时成立。多模态解决的是看到、听到、摸到的问题,而动作模型则更要据此把动作做对——知道杯子该抓哪里,和控制机械臂避开旁边的人手、保持合适力度、平稳放下杯子,是两道完全不同的题。
验证体系也在追赶。2026年6月1日实施的YD/T 6770—2026,已将仿真与真实环境纳入同一框架,覆盖环境设置、任务库、测试流程和“感知—决策—执行”全链条指标[22]。
所以说,能力曲线真正的拐点,在于同一套系统换物体、换布局、换指令、换任务顺序后,仍然能安全、稳定、反复地完成任务,而不再仅仅是第N个接近满分的固定任务成绩。
再看成本
这笔账首先要换计量单位——因为具身智能真正要降的,不只是单台产品售价,也不只是单条轨迹的生成成本,而是新增一个可稳定交付任务所需的全链条成本——数据采集、模型适配、真机验证、现场集成、后续运维,一环都不能少。
DROID给出了目前最具代表性的真实数据的样本框架:为产出7.6万条成功示教轨迹、350小时交互数据,项目动用18台机器人、50名采集者、13家机构,跨三大洲,12个月覆盖564个场景、84类任务[23]。每一段有效数据的背后,都要有人工操作、机器运行、场景布置、相机校准、物体复位、结果核验。语言数据可以从互联网批量爬取,动作数据首先要在物理世界里真实发生——复杂的成本要素聚集于此,
现状是,这条成本曲线已经开始弯折。
英伟达曾在11小时内生成78万条合成轨迹,相当于6500小时人工示教数据[24];2026年6月的RoboDream给出了更可控的对照:采集50条传统真机遥操作轨迹约需2小时,无实物遥操作仅需55分钟,速度提升约2.2倍;两者训练出的策略平均成功率分别为36.3%和32.5%,生成数据与少量真机数据混合后,平均成功率进一步提升至62.5%[25]。
但同一实验也证明另一个现实:数据多≠数据好用。把100条异域场景的DROID原始轨迹直接搬到目标环境,四项任务平均成功率为0%;经目标场景重生成并与真机数据混合后,才回升到62.5%[25]。生成模型可以廉价复制动作,却无法自动消除本体、视角、物体、接触关系带来的域差异。
当前更核心的变化,是通用能力不再需要全靠机器人亲自跑出来。DYNA-2(美国具身智能公司Dyna Robotics于2026年8月发布的新一代机器人基础模型——官方定义为世界动作模型(World-Action Model,WAM))披露,用超过100万小时第一视角人类视频做预训练,预训练阶段可以不依赖机器人动作数据[26]。
9月1日,另一条降本路径再进一步。李飞飞创办的World Labs发布新一代多模态世界模型Atlas,支持将文本、图像、视频、相机位姿、3D深度纳入统一空间上下文,基于少量真实影像即可完成三维场景重建,并生成机器人沿不同路径运动时的视角数据。其核心价值在于优化世界建模、空间重建与Real-to-Sim(真实到仿真)转换流程,可用于机器人训练与规划工作——过去需要逐项扫描、建模、布置的真实场景,开始能被扩展为物体、位置、光照、背景、机器人运动均可调的模拟考场[27]。
但截至目前,Atlas仍处于合作伙伴早期访问阶段,公开量化评测仅集中在相机控制与3D重建领域,尚未披露其生成环境训练出的策略在真机上的实际收益,难言全行业级别的技术拐点——它更准确的定位,是进一步将训练场本身转化为可生成的对象。
DYNA-2压低的是“见过世界”的成本,Atlas压低的是“搭建考场”的成本:前者扩充经验边界,后者扩充试错规模。过去是把机器人送进一个个真实场景采数据;现在可能是反过来,把一个真实场景复制成大量可控变体,送到机器人面前。
这就把数据成本结构拆成了四层:人类视频教机器人见世界,仿真让它反复练习,本体数据把动作对准身体,真机验证决定它能不能上岗。前两层的边际成本正在快速下行——仿真可以在虚拟环境里反复摔杯子、碰障碍、重开;后两层仍受制于物理世界——新任务真正落地前,仍要在真机上过节拍、安全、稳定性、异常恢复四道关,这些是无法一键生成的“上岗成本”。
真机数据已经从“所有知识的唯一来源”,退化为“控制校准与上岗验收的最后锚点”——但这是一个不能拔掉的锚。
更深一层看,成本曲线的核心瓶颈甚至不是“绝对金额太高”,而是“投入转化率太低”。
具身智能赛道上半年融资近千亿[28],但头部企业全年研发投入加起来远低于这一规模——钱进来了,却没花出去。不是花不起,更可能是不知道怎么花才能有效转化为能力。穹彻智能在累计采集超过10万小时真实世界数据后,通过预训练对照实验发现,数据量的线性堆叠并非模型能力提升的唯一变量,问题更在于标注质量、数据清洗与架构设计本身[29]。
钱花了不一定换得来能力提升,数据堆了不一定换得来模型进步。如果行业不知道怎么把钱花在刀刃上,融资再多可能也不会加速“时刻”的到来。
概言之,当前阶段,成本瓶颈更在于从数据到合格动作、再到生产责任的整条链——以及链上每一个环节的投入产出比。
最后看扩散
如果说扩散的本质,是把复杂能力封装成用户可直接调用的产品,那么ChatGPT的扩散接口是一个文本框,具身智能的扩散接口则是一套可采购、可接入、可验收、可运维的任务单元。客户最终买的不是“一台会动的机器”,而是某项工作能以什么节拍、什么成本、什么故障率持续交付。
这就决定了具身智能不可能像大语言模型那样零成本试用——ChatGPT发布后任何人打开网页就能用,无需采购、部署、培训、安全审批——边际成本趋近于零是病毒式传播的经济学前提。具身智能是物理实体,比如每一台人形机器人都有硬件成本、部署周期、安全要求,“免费试用”在这个领域是结构性不可能的。这决定了它的传播曲线不会是病毒式的。
从出货量看,这条曲线好像已经陡起来了。
Counterpoint统计显示,2026年上半年全球人形机器人出货量超2.2万台,同比增长近300%,但娱乐表演、数据生产、科研教育合计仍占六成以上,智能制造占13%,仓储物流仅占5%[30]。宇树披露的结构更极端:2025年前三季度人形机器人收入中,科研教育客户占73.6%,工业客户仅9.01%[31]。优必选2026年上半年全尺寸人形机器人收入5.903亿元、销量921台,同比增长1445%,首次成为占公司总收入近半的核心品类[32]。
三组数据,共同标定了产业化的两个阶段:一边是人形机器人开始形成报表级交付,另一边是相当一部分真实需求仍来自“研究机器人本身”。身体在加速出货,生产接口仍然稀缺。
但最有含金量的进展,不在于机器人第一次走进工厂演示、测试乃至干活,而更在于客户愿不愿意给它在第二个场景运行的机会。
据公开披露的产业合作信息,Figure 02在美国宝马斯帕坦堡工厂运行10个月,参与支持超3万辆BMW X3的焊装环节,后续宝马进一步引入Figure 03拓展物流排序场景;GXO物流在2023年完成概念验证后,于2024年与Agility Robotics签订多年期RaaS(机器人即服务)协议,落地Digit机器人的仓库搬运场景,并接入既有AMR与输送线系统[33]。
一个从单项生产任务走向第二个场景,一个从概念验证走向多年合同。两条路径指向同一种扩散模式:机器人不是被单独卖进工厂,而是被嵌进既有流程。任务边界清晰,环境相对稳定,部署周期是以月、以季度来计算的。
这代表着一种通用技术(人形机器人的泛化能力预期)进入产业的标准路径:先把开放世界收缩成一个可验收的任务,再用真实运行产生的数据逐步扩大能力边界。
具身智能最先成熟的扩散形式,更可能是一套经过工程收缩、能够承担明确责任的任务包——本体、模型、系统集成、安全机制、运维服务封装在一起,客户只需要验收结果。
这其中,合同也分深浅。
一份试点订单只能说明客户愿意试,一次批量交付只能说明产品能进场;持续运行证明任务能被验收,复购续约证明客户愿意持续付钱,跨客户复制才证明传播的真正开始。
当然,行业中存在战投绑定采购、政府订单支撑收入的现象,这也提醒我们:订单、出货、收入和真实落地,不是同一个层级[34]。
传播曲线的阈值,不是“所有人都能和机器人对话”,而是同一任务包能跨产线、跨工厂、跨客户复制,并持续产生续约、复购和场景扩张。
国际机器人联合会把2026年人形机器人的核心命题概括为“证明可靠性与效率”,衡量项包括节拍、能耗、维护成本、安全、耐久性、持续一致的表现[35]。
目前,出货量爆发,说明入口已经打开,但生产应用仍占少数,说明真正的规模化传播尚未完成。
三笔账合在一起,具身智能当前的位置就非常清晰了
固定考场的能力逼近满分,但跨场景、安全、重复执行的稳定性不足;合成数据的成本快速下行,但真实闭环与交付成本仍然刚性;整机出货的节奏持续加快,但可规模化复制的生产任务接口仍然稀缺。
行业整体已经跨过Demo验证的初级门槛,正处在向系统级能力冲击的中间阶段。
只有当同一套系统能把这些进展同步复制到陌生场景、陌生任务、陌生客户身上,第二次换了场地、换了指令、换了客户,它还能稳定完成,单点的小增量才会累积成全行业的大质变。
谁在等待,谁会是那个“ChatGPT”
归根结底,“ChatGPT时刻”,可能并不是一种具体的“时刻”,而更多是一种产业共识形成方式。
那么,究竟是谁在期待抑或等待?其实,这背后的力量分属完全不同的两个层级。
决定“时刻”到来早晚的力量在慢的一侧。技术成熟度、成本曲线、传播扩散三条环环相扣,彼此咬合推进。它们推进缓慢,不以人的意志为转移,不会因为一次Demo、一场发布会就跃迁。技术往前推一点,商业跟进一步,商业再反过来给技术提新约束,两者交替上升、螺旋推进。
只不过,干扰判断的力量在快的一侧。资本用真金白银定价,公众用注意力投票,人才市场随融资潮汐剧烈波动——2024到2025年行业从智驾批量挖人,有资深产品经理每周收到四十余份邀约;国内425家创业公司七成以上成立于2023年之后;到2026年头部公司又开始控预算、缩招聘,入职半年离职率达10%~20%[34]。
映射到二级市场,一个Demo能拉涨停,一次跑慢也能让股价跌去近半——预期拉满时人人喊时刻到了,预期回落时又人人说骗局——市场一旦发现“机器人做那么慢,不如自己来”,失望也同样极致。
快曲线不能决定“时刻”是否、如何到来,但会制造关于“时刻”的幻觉——资本热度冲顶时的集体亢奋,和预期回调时的集体失望,都是同一个情绪钟摆的两端。“ChatGPT时刻”这个词,也就在这个摆动里从技术定义变成了情绪容器——真正的产业节点,往往嵌在三条慢曲线的交汇处,而非快曲线的波峰波谷里。
那么,那些真实发生的进展算什么?它们是单点突破的小进展——小增量积累到什么程度才会变成大质变?中间隔着比单一技术更难的东西:同步:叙事同步、验证同步、采用同步。
具身智能并不缺“所有人都知道它重要”的叙事同步,即共识。高估值、密集融资、大厂布局,以及高盛最新又把2035年人形机器人出货量预测从140万台上调至650万台——“它将很重要”这件事早已达成共识[36]。
真正没完成的,是后两层同步:不同基准、不同主体对“可用”形成共同口径的验证同步,以及同一任务包被持续采购、复购、跨客户复制的采用同步。
ChatGPT的特殊性,就在于三层同步被一个文本框压进了极短时间窗口:人人都觉得重要、人人都能验证好不好用、人人都能用,几乎同时发生。具身智能则把三层完全拆开:预期最先到位,能力验证随后跟上,规模化采用最后发生。
公众不是认知得太慢,而是预期冲得太快。
当所有人都在等一个“时刻”时,真正的变化,有可能已经以另一种形态发生——只是它不病毒式传播,因此在公众视野里近乎隐形。
随后,当这些隐形进展累积到一定程度,终究会逼出那个问题:谁,或者谁们,会是具身智能的“ChatGPT”?
这个问题本身就该打个问号。人们总期待一个带有英雄主义光环的产品,但ChatGPT自己就不是孤胆英雄——它的底层架构是别人的Transformer,它的爆发是技术、成本、扩散三条曲线共振的结果,不是单家公司的奇迹。
现实来看,关于“谁是ChatGPT”,可能至少有三个层级的答案。
开发者层的“ChatGPT”,是一套成为行业事实标准的开源基座、数据范式与工具链——底层能力与成本曲线的核心载体。互联网大厂接连下场具身赛道却无一造整机,全部聚焦大脑、数据与平台层,恰恰印证了这一层的战略权重[37]。但机器人本体、传感方案、控制频率、安全规范的高度异构性,决定了即使某家模型拿下开发者生态的主导权,也不会成为终端产品与商业接口的唯一赢家。
客户层的“ChatGPT”,是一套跑通ROI门槛、可跨场景复制的标准化任务包——对应扩散曲线的成熟形态。客户无需理解VLA或世界模型的技术细节,只需要面向结果的验收标准与交付保障。
公众层的“ChatGPT”,是大众可直接感知、低门槛使用的通用消费级界面——这一层距离规模化落地最远,也并非当前产业演进的核心驱动。
横切2026年的产业格局,没有任何一家公司能同时占住三条曲线的制高点:英伟达做算力与工具链,谷歌输出大模型能力,Physical Intelligence赌通用大脑脱离本体,Figure走全栈垂直整合,中国庞大阵营靠本体产能、数据采集、应用场景三位一体推进。几方各守一个生态位,真正的节点更可能是生态协同的结果,而非单点爆破。
值得一提的是,被寄望为“领头羊”的宇树,披露的文件就比市场情绪冷静得多:招股书坦承“自研通用具身大模型尚未规模化应用于产品”[38],王兴兴也坦言大脑模型自研成功率仍不足50%[39]。这不是宇树一家的问题,而是整个行业的水位,就还只是在这儿。需要祛魅的,是对“单点英雄”的想象。
这也是星海图高继扬判断具身智能“可能没有ChatGPT时刻”的核心依据——它的落地是工厂和仓库里一寸一寸铺开的渐进过程,不是C端的一夜爆红——等到公众普遍意识到时,技术可能已经无处不在[40]。
而“所有人同时意识到”需要的,终究是一个能被所有人理解的界面。在物理世界里,那个“对话框”不是第一份采购合同,而是第二份不再写“试点”的复购单—靠同一个任务包从一家工厂不断复制到下一家。
具身智能不是没有自己的“时刻”,而是不会把所有时刻压缩进一次产品发布。
模型会先出现开发者时刻,任务会再出现ROI时刻,产业最后出现跨客户复制的时刻。ChatGPT把三次跨越折叠成了一个产品事件,具身智能则会把它们摊开在更长的产业周期里——一种以跨场景任务成功率、安全违规率、单任务部署周期、单位任务全链路成本、标准化任务包复购率为核心观测维度的渐进升级。
人们期待一个石破天惊的“ChatGPT时刻”,但或许恰恰是当我们不再把一段连续演进的工业化进程,误认成必须一夜爆发的产品奇观——那个真正定义产业的节点,反而会自然“浮现”。
参考资料:
[1]虎嗅.机器人运动会:智元、天工、银河通用赢麻了[N/OL].(2026-08-27).
[2]新华日报·交汇点.王兴兴现身世界机器人大会:人形机器人的"下一个十年"什么样?[N/OL].(2026-08-20).
[3]金融界.宇树科技股价收跌10.31%:总市值2439亿元,跌至全球人形机器人市值榜第二[N/OL].(2026-08-24).
[4]OpenAI.GPT-6 Astra[EB/OL].(2026-09-03).
[5]财联社.上线不到一周用户突破100万ChatGPT为何火爆全网?[N/OL].(2022-12-06).
[6]澎湃新闻·机器之心.史上增速最快消费级应用,ChatGPT月活用户突破1亿[N/OL].(2023-02-03).
[7]Vaswani A,Shazeer N,Parmar N,et al.Attention Is All You Need[C/OL].Advances in Neural Information Processing Systems 30(NeurIPS 2017).(2017-06-12).DOI:10.48550/arXiv.1706.03762.
[8]Brown T B,Mann B,Ryder N,et al.Language Models are Few-Shot Learners(GPT-3)[C/OL].Advances in Neural Information Processing Systems 33(NeurIPS 2020).(2020-05-28).DOI:10.48550/arXiv.2005.14165.
[9]Ahn M,Brohan A,Brown N,et al.Do As I Can,Not As I Say:Grounding Language in Robotic Affordances(SayCan)[C/OL].Conference on Robot Learning(CoRL 2022).(2022-04-04).DOI:10.48550/arXiv.2204.01691.
[10]Brohan A,Brown N,Carbajal J,et al.RT-1:Robotics Transformer for Real-World Control at Scale[C/OL].Robotics:Science and Systems(RSS 2023).(2022-12-13).DOI:10.48550/arXiv.2212.06817.
[11]Brohan A,Brown N,Carbajal J,et al.RT-2:Vision-Language-Action Models Transfer Web Knowledge to Robotic Control[C/OL].Conference on Robot Learning(CoRL 2023).(2023-07-28).DOI:10.48550/arXiv.2307.15818.
[12]Black K,Brown N,Driess D,et al.π0:A Vision-Language-Action Flow Model for General Robot Control[EB/OL].(2024-10-31).DOI:10.48550/arXiv.2410.24164.
[13]Kim M J,Pertsch K,Karamcheti S,et al.OpenVLA:An Open-Source Vision-Language-Action Model[C/OL].Conference on Robot Learning(CoRL 2024).(2024-06-07).DOI:10.48550/arXiv.2406.09246.
[14]新华网.工程师解密人形机器人百米跑,为啥最后都要"撞墙"[N/OL].(2026-08-27).
[15]新华网.第二届世界人形机器人运动会多项纪录被破[N/OL].(2026-08-27).
[16]Kim M J,Finn C,Liang P,et al.Fine-Tuning Vision-Language-Action Models:Optimizing Speed and Success(OpenVLA-OFT)[EB/OL].(2025-02-27).DOI:10.48550/arXiv.2502.19645.
[17]智元机器人(IT之家刊发官方发布稿).智元发布新一代具身基座大模型GO-2,让机器人"知行合一"[N/OL].(2026-04-09).
[18]Luo H,Wang Y,Zhang W,et al.Being-H0.5:Scaling Human-Centric Robot Learning for Cross-Embodiment Generalization[EB/OL].(2026-01-19).DOI:10.48550/arXiv.2601.12993.
[19]Xu H,Yuan H,Zhang C,et al.Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models(BeTTER)[EB/OL].(2026-04-20).DOI:10.48550/arXiv.2604.18000.
[20]深圳市优必选科技股份有限公司(9880.HK).截至2026年6月30日止六个月之中期业绩公告[R/OL].(2026-08-28).
[21]Fan J,et al.SafeVLA-Bench:A Benchmark for the Success-Safety Gap in Vision-Language-Action Models[EB/OL].(2026-05-30).DOI:10.48550/arXiv.2606.00773.
[22]新华网.加速产业规模化具身智能标准持续完善[N/OL].(2026-06-01).
[23]Khazatsky A,Pertsch K,Nair S,et al.DROID:A Large-Scale In-The-Wild Robot Manipulation Dataset[C/OL].Robotics:Science and Systems(RSS 2024).(2024-03-19).DOI:10.48550/arXiv.2403.12945.
[24]NVIDIA.NVIDIA Announces Isaac GR00T N1—the World's First Open Humanoid Robot Foundation Model—and Simulation Frameworks[EB/OL].(2025-03-18).
[25]RoboDream团队.RoboDream:Compositional World Models for Scalable Robot Data Synthesis[EB/OL].(2026-06-01).DOI:10.48550/arXiv.2606.02577.
[26]澎湃新闻.前DeepMind研究科学家发布具身模型,可在13分钟内适配新任务[N/OL].(2026-08-10).
[27]World Labs.Atlas:A World Model for Spatial Intelligence[EB/OL].(2026-09-01).
[28]中国证券报.具身智能融资半年破900亿投资逻辑从"后空翻"转向"搬砖头"[N/OL].(2026-07-10).
[29]36氪.一家具身模型公司"沉默"的三年[N/OL].(2026-08-31).
[30]Counterpoint Research.2026年上半年全球人形机器人出货量同比增长近300%,商用落地持续提速[R/OL].(2026-08-20).
[31]《财经》杂志.宇树科技上市在即,上涨空间几何?[N/OL].(2026-08-18).
[32]财联社.三箭齐发,卫冕全球第一!优必选2026年上半年营收12.7亿元,人形机器人销量16123台[N/OL].(2026-08-28).
[33]36氪.机器人还不会做家务,先学会了说"爱"你[N/OL].(2026-07-02).
[34]晚点LatePost(郭瑞婵、曾兴).具身智能还在抢人,第一批跳槽者却想走了[N/OL].(2026-08-31).
[35]International Federation of Robotics.Top 5 Global Robotics Trends 2026[EB/OL].(2026-01-08).
[36]财联社.海外研选|高盛上调人形机器人预期:2035年出货650万台物流仓储率先规模化[N/OL].(2026-08-31).
[37]钛媒体.进入2026年,每天至少有5亿元砸向具身智能[N/OL].(2026-03-07).
[38]宇树科技.首次公开发行股票并在科创板上市招股意向书[R/OL].(2026-07-31).
[39]虎嗅.宇树科技IPO背后的全球具身机器人"大脑"暗战[N/OL].(2026-08-13).
[40]中新经纬.多位创始人齐发声:具身智能的"ChatGPT时刻"何时到来?[N/OL].(2026-08-22).
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。