在 2026 年 CES 展会上,英伟达以“物理 AI”为核心主题,宣布推出一系列开放模型、开发框架和 AI 基础设施,目标是让机器人和自主机器能够像人类一样感知、理解并预测物理世界。[1] 现场,全球多家合作伙伴同步展示了基于这些模型打造的新一代工业、服务和人形机器人,使“AI 走出屏幕,进入现实世界”成为本届展会的亮点之一。[1]
根据英伟达介绍,本次发布的核心之一是 NVIDIA Cosmos 平台——一个专为物理 AI 打造的开放平台,围绕“世界基础模型”(World Foundation Model,WFM)构建,包括世界模型、视频数据处理库、视频评估工具以及后训练框架,旨在统一机器人训练所需的感知、预测与仿真能力。[2][3] 与此同时,英伟达还发布了面向人形机器人的 Isaac GR00T N1.6 视觉‑语言‑行动(VLA)模型,通过与 Cosmos Reason 2 的协同,为机器人提供端到端的“看、想、动”能力链条。[1]
英伟达将 Cosmos 定位为“领先的世界生成模型”,可灵活适配各类物理 AI 任务和环境,是构建机器人世界理解的底座。[1][2] 这一平台目前提供约 20 亿参数(2B)和 140 亿参数(14B)两种规模的世界基础模型,开发者可以根据自身算力和应用场景自由选择。[1][2]
在能力层面,Cosmos 模型支持 多模态输入:既可以从纯文本指令出发,也可以基于单帧图像或一段视频,直接生成最长约 30 秒的预测性视频“世界”,展示未来可能发生的一系列物理变化。[1][2] 例如,开发者可以输入“一个机器人端起桌上的杯子并放到货架上”这样的指令,Cosmos 便会生成对应的动态画面,用于训练或测试机器人任务规划。[1][2]
更关键的是,Cosmos 不仅是一个“生成模型”,还被设计为可广泛 后训练和定制 的平台。开发者可以利用自身采集的视频数据对模型进行微调,构建高度贴近业务需求的“自定义边缘案例”和复杂场景,并在闭环仿真中对机器人策略进行反复评估。[1][2] 这意味着,过去需要大量实地测试才能暴露的问题,如少见故障、极端光照或复杂人群互动等,都可以在虚拟世界中提前“预演”。[1][2]
在软件组件上,Cosmos 平台配套提供视频数据处理库、视频评估工具和后训练框架,帮助团队从原始视频到模型训练、再到效果量化实现端到端打通,从而加速机器人感知与世界建模能力的迭代。[1][2]
为进一步降低物理 AI 的开发门槛,英伟达此次将 Cosmos 细分为多种可组合的开放模型,包括 Cosmos Transfer 2.5、Cosmos Predict 2.5 和 Cosmos Reason 2,并通过 Hugging Face 对外提供。[1]
英伟达介绍,Cosmos Transfer 2.5 与 Cosmos Predict 2.5 是开放、完全可定制的世界模型,专门用于基于物理原理的合成数据生成与机器人策略的仿真评估,可以看作是“把现实世界搬进虚拟实验室”的工具。[1] 通过这些模型,开发者能够在大规模模拟中生成多样化场景,并在无需昂贵实物测试的前提下评估不同控制策略的效果和安全性。[1]
Cosmos Reason 2 则是一个开放的推理型视觉‑语言模型(VLM),负责“看图说话”和多模态理解:它可以接收图像或视频输入,结合文字指令进行语义理解、场景分析与任务分解,为上层的决策与控制模块提供上下文信息。[1] 与只做图像识别的传统视觉模型相比,Reason 2 强调对“物体之间物理关系”和“动作后果”的理解,更适合作为物理 AI 系统中的“认知中枢”。[1]
在控制层面,英伟达同步发布 Isaac GR00T N1.6,这是专为人形机器人打造的开放式视觉‑语言‑行动(VLA)模型,可以在接受文本或语音指令后,结合视觉和环境理解,输出适合整个人体骨骼系统的运动控制命令。[1] 英伟达表示,GR00T N1.6 可借助 Cosmos Reason 增强推理和上下文理解能力,从而实现更自然、更安全的人机协作行为,例如在拥挤环境中躲避人群、识别并完成多步骤任务等。[1]
与传统“闭门造车”的机器人算法不同,英伟达强调 Cosmos 系列模型是“开放模型”,开发者可以通过 Hugging Face 等平台直接获取模型权重,在此基础上进行二次训练与部署,从而绕过耗时耗资的预训练阶段,把精力集中在场景设计和产品化上。[1] 这对于中小团队和垂直行业企业而言,显著降低了进入物理 AI 领域的门槛。[1]
在应用层面,英伟达及其合作伙伴展示了多种基于 Cosmos 与 Isaac 生态的机器人形态,包括工业搬运机器人、仓储自动化设备、服务机器人乃至通用人形机器人,它们均依赖世界模型进行环境理解与轨迹规划,以更好地适应动态、复杂甚至未知的真实场景。[1] 借助 Cosmos 提供的仿真与预测能力,企业可以先在虚拟世界中完成策略开发和安全验证,再将方案迁移到现实工厂、仓库或公共空间,从而缩短部署周期并降低风险。[2][1]
从产业视角看,英伟达通过 Cosmos 将“世界模型”“视觉‑语言推理”和“人形机器人控制”打包成一整套开放技术栈,试图为物理 AI 建立类似于过去 GPU 在深度学习中扮演的基础设施角色。[2][1] 分析人士认为,随着更多开发者在这一平台上构建应用,机器人有望逐步从单一场景工具迈向具备通用感知与动作能力的“通用实体智能”,而“让机器人看懂世界”也正在从概念走向可验证的工程现实。[1][2]