李飞飞谈“数据瓶颈”,具身智能训练数据进入“春秋战国”时代,“粮草”从哪里来?

2026-08-26

过去三年,行业各方把大量资本和人才投入到硬件本体与模型算法上——谁能做出更灵活的机器人,谁就能占据资本与舆论的制高点。

刚刚举办的 2026 世界机器人大会上,机器人制造商“百家争鸣”,纷纷亮出看家本领,集中展示最新技术与产品。随着具身智能加速走出实验室、迈向真实场景,行业竞争也正在从“比技术”转向“比落地”,一场围绕实际应用与商业化能力的较量正全面展开。

到了 2026 年,战局正在悄然扭转,竞争的重心正在从硬件和大脑转向数据。行业逐渐意识到一个残酷的事实:没有足够多的高质量训练数据,再好的机器人也只是中看不中用。如果把具身智能比作士兵,那么数据就是粮草,而“粮草”问题,远比想象中严峻。

当前具身智能训练数据形式并未收敛,各种各样的数据内容层次出现、正是话语权争夺的“春秋战国”时代。

 

 

 

数据为什么已经成为具身智能的核心瓶颈

 

 

有一组对比可供参考:大语言模型可以依靠互联网上数十年积累的海量文本数据完成训练,GPT-2 和 GPT-3 的训练数据分别对应约 79 万小时和 1100 万小时。但具身智能呢?截至 2026 年初,全球高质量真实物理交互数据总量仅约 50 万小时。

2026 年 7 月,李飞飞在 a16z 的访谈中也提到:机器人面临一个极其困难的问题,就是非常缺乏数据,无论是训练数据还是评估数据都严重不足,大语言模型只需要理解语义,但机器人必须理解物理世界,一个物体的重量、摩擦力、形变,以及空间中的位置关系、障碍物布局。这些信息不是"看到"就能获取的,必须通过真实世界的物理交互才能采集。

而真实世界的采集,远比想象中困难。不同型号的机器人、不同的工作场景、不同的光照和物体条件,采集到的数据几乎不通用。一台机器人在 A 工厂学会的抓取技能,换到 B 工厂的产线上就要重新训练。

数据的紧缺,就阻碍了具身智能快速、规模化的进入真实世界。

 

 

 

具身智能训练数据的“粮草”都有什么种类?

 

 

第一类是真机数据。

真机数据是目前数据质量最高的方案,它的采集逻辑很直接:人通过 VR 头显和遥操设备远程操控真实的机器人,让真实机器人完成各种任务,同步采集动作与环境数据。

真机数据的优点是数据保真度高,它直接来自真实机器人的传感器反馈,采集的数据能直接反映机器人操作习惯,为复杂动作提供可靠的数据基础。

缺点也十分突出,一个字——贵。一台机器人硬件成本动辄几十万,采集员需要全天候值守。更致命的是,不同型号机器人的数据不通用,难以跨本体使用。

(图源网络)

第二类是 EGO 数据,也就是第一视角人类数据。

人类每天都在拿东西、开门、做饭、整理物品,这些行为本身就是巨大的具身智能数据来源。Ego-Exo4D 等项目已经开始大规模记录人类第一视角行为。EGO 数据的优势是规模大、成本相对低,可以帮助模型理解人类如何与世界交互。

(图源网络)

第三类是 UMI 数据,即通用操作接口数据。

UMI 的核心思路是把“人的示范”和“机器人”进行捆绑。人类可以通过一个类似夹爪的小型操作设备完成真实操作,系统再把这些动作转化为机器人能够学习的数据。这样可以降低机器人数据采集成本,对于聚焦单一操作任务的中小企业而言,UMI 数据成本更低、可用性更强。

(图源网络)

第四类是仿真合成数据。

仿真合成数据是在虚拟物理世界中批量生成的机器人操作数据。它有点像打电子游戏——在电脑里构建一个虚拟的物理世界,让机器人在里面反复练习。

仿真数据的优点是成本极低、可无限生成、可覆盖各种危险或难以在现实中复现的场景。仿真数据生成成本仅为真机采集的约百分之一,且能快速切换任意环境,这是真机采集无法比拟的效率。

但它的缺点是存在显著的 Sim2Real Gap——由于仿真环境很难 100% 还原真实世界的物体形变和物理特性,仿真数据往往存在偏差,直接迁移到机器人上时会出现“水土不服”,训练出来的策略搬到真机上往往表现不佳。

(图源网络)

 

 

 

 

未来趋势:仿真合成会成为最终答案吗?

 

 

面对上述四种数据类型的各自短板,行业一直在探索最优解。

早期工业依赖实物制造和反复试验,研发成本高、周期长。随着标准化实验、工程测试和计算机技术的发展,越来越多的试错从生产现场转移到实验室和数字空间,CAD、CAE、CFD 等设计仿真工具由此成为现代工业研发的重要基础。进入物理 AI 时代,工业时代这一发展历程同样也在悄然发生。

2026 年 7 月,李飞飞的 World Labs 发布“Real-to-Sim-to-Real”引擎。它的核心逻辑是:在仿真环境里批量生成那些在真实世界中极难采集的训练数据。整个策略完全在仿真中完成训练,全程不使用任何真机数据,仅靠仿真数据就完成了从仿真训练到多种机器人真机迁移,真正实现了 0 样本真机训练。

在此之前,艾伦人工智能研究所(AllenAI)发布相关实验论文《MolmoBot: Large-Scale Simulation Enables Zero-Shot Manipulation》已经表明:在机器人训练任务中,构造一个零真机数据的仿真训练场,并生成海量多样化场景——随机变换房间布局、物品类别、光照条件、视角角度和物体位置,模型在训练中掌握的是任务底层的通用逻辑,完全不需要接触真实世界数据。训练完成后直接迁移到实体机器人上,效果甚至超过用昂贵真机数据训练出的顶级模型。

(图源网络)

从过去一年具身行业的发展来看,春秋战国终将走向统一。从工业发展的历史规律来看,仿真的规模化应用,几乎是必然的终局。仿真不是替代了真实,而是让昂贵的真机数据被高效地放大和利用。因此,未来的竞争重点可能不再只是“谁拥有更多机器人”,而是谁拥有更多、更丰富、更还原真实世界的世纪模型。

 

 

 

众趣科技,为具身智能建一座对齐真实世界的“训练场”

 

 

在过去,三维扫描的主要价值是把房间、园区、建筑等真实空间数字化,让人能够在数字世界中查看和管理现实空间。而能更快、更精准、更低成本地把真实世界的空间结构“搬”进数字世界,是行业一直在努力的方向。在这个方向上,众趣科技已经积累了十余年。

在进入物理 AI 时代以后,这些空间数据有了新的价值:它们可以进一步成为具身智能理解、训练和模拟真实世界的模拟器。

截至目前,众趣科技已累计复刻超 50 亿平方米的真实三维数字空间,覆盖从百平米室内到大型园区的各类场景,形成了国内规模领先的真实空间数字化资产库。

但仅仅把空间“搬”进数字世界还不够,众趣正在做的是第二步:基于真实世界扫描生成的三维模型可转换为兼容 OpenUSD 标准的数字资产,接入基于 NVIDIA 机器人生态的 Isaac Sim/Lab/Newton 等开放框架开发的智能体和应用,并进一步用于具身智能训练和大规模评测,最终形成“Real-to-Sim-to-Real”完美闭环。

这意味着,众趣科技已积累的海量数字孪生空间,不再只是给人看的世界模型渲染器,而是可以直接成为具身智能可以进去训练、试错、迭代的“世界模型模拟器”。

我们判断,随着仿真引擎的不断进步,正如高端制造业过去 30 年发展经历一样,具身智能的训练数据之争终究会走上“仿真+真机”的成长路线:机器人要在真实世界工作,首先得有一个足够真实的仿真环境,这将是具身学习最扎实的底座(正如我们的学校教育一样),最后再加上有限高质量的真机数据(岗前培训),就形成机器人完美的成长教育体系。

而众趣科技,正在用十几年积累的海量真实空间数据和领先的空间智能能力,铺下这场战役的第一块基石。

 

 

参考文章:

《构建用于人形机器人学习的合成运动生成流程》康纳·史密斯,Peter Du——NVIDIA

《具身智能进入数据竞争下半场:千万小时真实交互数据成核心瓶颈》DONEWS

《当Github7万星标遇上产业老兵》36氪品牌

《在宿迁,窥见世界模型争夺战的数据采集前线》周远方——科工力量

《破解具身智能数据瓶颈:哪条技术路线才是最优解?单选Or并行?》机器觉醒时代——维科网

《MolmoBot: Large-Scale Simulation Enables Zero-Shot Manipulation》艾伦人工智能研究所(AllenAI)、华盛顿大学、普林斯顿大学等

一站式3D空间数字化解决方案,即刻了解

预约演示
致电咨询
客服电话咨询

400-779-7900

企业微信
企业微信