机器人行业最该回答的5个问题是什么?一文带您了解(5)

2026-08-25 11:22  极客公园

03

具身数据正在变成一门硬件生意吗?

无论具身智能的通用性能,还是垂直场景性能,模型都需要大量高质量的数据。

机器人的数据采集,目前主流的方式有遥操作、 无本体 UMI 与数据手套、第一视角采集与动捕、真机本体采集等,几乎每一种,都涉及硬件,有人笑称,具身智能的数据采集,是不是变成了一门硬件生意?

其实数据的重要性不在数据本身,而在于模型,在于智能。只有当数据足够多,足够高质量,能够反哺模型进化,并且在场景中形成数据闭环和数据飞轮,它的意义才真正体现。

光轮智能是独立具身智能数据领域的头部公司之一,围绕人类第一视角数据、物理仿真、规模化评测和真机反馈,构建 Real2Sim2Real 数据闭环。

此次 WRC,光轮智能重点展示了 SimFoundry 仿真和 RoboFinals 评测体系。SimFoundry 通过真实物体参数测量和自研物理求解器,提高衣物、线缆等柔性物体的仿真精度;RoboFinals 则用于机器人模型的大规模测试和评估,让模型在进入真实场景前先经过系统验证。

遥操、UMI、动捕,是以人为中心的高质量数据获取方式,但它们的成本还是太高,较难满足模型对数据量的需求。

具身数据的获取方式还有很多,比如靠视频数据,靠游戏数据,以及最近 1-2 年兴起的世界模型。

极佳视界走的是世界模型路线,将世界模型作为「数据放大器」。GigaWorld 根据机器人动作推演环境变化,批量生成训练和测试所需的交互数据;GigaWorld-1 进一步加入动作建模和物理参数估计,提高抓取、碰撞等操作模拟的可信度。

所以数据并不是一门单纯的硬件生意,而是有多种类型,多种形式的。并且,相比单纯数据采集,为模型提供数据,对于具身智能模型提升更大的,可能是形成数据飞轮,而这是专注在具身数据采集的单个企业很难完成。

要形成数据闭环和数据飞轮,必须进入具体场景,和机器人一起协作,用真实产生的数据去迭代和优化模型。

例如,银河通用构建了「银河星数(AstraData)」数据基座,将互联网数据、人类行为数据、仿真合成数据、真机遥操和真实场景回流数据统一用于模型训练,并接入场景验证和回流优化的闭环。其通用小脑模型 AstraBrain-WBC 0.5 使用约 2 万小时、20 亿帧人类动作数据训练,工程优化后推理延迟低于 1.5 毫秒,整条动捕链路延迟小于 20 毫秒。

智元机器人的数采 2.0 体系,基于 430 余个真实场景搭建真机、无本体和多源数据金字塔,并把模型评测、场景落地、实景适配测试和运行数据回流放在同一体系中。

更进一步,还有海外创业公司在工厂环境中让现场工人现场纠正机器人,然后把新的行为继续接入流程,并且收集数据对具身模型进行 Post-Training。

银河通用、智平方、智元机器人等中国公司也已经在往这个方向进步,未来具身数据的共同趋势可能是:数据采集将从「集中式数采工厂」走向「机器人部署现场」。