机器人行业最该回答的5个问题是什么?一文带您了解(4)

2026-08-25 11:22  极客公园

未来不远此前基于 AVLA 构建视觉、语言与动作的端到端闭环,并在此基础上进一步推出 Self-Evolving WAM(自进化世界动作模型),让机器人不仅能够理解并执行任务,还能预测动作结果,并利用真实家庭中的执行数据持续迭代模型。

未来不远表示,以洗衣场景为例,其模型基于几十种洗衣机进行训练后,已经可以泛化到数百种不同的机型、开门方式和按钮类型。类似的泛化能力也用于衣物,玩具等家庭物品,让机器人能够在不同家庭环境中完成动态变化的任务。

自变量重点展示其模型 WALL-B 的通用性:家庭服务和物流分拣两个差异很大的场景,运行的是同一个模型。WALL-B 将视觉、语言、触觉、动作和物理预测融合进统一网络,让机器人理解重力、惯性、摩擦等物理规律,并预判动作结果。

分层式具身智能架构的代表性探索包括逐际动力 COSA。

COSA 0.5 将机器人大脑分为三层:System 2 负责场景理解、记忆、推理和任务调度,System 1 调用 VLA 等操作技能,System 0 以最高 1000Hz 进行全身运动控制。

跨本体具身基础模型的代表之一是星海图 G0.5。WRC 现场,搭载 G0.5 的 R1 Lite 在移动过程中完成任务整理需要的环境理解、任务拆解、双臂操作和异常恢复。G0.5 通过统一动作编码,让同一套模型适配不同机器人本体。

千寻智能用它的 Moz1 挑战长程任务,比如「整理餐厅」,机器人接到一句指令后,要连续完成环视环境、取可乐、移动到冰箱、开门放入、关门,再把脏碗送进洗碗机等一系列动作;如果目标物被移走、遮挡,或者已经整理好的环境再次被打乱,它还会重新感知并规划。

在应用场景上,让机器人像人一样进入家庭和公共空间,完成复杂任务,现在的成熟度还相对不足,尤其是涉及与人直接交互,需要考虑安全性。但在工厂、在仓库、以及其他相对封闭的场景,机器人已经能完成一些相对复杂的长程任务。

例如,星动纪元的星动 M7 在现场连续完成随机包裹识别、抓取、翻转面单和送入传送链路等动作;这套能力已经在中国邮政等物流中心落地,最高达到每小时 1200 件。

具身智能的通用能力和垂直场景能力并不互斥,机器人在真实世界的垂直场景中,适应各种非标操作,并且能稳定运行,其实可以反哺通用能力的提升。

而且,各家公司在模型进化上的努力,都是从单项技能向跨本体、长程任务和动态环境泛化等方向进步。