其二是动作预测:给定任务指令、当前视觉观测,以及可选的近期动作历史,模型直接输出下一拍末端执行器的动作块,表达为一段ActionPiece token序列;单臂、左腕、右腕共用同一套词表与码本,意味着一份通用模型权重即可驱动不同形态的机器人。这正是"理解"能够落地为"行动"的关键一跃。

其三是未来状态预测:在给定当前观测与任务指令后,模型预测约一秒后的世界状态,并以 RGB 图像、度量深度图与机器人占用掩码三种模态联合给出。这种"先想象结果、再采取行动"的能力,让模型在闭环中拥有了前瞻与纠错的依据,动作尚未执行,它已能预判环境将如何变化。

这种"一个 token 接口贯通物理循环"的架构选择,比单纯堆高某项分数更能说明问题:它指向的,是一个可"感知-决策-行动-反馈"连续运转、并能据反馈自我修正的物理智能基座模型。
02 人类完整经验,
是物理智能循环的来源
闭环要能运转,第一步是"有经验可学"。模型在 Physical Loop 中观察、决策、行动、反馈,其能力上限,终究由它所消化的物理经验的质量与完整性决定。而人类经验天然地嵌入这一循环中。人在真实世界中持续感知环境、理解情境、形成意图、采取行动,并根据环境反馈修正自己的判断与行为。人类的智能,正是在无数次Physical Loop中生长出来的。在深度机智的路线里,人类经验是物理智能循环的第一性来源。
为此,深度机智构建了 Ego360 全景数采体系,尽可能完整地保留人类行动过程中的环境、身体、手部交互与注视。这意味着模型学到的是一段连续、完整的"人类经验",而非被割裂的局部,这正是"完整经验"之于物理智能循环的关键价值。只有保留了行动前后的因果链条,模型才能真正理解"为什么这么做"和"做完之后发生了什么",而非仅仅记住"怎么做"。











