01 把"理解、动作、预测"
收敛进一个闭环
在讨论模型之前,需要先厘清物理智能到底在解决什么。深度机智将其概括为 Physical Loop:一个"观察世界、理解空间与任务、判断动作后果、执行、再依据新的观察修正下一步"的物理智能循环。
真正的物理智能,不是单点能力,而是这个闭环能够连续、稳定地运转,并据反馈自我修正。但在今天,构成这一循环的能力大多分散在语义理解、空间感知、物体识别、动态生成等彼此割裂的专用模型中,缺少统一的世界表征、行动目标与反馈机制,Physical Loop也难以运转。
深度机智的判断是:要做出能"在世界中行动并自我修正"的底座,必须先回到这个闭环本身,把能力重新组织起来。PhysBrain 1.5,正是围绕这一闭环重建模型本身。

该模型以 Qwen3-VL-8B-Instruct 为基座,扩展出专用的动作 token 与视觉状态 token,把语言回答、结构化空间输出、末端执行器轨迹,以及未来的 RGB、深度与机器人占用预测,全部表达为离散 token,在单一自回归主干、单一 next-token 预测目标下联合训练,不引入任何任务专属头。这意味着,理解、动作生成与未来状态预测不再由多个模型拼接,而是在同一个物理循环中共同训练、彼此对齐,构成了能力扎实、边界清晰的一体化物理智能底座。
在这套统一架构之下,PhysBrain 1.5 的能力可沿 Physical Loop 拆成三个相互咬合的环节。
其一是具身理解:模型通过基础 VLM 接口、辅以具身监督,覆盖五类能力--基础视觉空间感知、3D与多视角空间理解、具身认知推理与规划、空间指向与可供性,以及视觉轨迹推理。换言之,它不只是"看懂"画面,而是带着空间结构与物理常识去理解场景。











