PhysBrain 1.5:把语言、动作与未来世界状态统一进一个自回归词表的物理基础模型
核心概要
PhysBrain 1.5 以预训练 Qwen3-VL 为骨干并扩展专用动作与视觉状态 token,把语言回答、结构化空间输出、末端执行器轨迹与未来世界状态统一为离散 token 并在单一“下一 token 预测”目标下联合学习,预训练阶段的具身监督全部来自人类交互视频(自我中心、同步自我—外中心与全景记录,组织为以任务为中心的片段),监督微调再结合人类演示、真实机器人轨迹与仿真经验,在 28 个具身空间智能与规划基准上 8B 版本取得 72.5 的总体平均分,开源模型中排名第一,并与 GPT-6-Astra(73.3)和 Gemini 3.6 Flash(73.0)等领先闭源系统表现相当,在开源模型中于 14 个基准排名第一、10 个
深度剖析
把语言、动作与视觉状态统一为同一自回归流中的离散 token,不使用任务专用头。 相对以往为动作或世界模型单独设计预测头的做法,这里语义、运动与未来状态监督都通过同一个下一 token 预测目标更新同一套参数。 论文以架构描述与统一词表的方式给出该设计,并说明其建立在预训练 Qwen3-VL 之上、扩展了专用动作与视觉状态 token;证据形式为模型设计与整体基准表现,而非消融实验。
ActionPiece token 在统一动作码本中编码末端执行器轨迹,跨控制配置与机械臂设置共享。 这使单一通用检查点可以驱动多种机器人平台与操作设置,而不是为每种平台单独训练策略。 论文给出统一动作码本与词表的机制说明,并配以动作轨迹预测的定性结果;证据以定性展示与整体基准为主。
在同一词表内把未来世界状态预测为空间对齐的 RGB 图像、深度图与机器人掩码。 世界模型被纳入与语言、动作相同的自回归词表,而非独立模块。 论文以“预测一步未来”的多模态世界模型描述与跨多种机器人形态的未来视觉预测定性结果支撑。
在 28 个具身空间智能与规划基准上,8B 版本总体平均 72.5,开源第一,接近领先闭源系统。 论文称所有模型均以每个基准的单一规范指标独立重评以保证可比性,并报告在开源模型中 14 项第一、10 项第二。 证据为跨 28 个基准、13 个模型的汇总评分表,总体平均为 28 个基准的未加权均值;闭源模型与 2B 版本仅作参考、不参与排名。
启示与展望
该结果面向具身空间智能与规划任务:给定任务指令、当前观测与可选近期动作历史,预测下一段末端执行器动作块,并预测一步未来的 RGB、深度与机器人掩码。适用对象是希望以单一通用检查点驱动多种机器人平台与操作设置、并复用标准模型接口进行推理与后训练的研究者与工程团队。预训练具身监督来自人类交互视频,微调结合人类演示、真实机器人轨迹与仿真经验,因此其定位是这一数据与任务设定下的物理基础模型。
本次读取的文本为不完整范围,缺少完整技术报告正文、图表细节与消融信息,因此关于预训练数据规模、训练配方、动作码本构建方式与各基准逐项差异的细节仍属开放问题。读者可继续关注:统一词表下语言、动作与视觉状态之间是否存在相互影响,统一动作码本在更多控制配置与机械臂设置上的表现,以及未来状态预测精度与下游操作成功率之间的关系。此外,总体平均为 28 个基准的未加权均值,不同基准的难度分布如何影响该汇总值,也值得在阅读完整报告时留意。
