跳到主要内容
返回时间线
arXiv来源发表:

BLS 在测试时精炼任务向量,使零样本策略在 OGBench、DMC 与 HumEnv 上超越 OLS 与在线自适应基线

相关研究与后续进展

核心概要

作者提出 BLS:一种面向行为基础模型(BFM)的离线零样本任务推断方法,它先用最小二乘(OLS)得到任务向量,再用软间隔对比损失与信赖域损失联合优化该向量,以同时降低奖励重建误差与后继测度偏差;理论上给出由后继测度残差与奖励残差共同刻画的次优性上界,实验在 OGBench 的 5 种特征表示(本体感知与像素观测)、DMC 的 20 个任务与 HumEnv 的 45 个人形控制任务上平均优于 OLS、ZOL、ReLA 与 LoLA,且推理开销可忽略。

Source-provided article image: Task Inference Beyond Least Squares in Behavioral Foundation Models
Figure 1 ·

Figure 1: Ordinary least squares (OLS) aims to minimize the total errors of reconstructed rewards. Its performance highly depends on the quality of state representations, the state coverage within the dataset, and the distribution of rewards. Because OLS can be biased toward the majority of states, low-reward states ( N N ) may be assigned with high-value rewards and vice versa for high-reward states ( G G ). The successor measure of the retrieved zero-shot policy can therefore diverge from that of the optimal policy. BLS instead adopts an objective that reduces the reward reconstruction errors while enlarging the margin between high- and low-reward states. Thus, the successor measure of the retrieved zero-shot policy is encouraged to stay closer to the optimal policy’s.

arXiv

深度剖析

论文给出零样本推断策略次优性上界,该上界同时由奖励重建残差与策略平均后继测度残差决定,并指出 OLS 只优化前者。 此前 BFM 任务推断普遍以 OLS 最小化奖励重建误差为目标,后继测度偏差未被纳入推断目标;本文把两个残差并列写进同一个上界。 定理 4.1 及其在附录 A 的证明,配合对 OLS 只追求奖励一致这一条件的分析。

提出 BLS:以 OLS 解为锚点,用软间隔对比损失拉大高奖励状态与低奖励状态之间重建奖励的间隔,并用信赖域损失约束任务向量不偏离锚点,通过梯度下降迭代优化。 与 ReLA、LoLA 需要任务相关的在线交互不同,BLS 直接在离线奖励—特征样本上做测试时任务向量精炼;与 ZOL 的分布校正不同,BLS 不改变表示、后继测度与策略的训练方式。 算法 1 与第 4.2 节的目标函数;附录 B 给出推理样本、Adam 优化步数与学习率、单位球投影、奖励归一化等实现细节。

在 OGBench 上 BLS 提升全部 5 种特征表示的平均表现,本体感知下 HILP 与 TD-JEPA 增益尤为明显;像素观测下同样保持整体趋势。 此前没有方法在如此多预训练目标不同的特征表示上同时验证任务推断的改进。 表 1 报告 9 个稀疏奖励导航与操作任务在 Laplacian、ICVF、HILP、FB、TD-JEPA 上的成功率,均值与标准差基于 3 个随机种子。

BLS 在离线推断设定下超过在线自适应方法,并在稠密奖励任务上继续有效:DMC 上 20 个任务中改进 18 个,HumEnv 上 45 个任务中改进 42 个。 ReLA 与 LoLA 需要每个任务的奖励标注交互回合,而 BLS 不需要任务相关交互;同时 BLS 可作用于 OLS 之外的强锚点(如 HumEnv 的 FB-CPR 目标嵌入)。 表 3 的跨表示平均成功率、图 3 的 DMC 与 HumEnv 结果、表 8 与表 9 的 HumEnv 目标到达与 5 个 FB-CPR 检查点结果。

启示与展望

该方法面向已有预训练 BFM 的测试时使用场景:表示、后继测度与策略保持冻结,只更新任务向量,适用于能从离线回放缓冲区取得奖励—特征样本的设定。对稀疏奖励任务,软间隔对比损失权重取小值更合适;对稠密奖励任务,保持接近 OLS 锚点更合适,论文用余弦相似度目标来参数化信赖域强度。它也可用于精炼 OLS 之外的强锚点,例如 HumEnv 目标到达中由目标状态反向嵌入构成的任务向量,以及以加权奖励推断为锚点的情形。

软间隔目标被作者明确表述为后继测度偏差的经验代理,而非理论保证;其与锚点损失的权重随奖励稀疏程度变化,需要按任务类型选择。高奖励集合的构造在稠密奖励任务中依赖奖励阈值,论文报告了阈值敏感性分析,但阈值与权重之间的联合选择仍是开放问题。此外,论文报告的是仿真基准上的成功率与回报,向真实机器人或更广泛任务分布的迁移尚未在文中验证。

来源