arXiv 2026年10月6日作者提出 BLS:一种面向行为基础模型(BFM)的离线零样本任务推断方法,它先用最小二乘(OLS)得到任务向量,再用软间隔对比损失与信赖域损失联合优化该向量,以同时降低奖励重建误差与后继测度偏差;理论上给出由后继测度残差与奖励残差共同刻画的次优性上界,实验在 OGBench 的 5 种特征表示(本体感知与像素观测)、DMC 的 20 个任务与 HumEnv 的 45 个人形控制任务上平均优于 OLS、ZOL、ReLA 与 LoLA,且推理开销可忽略。作者提出 BLS:一种面向行为基础模型(BFM)的离线零样本任务推断方法,它先用最小二乘(OLS)得到任务向量,再用软间隔对比损失与信赖域损失联合优化该向量,以同时降低奖励重建误差与后继测度偏差;理论上给出由后继测度残差与奖励残差共同刻画的次优性上界,实验在 OGBench 的 5 种特征表示(本体感知与像素观测)、DMC 的 20 个任务与 HumEnv 的 45 个人形控制任务上平均优于 OLS、ZOL、ReLA 与 LoLA,且推理开销可忽略。BLS 在测试时精炼任务向量,使零样本策略在 OGBench、DMC 与 HumEnv 上超越 OLS 与在线自适应基线作者提出 BLS:一种面向行为基础模型(BFM)的离线零样本任务推断方法,它先用最小二乘(OLS)得到任务向量,再用软间隔对比损失与信赖域损失联合优化该向量,以同时降低奖励重建误差与后继测度偏差;理论上给出由后继测度残差与奖励残差共同刻画的次优性上界,实验在 OGBench 的 5 种特征表示(本体感知与像素观测)、DMC 的 20 个任务与 HumEnv 的 45 个人形控制任务上平均优于 OLS、ZOL、ReLA 与 LoLA,且推理开销可忽略。作者提出 BLS:一种面向行为基础模型(BFM)的离线零样本任务推断方法,它先用最小二乘(OLS)得到任务向量,再用软间隔对比损失与信赖域损失联合优化该向量,以同时降低奖励重建误差与后继测度偏差;理论上给出由后继测度残差与奖励残差共同刻画的次优性上界,实验在 OGBench 的 5 种特征表示(本体感知与像素观测)、DMC 的 20 个任务与 HumEnv 的 45 个人形控制任务上平均优于 OLS、ZOL、ReLA 与 LoLA,且推理开销可忽略。