跳到主要内容
返回时间线
arXiv来源发表:

ICDP用对比密度比估计约束交互分布偏移,在nuPlan闭环与实车卡车上抑制高价值但交互不支持的轨迹

核心概要

该工作提出ICDP,一种离线强化学习框架:它把自我车辆与周围智能体联合支持度的退化精确分解为自我轨迹支持项与残差交互支持项,并用对比密度比估计恢复后者,从而在不建模联合密度、不预测周围智能体、不做反应式仿真或世界模型推演的前提下约束策略改进;在nuPlan、InterPlan闭环评测与真实卡车实验中,ICDP抑制了高价值但交互不支持的轨迹选择,并在交互关键场景中提升表现。

Source-provided article image: Beyond Policy Support: Interaction Constrained Offline Reinforcement Learning for Autonomous Driving
Figure 1 ·

Figure 1: Overview of ICDP . The logged scene is encoded into structured scene features used by the diffusion actor and critic. The actor generates candidate ego trajectories, which are evaluated by a pessimistic chunk-level critic and by the interaction-support module. The latter combines a joint ego–agent classifier with an ego-only classifier; their residual score isolates interaction-specific support and yields the IDS estimate used to constrain policy improvement.

arXiv

深度剖析

论文识别并形式化了交互分布偏移(IDS):在交互式离线强化学习中,一条自我轨迹可以在边缘行为分布下支持良好,却在与日志中周围智能体演化联合配对时支持不足。 既有离线强化学习主要在策略自身动作空间内控制分布偏移,例如保守价值估计、样本内学习或向行为分布的正则化;该工作指出这类机制无法刻画联合交互支持,并把IDS作为独立于自我边缘支持的一类偏移单独提出。 该识别以条件分解的推导为支撑:由条件分解,联合支持退化被精确写成自我边缘支持项与残差交互支持项之和,从而在形式上把IDS与自我轨迹偏移区分开。

论文给出对比密度比估计器,其残差交互分数在总体最优条件下精确恢复IDS,并把它与分块级价值学习和扩散策略优化整合进ICDP。 恢复IDS不需要显式估计高维联合轨迹密度、不需要预测周围智能体未来,也不需要在策略优化期间做反应式仿真器或学习世界模型推演;关键在于两个对比目标共用同一批策略生成候选轨迹,使边缘自我偏移项在相减时抵消。 该结论以定理形式给出:在平衡类别采样与共同支撑下,联合分类器与自我分类器的总体最优logit之差,在保持同一日志周围智能体轨迹时精确等于IDS;附录给出证明,并说明共用候选分布对抵消的必要性。此外,IDS的期望被解释为日志与候选自我轨迹所对应条件交互分布之间的散度。

在nuPlan闭环基准上,ICDP在Val14、Test14-Hard与Test14-Random的非反应式与反应式评测中均取得所报告的最强表现,例如Test14-Hard非反应式78.34、反应式72.87,Test14-Random非反应式93.33、反应式86.34。 与PDM-Open、GameFormer、PlanTF、PLUTO、Diffusion Planner、Flow Planner等代表性规划器在同一nuPlan基准上比较,ICDP在全部评测中领先;在反应式评测中增益仍保持,而该设置下周围智能体会对自我车辆作出响应,交互质量尤为关键。 证据来自同一基准上的闭环评测表格,并尽量采用不含规则式轨迹精修的变体以直接比较学习策略;在受控骨干与相同训练数据下,交互约束在六种设置中的五种取得最强表现,相对无约束离线强化学习把Test14-Hard反应式分数与Test14-Random反应式分数进一步提升。

消融显示自我支持正则与交互支持正则都存在中等强度最优的模式,交互支持估计器使用足够多的周围智能体上下文有益,继续扩大则收益有限;真实卡车实验提供交互与常规驾驶的定性可行性证据。 这些分析把交互约束的作用与正则强度、多智能体上下文规模联系起来,并给出仿真之外的部署观察,而不仅是单一基准分数。 正则敏感性以跨Test14-Hard与Test14-Random的平均闭环分数呈现,自我支持正则从较低值提升后随权重继续增大而下降,交互正则同样表现为中等取值优于更弱与更强;周围智能体数量增加时性能持续改善,继续扩大后平均表现小幅下降。真实实验在积雪测试跑道上覆盖多车交互(超车与前车跟随)与弯道单车行驶,作者将其定位为定性证据。

启示与展望

该结果面向仅从固定驾驶日志改进自我策略的离线设定,周围交通被视为日志中的环境演化而非被预测或联合优化;交互支持估计器在最终配置中使用有限数量的周围智能体轨迹,正则强度也需在自我支持与交互支持之间取中等取值。对读者而言,这提供了一条在无仿真器交互、无世界模型推演条件下约束交互级分布偏移的路径,适用于拥有含周围智能体未来交互日志、并希望以奖励驱动方式超越示范行为的安全关键规划团队;真实卡车实验在积雪测试跑道上覆盖多车交互与弯道单车行驶,作者将其定位为定性可行性证据。作者提出的下一步是把ICDP扩展到在线强化学习,在保留交互感知支持控制的同时从闭环交互中继续精炼行为。

读者仍需关注:IDS的精确恢复依赖总体最优、平衡类别采样与共同支撑等条件,实际学习到的分类器与这些条件之间的差距会影响约束的可靠性;交互支持估计器使用多少周围智能体上下文、正则权重取何值,在报告中被描述为经验上中等取值最优,其在不同数据分布与场景构成下的稳定性仍是开放问题。真实世界部分为定性证据,定量实车表现、不同天气与传感器条件下的行为,以及从离线扩展到在线强化学习后的支持控制效果,都还有待进一步观察。此外,正文中若干公式与表格数值在解析文本中未完整呈现,若需精确复现实验配置与逐项分数,应查阅原文附录与图表。

来源