跳到主要内容
返回时间线
arXiv来源发表:

有限深度策略敏感度:截断导数传播即可预测交互智能体行为变化下的策略调整

相关研究与后续进展

核心概要

该工作提出有限深度框架,用参考环境信息近似策略Hessian与混合导数来估计策略敏感度,其可调传播深度决定沿轨迹截断导数传播的位置;作者刻画了被截断的导数贡献并给出截断误差界,证明该界随深度非增且在全时域传播时消失,并在信念驱动的追逃博弈中验证:随深度增加导数估计误差总体下降,估计精度与策略适应优于基线,基于敏感度的初始化相对直接迁移提升了零样本回报并在后续微调中显示优势。

Source-provided article image: Adapting to Changes in Agent Behavior via Finite-Depth Policy Sensitivity
Fig. 1 ·

Fig. 1: Adaptation to changes in an interactive agent’s behavior by finite-depth policy sensitivity estimation.

arXiv

深度剖析

提出有限深度敏感度估计方法,通过结合状态采样与局部状态转移传播,构造策略Hessian与混合导数的Bellman导数分解及有限深度近似,传播深度可调。 既有路线要么依赖完整轨迹采样(样本需求大),要么依赖全时域模型导数传播(计算昂贵);该方法在两者之间取折中,只采样初始状态并用转移核与Bellman递推计算条件期望。 论文给出方法推导与Lemma 1的精确分解,并在追逃博弈小规模实例上以谱范数相对误差评估,显示估计对初始状态样本数相对不敏感。

给出截断误差保证:刻画有限深度传播遗漏的导数贡献,推导近似导数与所得策略敏感度的误差界,界随传播深度非增并在全时域传播时消失。 此前工作多关注策略Hessian的计算或近似,较少对因截断导数传播而产生的结构性误差给出显式界;该工作量化了深度与精度的权衡。 在Assumption 2的一致导数界下,Theorem 1给出误差界并证明其非增性与消失性,证明通过展开截断Bellman递推并计数被遗漏的导数项完成。

在信念驱动的追逃博弈中验证:随传播深度增加导数估计误差总体下降,方法在估计精度与策略适应上优于基线,基于敏感度的初始化提升零样本回报并有利于后续微调。 与轨迹似然比估计器相比,在相同样本量下该方法所需采样数据显著更少;在若干深度设置下持续取得更低误差。 小规模网格用于精确基准评估估计精度,大规模网格用于评估零样本回报与微调;六次迁移中敏感度初始化相对直接迁移提升零样本平均回报,优势在部分情形下于微调中保持、在另一些情形下随两者适应而收窄。

启示与展望

该框架面向单一参考环境中已获得局部最优策略、且交互智能体行为参数发生小幅变化的适应场景,适用于交互结构已知或可从数据辨识、因而可获得参考转移核及其对行为参数导数的系统。它使实践者能够用可调传播深度在模型导数传播成本与近似精度之间取舍,并以敏感度作为目标环境初始化的第一阶修正,从而在零样本回报与后续微调上获得起点优势。

当前分析假设可访问参考转移核及其对行为参数的导数,并将边界值估计视为与参数无关,因而截断了值函数导数传播;采样误差与值函数近似误差未纳入理论界,仅在实验中考察。未来工作拟放宽模型信息要求、把采样与值函数近似误差纳入分析,并估计边界值导数以实现策略与评论家的联合适应。此外,验证集中在单一追逃博弈场景,向其他交互结构与更大行为参数变化的推广仍是开放问题。

来源