跳到主要内容
返回时间线
arXiv来源发表:

WAND:用TCN估计风扰并同时驱动策略与前馈补偿,四旋翼在12种风扰仿真设置中成功率平均提升8.3个百分点,室内风扇测试20次成功18次

核心概要

本文提出WAND,一个面向密集障碍与时变风扰的四旋翼强化学习导航框架:它用时间卷积网络(TCN)从历史本体感知状态估计风致扰动加速度,经零初始化残差模块WindAdapter注入策略,同时复用该估计做底层前馈补偿;在12种风扰仿真设置中,其观测成功率相对仅用前馈补偿平均提升8.3个百分点,室内风扇扰动飞行测试20次成功18次。

Source-provided article image: WAND: Learning Robust Navigation under Complex Wind Disturbances and Dense Obstacles for Quadrotors
Fig. 1 ·

Fig. 1 : Real-world deployment of WAND. (a) A quadrotor navigates a cluttered indoor scene under fan-induced airflow; the inset shows an anemometer reading of approximately 7.2 ​ m / s 7.2\,\mathrm{m/s} . (b) The corresponding visualization in RViz.

arXiv

深度剖析

WAND把风扰估计同时用于策略条件化与底层前馈补偿,使导航动作显式依赖风扰估计,而非仅靠障碍感知与本体感知隐式推断时变气动效应。 既有学习式导航策略主要条件化于障碍感知与本体感知,风扰需被隐式推断;WAND以监督方式估计风致扰动加速度,使条件化信号具有物理解释性,并将其与障碍感知、当前本体状态融合。 方法层面给出扰动加速度定义(式6)与因果TCN结构(三个残差因果块、核大小与膨胀率、左填充保证不访问未来测量),并在仿真与真实飞行中验证。

TCN扰动估计器在四类风况下RMSE均低于EKF与LSTM,包括未参与训练、验证与模型选择的留出混合风数据集。 此前风/外力估计多依赖本体或视觉惯性测量与自适应控制;这里以同一监督目标(仿真施加气动力除以质量)训练因果TCN,并在Gazebo与Isaac Sim间零重训迁移、PPO训练期间冻结。 表I给出Constant/Turbulent/Gust/Mixed四列RMSE,TCN分别为0.0777、0.1876、0.1159、0.1970,均低于EKF与LSTM;混合风为单独生成的留出评估集。

消融显示零初始化WindAdapter与方向性间隙奖励项互补:单独使用零初始化或随机初始化均未明显优于Base+Comp,二者结合才带来后期到达目标率的明显提升。 该奖励项将估计扰动方向与LiDAR方向性间隙耦合,使安全裕度随估计扰动幅值与方向自适应;零初始化使风条件残差在联合训练中渐进引入。 六种配置共享相同环境随机化与PPO设置,对比No Wind、Base、Base+Comp、w/o r_c、Random Init与WAND的训练曲线(图4)。

在固定障碍布局的对向侧风实验中,WAND在两种风向下20次试验全部成功,而Base+Comp成功率分别为60%与0%,且轨迹随风向反向偏移到中央障碍簇另一侧。 这提供了超出前馈补偿的扰动条件化导航证据:策略不仅补偿扰动,还按风向改变绕行路线与安全裕度。 表II报告S/C/T与最小障碍间隙,每条件20次试验;在某一风向下WAND还提高了成功试验的平均最小间隙。

启示与展望

该工作面向密集障碍、时变风扰下的微小型四旋翼导航,适用于仿真中空间均匀的常值、湍流、阵风与混合风剖面,以及室内风扇诱导气流的受控场景;策略从仿真直接迁移,估计器用约10分钟真实飞行数据微调,整套模型约34万参数、机载30 Hz运行,说明其目标设定是SWaP受限平台上的实时机载部署。对读者而言,这提供了把显式扰动估计同时接入策略与底层控制的参考设计,可用于需要风扰自适应安全裕度的自主飞行任务。

风剖面在仿真中为空间均匀,未建模障碍诱导的尾流与回流,作者也将空间变化风场的系统评估列为未来工作;真实实验为室内风扇诱导气流、每场景10次试验,风扰强度与空间结构受限。估计器仅捕捉飞行器当前位置的扰动,真实部署中未做显式延迟补偿,也未对加速度输出做数值微分或额外滤波。此外,部分公式、奖励权重与间隙数值在文本中以占位形式呈现,若需精确复现应查阅原文图表与公式。

来源