跳到主要内容
返回时间线
arXiv来源发表:

闭环框架用LLM分析策略轨迹,自动修正结构化策略,模仿学习性能最高提升15%

核心概要

该工作提出一个闭环框架,将策略轨迹记录为语义化表格数据,并提示LLM生成诊断分析代码,从而在无需人工指令的情况下迭代识别并修正结构化策略中的次优结构;在赛车和开门任务上,模仿学习性能较零样本LLM生成结构最高提升15%,达到相同强化学习性能所需计算量减少75%。

Source-provided article image: Iterative Policy Refinement through Semantic Rollout Analysis
Figure 1 ·

Figure 1: Overview of policy refinement. 1. Generate the initial structure by querying an LLM with the task description. 2. Update parameters through imitation learning on the demonstrations. 3. Generate analysis code based on the desired behavior of the policy and its structure topology. 4. Collect tabular trajectories , recording observations, actions, and named latent values during policy rollouts. 5. Execute analyses and revise the structure based on the analysis results. The updated program returns to parameter fitting and another refinement cycle. 6. Reinforcement learning after the structure aligns with the demonstrations to go beyond the demonstration performance.

arXiv

深度剖析

提出闭环框架,通过LLM引导的轨迹分析迭代精炼结构化策略,无需人工指令即可自动修正策略结构中的次优性。 现有结构生成方法依赖大量人工输入或LLM中编码的静态领域知识,可能与专家演示不一致;该工作改用策略自身轨迹作为反馈信号。 在赛车和开门两个任务上实验,报告模仿学习性能较零样本LLM生成结构最高提升15%,达到相同强化学习性能所需计算量减少75%。

将策略轨迹记录为语义上有意义的表格数据,并提示LLM生成诊断分析代码,使表格轨迹分析成为对齐LLM生成策略结构与专家演示的有效反馈信号。 把轨迹日志转化为可被LLM诊断的表格形式,而非仅依赖静态领域知识或人工反馈。 摘要报告在赛车和开门任务上的实验结果显示该方法能自动生成良好的策略结构。

启示与展望

该框架面向需要结构化策略的模仿学习场景,适用于可记录为语义化表格轨迹的任务,如赛车和开门。它使研究者能够在无需人工指令的情况下自动迭代修正策略结构,并可能降低达到相同强化学习性能所需的计算量。结果适用于摘要所述的两个任务设置,更广泛的任务、机器人平台和真实环境中的适用性有待验证。

摘要未说明轨迹表格的具体字段、LLM诊断代码的生成与执行方式、迭代停止条件,也未报告样本量、随机种子或统计显著性。两个任务上的提升幅度是否在其他任务中复现、计算量减少的测量口径如何,仍是读者需要关注的问题。由于当前仅能获取摘要,无法核对图表和实验细节,上述内容应视为开放问题而非结论。

来源