跳到主要内容
返回时间线
arXiv来源发表:

Qwen-Planner-Agent 在 MobilePA-Bench 上取得所有被评估模型与系统中的最佳总体表现,并在工具使用、记忆、技能与子智能体协同上超越其基座模型

核心概要

该工作构建了闭环 AI-for-AI 框架下的 Qwen-Planner-Agent,通过共享的“动作—反馈—验证”契约把数据生产、模型训练与部署串联起来:AI for Data 建立人工把关的智能体数据飞轮,AI for Training 结合监督式规划冷启动与混合环境在线智能体强化学习并提出 CARE 以降低推理与工具使用成本,AI 驱动模型与运行框架协同演化;结果显示该智能体在 MobilePA-Bench 上取得所有被评估模型与系统中的最佳总体表现,并在工具使用、记忆、技能与子智能体协同方面优于其基座模型,同时在非移动智能体基准上有所提升且大体保持通用能力。

Source-provided article image: Qwen-Planner-Agent: A Closed-Loop AI-for-AI Framework for Real-World Mobile Planner Agents
Figure 2 ·

Figure 2 : AI-for-AI lifecycle of Qwen-Planner-Agent, comprising three interconnected phases. (i) AI for Data combines AI-assisted task generation with automated trajectory collection and curation, using model feedback to refine subsequent tasks and training-data composition. (ii) AI for Training combines planning-oriented cold-start training with hybrid-environment online reinforcement learning, while CARE adapts reward scheduling and advantage signals to the model’s evolving competence. (iii) AI for Harness equips the planner with a unified Harness that manages Skills, persistent Memory, and execution feedback, while AI-assisted diagnosis guides subsequent model and Harness refinement and feeds new requirements back into data production and training.

arXiv

深度剖析

提出并实现了闭环 AI-for-AI 框架,用共享的“动作—反馈—验证”契约把数据生产、模型训练与部署连接为一个可迭代的整体。 以往 AI 开发流程中数据、训练与部署往往彼此分离,该工作把三者纳入同一契约之下,使训练反馈能够回流指导后续数据生成。 摘要层面描述了框架的三个组成部分及其连接机制,未给出各组件的独立消融或量化对比。

AI for Data 构建了人工把关的智能体数据飞轮,由专门智能体构造任务、采集交互轨迹、筛选与平衡训练数据,并用训练反馈引导后续数据生成。 把数据生产本身交给智能体并以训练反馈闭环驱动,而非依赖一次性静态数据集。 摘要说明了飞轮的构成与反馈路径,未提供数据规模、筛选标准或人工把关比例等细节。

AI for Training 将监督式规划冷启动与混合环境在线智能体强化学习结合,并提出 Competence-Aware Reward-and-Advantage Engineering(CARE),在保持任务表现的同时降低推理与工具使用成本。 CARE 针对推理与工具使用成本进行奖励与优势设计,区别于仅以任务成功率为目标的训练方式。 摘要给出方法定位与目标,未报告成本下降幅度或任务表现的量化数值。

AI 驱动模型与运行框架协同演化,通过执行证据驱动的循环在运行时编排记忆、技能与工具,并把结构化动作反馈与保留的失败轨迹回流到模型与框架的协同适配中。 把失败轨迹作为可复用证据纳入模型与运行框架的联合改进,而非仅优化模型权重。 摘要描述了循环机制与回流内容,未给出协同演化的迭代次数或对照实验。

启示与展望

该工作面向真实世界移动规划智能体这一设定,适用于需要长时程任务规划、工具调用、记忆与子智能体协同的移动场景,并以 MobilePA-Bench 作为主要评测载体。其框架设计也面向希望把数据生产、训练与部署打通为闭环的智能体开发团队,摘要提到在非移动智能体基准上同样观察到提升,说明该路径可能被用于更广泛的智能体开发流程。

当前可获取的是摘要层面的信息,未包含具体评测数值、样本规模、消融实验与统计细节,因此“最佳总体表现”与“降低推理与工具使用成本”的具体幅度无法从现有文本判断。CARE 中“能力感知”的具体定义、人工把关在数据飞轮中的介入方式、以及模型与运行框架协同演化的迭代机制,均属于需要阅读原文方法部分才能确认的开放问题。

来源