跳到主要内容
返回时间线
arXiv来源发表:

AeroEval 用程序级与执行级分阶段验证,把 AI 生成无人机任务的成功率从 11/20 提升到 19/20

核心概要

AeroEval 是一种智能体辅助中间件,在 AI 生成无人机任务与真机执行之间做分阶段验证:先用确定性语法与平台 API 检查加意图校验智能体审查程序,再在物理仿真器中执行,并用数值轨迹比较或上下文接地智能体评估避障、高度、覆盖、朝向与事件驱动切换等行为属性,把结构化失败诊断回传给生成器迭代重生成;在 20 个导航任务上把成功数从 11 提升到 19,在五类分析任务上把聚合运行级成功率从 0.30 提升到 0.90。

Source-provided article image: AeroEval: Staged Program and Execution Validation for AI-Generated Drone Missions

((a))

arXiv

深度剖析

提出分阶段验证生命周期,把程序有效性、任务意图一致性与真实物理行为分开检查,并返回阶段专属反馈用于迭代重生成。 此前的无人机代码生成系统主要依赖提示词护栏或仿真结果,失败定位有限;AeroEval 明确区分程序结构、平台 API 使用、任务解释与真实物理行为四类失败来源。 设计层面给出各验证器返回 stage、outcome、violation、evidence、correction 五元记录,失败记录连同原始候选包回传生成器,重生成程序重新进入程序验证阶段。

为没有唯一参考轨迹的分析类任务开发上下文接地的行为验证:验证智能体结合任务需求、程序产物、机器人与世界描述以及执行观测,评估时空与事件驱动属性。 参考路径比较只能判断是否复现一条期望路径;该方法判断观测行为是否满足任务属性,从而支持存在多条合法轨迹的巡检、测绘与搜索跟踪任务。 智能体接收任务规范、生成程序、里程计元组序列、机器人约束(最大速度与高度、载荷、电池)和世界约束(障碍、道路网、飞行走廊、禁飞区、最大高度),直接由文本世界描述与执行轨迹推断属性,当前实现不使用独立几何辅助工具。

阶段互补性得到实测支持:仅代码验证器与仅轨迹验证器的平均运行级成功率分别为 0.50 与 0.60,二者组合达到 0.90。 说明程序级检查与执行级检查各自捕获不同失败类别,组合收益来自互补而非单一阶段更强。 在五类分析任务各 10 次独立运行、最多三轮重生成的共同预算下比较;12 个 Delivery、27 个 Farm Survey、64 个 Radio Tower Inspection 候选通过代码验证器却在轨迹验证器失败,量化了代码合法但行为不合法的候选规模。

端到端可靠性提升并在两个推理模型上复现:导航任务从 11/20 提升到 19/20,分析任务聚合运行级成功率从 0.30 提升到 0.90(o3-mini);Gemini-3.1-Pro 下 AeroGen 成功 9 次、AeroEval 成功 35 次,提升 52 个百分点。 相对闭环 CLG 基线与一次性 AeroGen,分阶段诊断把多数原本失败的任务转化为被接受的方案,代价是平均迭代次数增加。 导航任务使用 AirSim 与 15 次迭代预算,分析任务使用 Gazebo 与 15 次迭代预算;AeroEval 在 o3-mini 下成功 45 次、Gemini-3.1-Pro 下成功 35 次,两者置信区间重叠,因此结果支持分阶段验证在两个模型族上均有效,而非判定某一模型更可靠。

启示与展望

该工作面向在 AI 任务生成与无人机执行之间插入验证层的场景,适用于已有平台 API 元数据、机器人描述与可执行物理仿真的团队,例如无人机应用开发者、信息物理系统验证研究者与边缘分析部署方。方法在评估环境中把导航成功数从 11/20 提升到 19/20,把分析任务聚合运行级成功率从 0.30 提升到 0.90,并在 DJI Ryze Tello 上以约 50 米半径开阔场地、每类任务一次受监督运行的方式验证了 Delivery、Farm Survey 与 Search and Track 三类任务可迁移执行。支持另一种编程语言只需替换解析器与平台 API 元数据,验证智能体的接口不变。可选的部署顾问在构造的资源竞争下给出分析放置或航点调度建议,但不决定任务是否被接受。

轨迹验证器在 15 条专家标注结果(12 条专家拒绝、3 条专家接受)上出现 3 次误接受、0 次误拒绝,作者据此说明上下文接地智能体不能作为独立保证机制;该标注集规模小且类别不平衡,因此只报告原始跨模型一致率而不解释经过机会校正的系数。每类分析任务仅 10 次运行,逐任务置信区间较宽。生成与验证默认使用同一模型,可能保留相关误差。真机实验仅一个平台、有限任务与环境条件,且因 Tello 电池限制缩小了轨迹范围与飞行距离,不构成通用仿真到现实迁移或安全性结论。验证开销与成本随任务和模型变化,Radio Tower Inspection 的收敛运行端到端时长可达小时量级。若读者需要精确的逐任务成功率、置信区间数值与成本表,应查阅原文图表与表格,因为快速解析可能缺失这些细节。

来源