哪个大语言模型最擅长把自然语言目标翻译成 PDDL
核心概要
本文设计了一个经过迭代优化的提示模板,让六个当代大语言模型把视频游戏测试人员用非正式语言写成的测试目标翻译为经典规划所需的 PDDL 目标,并在 90 条自然语言目标(45 条可表达、45 条不可表达,覆盖 8 个领域)上系统评估其正确率、响应速度与错误倾向,结果显示所有模型正确率均超过 92%,其中 Gemini 2.5 Flash 正确率最高达 96% 且假阳性最少,GPT-4.1 响应最快。
Figure 2: Comparative Prompt Response Time Analysis of Large Language Models (LLMs). Each line represents a distinct LLM, plotting its prompt response time (y-axis) against the problem index (x-axis) after sorting all prompts by increasing runtime for that model.
arXiv深度剖析
提出并公开了一个完整的提示模板,把 PDDL 领域文件、对象及其类型清单、以及自然语言目标填入占位符,并要求模型在目标无法表达时以“Goal cannot be expressed”开头给出简短解释。 与以往把完整 problem.pddl 塞进提示的做法不同,该模板只保留必要的对象定义,并加入不可表达情形的示例和“简洁作答”的指令。 模板以图 1 完整呈现,其设计依据来自作者自述的迭代实验:去掉完整问题文件、加入不可表达示例、要求简洁表达这三项修改分别对应观察到的准确率下降、假阳性偏多和生成目标过于复杂且常出错。
在 90 条真实风格的自然语言测试目标上,六个模型(OpenAI GPT-4.1、OpenAI o3、Gemini 2.5 Pro、Gemini 2.5 Flash、Claude Opus 4、Claude Sonnet 4)的正确率全部超过 92%。 此前工作多关注用大语言模型生成计划或获取领域模型,本文把评估聚焦在“目标翻译”这一环节,并同时覆盖可表达与不可表达两类目标。 基准共 90 条目标,45 条可表达、45 条不可表达,覆盖 Rovers、Barman、Woodworking、Parking 四个 IPC 领域和四个受电子游戏启发的领域;可表达目标先与参考 PDDL 精确匹配,未匹配的由 PDDL 专家人工复核,不可表达目标则自动判定。
模型之间存在可操作的差异:Gemini 2.5 Flash 正确率最高(96%)且假阳性最少(2 次),GPT-4.1 平均响应时间最短(1.61),而 Gemini 2.5 Pro 虽然正确率 94% 但平均响应时间最长(15.83)。 这些差异说明“选哪个模型”取决于流水线更看重准确率还是延迟,而不是所有模型可以互换。 表 1 给出每个模型的正确率、平均提示响应时间、假阳性数、假阴性数和语法无效响应数;全部评估中仅出现一次语法无效响应。
剩余失败主要来自语言歧义和领域表示能力的限制,作者据此提出后续方向包括扩大评估数据集、改进提示工程、以及引入对话澄清与错误恢复的反馈回路。 这把“翻译”定位为需要交互与纠错的持续过程,而不是一次性映射。 结论部分明确列出这三项下一步工作,并指出部分失败源于语言固有歧义,另一些源于模型解析细微领域逻辑或处理形式化无法跟上人类创造力的边界情形。
启示与展望
这项工作针对的是经典 STRIPS 规划(含数值流)下的目标翻译,输入包含 PDDL 领域模型、对象及其类型清单和自然语言目标,初始状态可从游戏中直接提取,因此领域模型仍由专家一次性构建和维护。它适用于希望把测试目标自动转为 PDDL 目标的游戏测试流水线,也为其他“自然语言到形式化目标”的场景提供参考;评估覆盖 8 个领域、90 条目标,其中 45 条可表达、45 条不可表达。
读者仍会关心:不可表达目标的判定是自动完成的,且未对模型给出的自然语言解释质量或细节做人工检查,因此“正确拒绝”的语义质量尚不清楚;可表达目标中未与参考精确匹配的部分依赖单个 PDDL 专家的人工复核;评估对每个基准只使用一次提示,未报告重复运行的稳定性,而文中也提到即使温度为零,批大小相关的数值效应和非批不变内核也可能导致同一模型重复运行结果不同;此外,目标由公司内部员工众包撰写,其分布与真实测试团队的目标分布是否一致仍是开放问题。
