Ego2World 将第一视角烹饪视频编译为可执行规划环境,六种规划器在 105 项任务上常出现操作被接受但目标未达成
相关研究与后续进展核心概要
作者提出 Ego2World 基准,把带标注的烹饪活动编译成部分可观测下的可执行规划环境,将源步骤与物体链接到符号动作规则、持久世界状态和显式任务条件,并分开维护世界状态与智能体信念;在 105 项任务上评估六种规划器发现被接受的操作常未达成任务目标,执行轨迹与条件检查可区分中断、部分达成与执行完成但未达成目标;另一项配对 Qwen-Plus 研究中,持久信念使动作有效性提高 4.15 个百分点、视觉查询尝试减少 90.27%,但 token 用量更高且未检测到完成度提升。
Figure 1: From activity evidence to interactive evaluation. The upper panel illustrates construction: its hidden graph G h G_{h} is denoted G w G^{\mathrm{w}} in the text, and skills correspond to action groups. The lower schematic shows how agents use the compiled environment. Source links, action records, and task checks make decisions inspectable; Table 1 follows a real task through these stages.
arXiv深度剖析
Ego2World 把带标注的烹饪活动编译为部分可观测下的可执行规划环境,其编译器将源步骤与物体链接到符号动作规则、持久世界状态和显式任务条件,使研究者可以执行智能体提出的动作并检查其结果。 相对于仅记录人类活动的第一视角视频数据,该工作把录制的人类活动转化为可执行、可检验结果的规划环境,从而支持对智能体自选动作后果的评估。 摘要说明该基准由编译器、符号动作规则、持久世界状态与显式任务条件构成,并支持执行智能体提出的动作并检查结果;具体编译细节与数据规模未在摘要中给出。
世界状态与智能体信念被分开维护,从而支持对规划与信息复用进行受控研究,并可跨连续任务考察。 将世界状态与信念分离,使研究者能够单独考察智能体对环境的认知与真实状态之间的差异,而不仅是最终任务成败。 摘要明确说明二者分开维护并用于受控研究;具体分离机制与实验设计细节未在摘要中展开。
在 105 项任务上评估六种规划器,结果显示被接受的操作常常未能达成任务目标;执行轨迹与条件检查可区分中断的运行、部分达成以及执行完成但未达成目标。 该结果把评估重点从操作是否被接受推进到目标是否真正达成,并提供区分不同失败形态的轨迹与条件检查手段。 摘要报告了六种规划器、105 项任务以及三类可区分情形;各规划器的具体数值与统计比较未在摘要中给出。
在另一项配对 Qwen-Plus 研究中,持久信念使动作有效性提高 4.15 个百分点,视觉查询尝试减少 90.27%,同时 token 用量更高,且未检测到完成度提升。 该配对研究把持久信念对动作有效性与观察需求的影响分开量化,显示有效性提升与视觉查询减少并不自动转化为任务完成度提升。 摘要给出配对研究的具体百分比变化,并明确说明 token 用量更高与未检测到完成度增益;样本规模与统计检验细节未在摘要中给出。
启示与展望
该工作面向需要评估智能体自选动作后果的研究者,适用于部分可观测下的连续任务规划与信息复用研究,尤其是第一视角烹饪活动这一类带标注的日常活动。其可执行环境、符号动作规则、持久世界状态与显式任务条件,使研究者能够执行智能体提出的动作并检查结果,并通过执行轨迹与条件检查区分中断、部分达成与执行完成但未达成目标。配对 Qwen-Plus 研究进一步说明,持久信念在提高动作有效性与减少视觉查询尝试的同时会带来更高 token 用量,因此该测试平台适合用于考察规划与记忆选择对执行、观察需求与任务达成的影响。
摘要未说明编译器的具体实现、任务条件的定义方式、105 项任务的构成与难度分布,也未给出六种规划器的分项结果与统计检验。配对 Qwen-Plus 研究的样本规模、配对方式与 token 用量增幅同样未在摘要中给出。此外,摘要提到未检测到完成度提升,但未说明该结论的检验方式与置信程度。由于本次阅读范围仅为摘要,上述细节需在原文中进一步确认。
