EgoTools 用 100 小时第一人称工具使用视频与 1000 题基准,测出视频模型在工具感知与因果推理上的短板
核心概要
该工作提出 EgoTools 套件,包含约 100 小时、覆盖厨房、教室、研究实验室、维修车间、手工艺、办公室与家庭七个领域的工具中心第一人称视频语料 EgoTools-Data(含同步音频、361,332 条分层字幕、6,519 条工具中心叙述与补充 3D 信息),以及由 900 道人工编写题与 100 道人工核验空间题组成的 1,000 题八选一诊断基准 EgoTools-Bench(分 Affordance & Causality、Perception & Grounding、Procedural Dynamics、Spatial Reasoning 四轨),评测显示 Gemini-3.1-Pro 总体 66.9% 但 Perception & G
深度剖析
EgoTools 把「工具」确立为第一人称视频理解的中心解释单元,并给出配套的数据与诊断基准。 既有第一人称数据集与基准多围绕活动、物体、事件或计划组织,动作常被标注为「cook eggs」这类活动级标签,而中介该活动的锅铲与锅并不出现在标注中;EgoTools-Data 则以工具中心叙述显式记录工具选择、替代、目标物状态变化与因果效果,EgoTools-Bench 则把工具中介推理单独隔离出来评测。 语料为 646 段视频、100.37 小时,含 361,332 条分层字幕与 6,519 条工具中心叙述;基准为 1,000 题八选一(900 人工编写 + 100 人工核验空间题),四轨题量分别为 363、236、222、179,平均每题时间跨度 4.19 分钟。
基准暴露出当前多模态视频模型在把工具使用落到视觉证据上的困难,且这一困难不是单一架构的孤立弱点。 在 EgoSchema、EgoThink 等既有第一人称基准上表现较好的模型,在 EgoTools-Bench 上明显回落,说明宽泛的第一人称活动理解并不自动带来工具使用推理能力。 八选一随机水平为 12.5%;开源指令模型总体 38.9%–50.0%,最强为 Qwen3-VL-8B-Instruct 50.0%;开源思考模型中 GLM4.1V-Thinking 最高 50.7%;Gemini-3.1-Pro 总体 66.9%,但 Perception & Grounding 仅 51.7%,比其 AC、PD、SR 低 18–23 点;人类专家总体 83.2%。
EgoTools-Data 不只是造题的中间产物,而是可用的训练监督,能部分缩小工具中心推理差距。 在源视频级别严格分离训练池与基准池的前提下,用非基准部分派生的 184,679 条指令样本做单阶段全参数监督微调,仍能在留出的工具使用片段上取得提升,说明增益来自泛化而非记忆基准片段。 Qwen3-VL-8B-Instruct 从 50.0% 提升到 60.9%(+10.9 点),其中 Affordance & Causality +9.3、Perception & Grounding +13.8、Procedural Dynamics +11.0,Spatial Reasoning 下降 11.0 点;同一模型在 EgoSchema 上为 67.6%,比骨干的 69.0% 低 1.4 点。
输入消融把四条评测轨道的诊断角色区分开来:感知接地依赖视觉证据,程序动态依赖时间顺序,空间推理依赖多帧覆盖。 通过有序 64 帧、打乱 64 帧、单中间帧与纯文本四种条件的对照,把「需要视觉」「需要顺序」「需要多帧」三类需求分别归因到不同轨道,而不是笼统地说模型需要视频。 有序 64 帧总体 51.7%,纯文本 42.7%(相差 9.0 点,纯文本仍高于 12.5% 随机水平);单中间帧降至 46.9%,其中 Spatial Reasoning 相差 11.9 点;打乱帧降至 49.3%,Procedural Dynamics 对顺序最敏感(相差 3.2 点),Spatial Reasoning 仅相差 1.1 点。
启示与展望
该工作面向需要理解工具中介动作的研究者与系统开发者,适用于第一人称视频中工具选择、替代、操作顺序与目标物状态变化的问答与训练场景。EgoTools-Data 覆盖厨房、教室、研究实验室、维修车间、手工艺、办公室与家庭七个领域,可用于构建指令微调语料;EgoTools-Bench 用于诊断评测,四轨分别对应感知接地、程序动态、空间关系与可供性因果。作者明确基准以厨房题为主、不应作为领域均衡评测,因此领域级结论应谨慎使用;公开释放以研究用途为限,包含矫正后的第一人称视频、分层字幕、校正英文叙述、全部 1,000 题及评测标注、片段元数据与源视频级划分信息,原始鱼眼视频不公开,叙述音频、部分接地标注与 3D 轨迹资产按授权与隐私审查逐步释放。
基准领域分布高度长尾,厨房题占多数,因此按领域切分的比较会不稳定,作者也据此把主要分析放在推理能力而非领域表现上。微调后 Spatial Reasoning 下降 11.0 点,说明当前训练配方下空间推理仍是开放问题;EgoPlan-Bench 上 35.2% 低于骨干 42.3%,作者也说明训练子集与这些基准的答案格式相近,因此不能把格式覆盖与其他微调效应分开。纯文本输入仍达 42.7%,高于 12.5% 随机水平,提示部分题目仍存在可利用的常识或选项线索。此外,模型变体在训练与输入预算上并不一致,无法据此隔离规模、音频或思考式推理的单独作用;数据收集未寻求正式机构伦理审查,作者以知情同意、匿名化与释放审查作为替代保障。
