跳到主要内容
返回时间线
arXiv来源发表:

WebArxiv 用 510 个静态快照任务评测网页智能体,发现其依赖固定交互历史并引入动态记忆机制

核心概要

该工作提出 WebArxiv——一个基于 arXiv 静态快照、包含 510 个时间不变任务且每个任务有唯一确定性真值的基准,用于评测多模态网页智能体在学术检索、细粒度内容抽取与跨论文比较等任务上的表现;对多种基于基础模型的网页智能体的评测显示该基准仍具挑战性,行为分析发现智能体过度依赖固定交互历史,导致推理不完整或重复,作者因此为智能体加入轻量级动态记忆机制以支持对相关上下文的自适应检索与推理。

Source-provided article image: WebArxiv: A Reproducible Benchmark for Evaluating Multimodal Web Agents on arXiv Tasks
Figure 1 ·

Figure 1: WebArxiv construction pipeline. Seed tasks are expanded, similarity-filtered, manually reviewed, and expert cross-validated.

arXiv

深度剖析

提出 WebArxiv 基准:基于 arXiv 静态快照构建,包含 510 个时间不变任务,每个任务具有唯一的确定性真值。 相对于偏重通用浏览、且常依赖内容与结构不断变化的实时网站的既有基准,该工作把评测环境放在研究导向的学术发现工作流上,并用静态快照保证可复现性。 文本明确给出任务数量 510、静态快照形式、时间不变与唯一确定性真值等设计属性,并说明 arXiv 是真实、可复现、层级化、以信息为中心且不涉及隐私敏感交互的测试环境。

任务设计超越简单信息查找与规则遵循,强调多约束论文检索、细粒度内容抽取和跨论文比较。 把学术发现中的复合约束与跨文档比较纳入评测任务,而非停留在通用浏览或单点信息定位。 文本以任务类型描述支撑该主张,未给出各任务类型的数量分布或难度分级。

对多种基于基础模型的网页智能体的评测显示 WebArxiv 仍具挑战性;行为分析发现智能体过度依赖固定交互历史,造成推理不完整或重复。 在基准评测之外补充了行为层面的诊断,把性能不足与具体的交互历史依赖模式联系起来。 文本报告了评测结果与行为分析结论,但未给出具体分数、模型清单或样本规模。

为智能体配备轻量级动态记忆机制,用于对相关上下文进行自适应检索与推理。 针对上述固定交互历史的依赖问题提出对应机制,而非仅停留在基准与诊断层面。 文本说明该机制的性质为轻量级、目标是自适应检索与推理,未报告其带来的具体提升幅度。

启示与展望

该基准面向研究导向的学术发现工作流,适用于在 arXiv 这类层级化、以信息为中心且不涉及隐私敏感交互的静态快照环境中评测多模态网页智能体;其时间不变任务与唯一确定性真值的设计,使结果可在不随实时网站变化而漂移的条件下被复现和比较。动态记忆机制面向需要自适应检索与推理的智能体,供研究者在同类学术检索与跨论文比较任务上继续实验。

文本为摘要级材料,未给出各任务类型的数量分布、参与评测的模型清单、具体得分、动态记忆机制带来的提升幅度,也未说明真值的构造与校验流程;因此读者仍需在原文中确认这些细节。此外,动态记忆机制是否在其他站点或非学术任务上同样有效,文本未作说明,属于可继续观察的开放问题。

来源