ReFract 基准:同一提问因用户角色不同而需不同行动,顶尖 LLM 最多解出 69% 且过半轨迹出现越权操作
相关研究与后续进展核心概要
作者提出 ReFract——一个含 150 条专家验证条目的基准,用文本世界模型模拟工业维护与设备故障排查环境,要求智能体对同一查询依据用户角色采取不同行动;结果显示最先进 LLM 最多解出 69% 的任务,且超过 50% 的轨迹包含违反角色权限的操作尝试。
Figure 1 : Different roles asking the same query pursue different goals . A perspective-aware LLM agent ought to infer the goal of the given role and take actions admissible inside the role’s capability and knowledge boundary. In cases where the role does not have the remit to accomplish the goal, the agent must identify capable roles and route the work accordingly.
arXiv深度剖析
论文提出并命名了“视角感知”(Perspective Awareness)这一能力:智能体需推断某角色意图,并只通过该角色可合法使用的工具行动。 既有基准大多忽略了对角色意图的推断与工具权限约束,本文把这一维度单独提出并作为评测对象。 该能力定义与动机来自摘要中对工业维护、设备故障排查等高风险场景的论述,属于概念性贡献,未给出量化验证。
作者构建了 ReFract 基准,包含 150 条经专家验证的条目,其核心设计是同一查询在不同用户角色下要求智能体采取不同行动。 条目取材于领域支持对话中的匿名化查询,并据此构建文本世界模型来模拟智能体运行环境、组装视角感知的行动轨迹。 摘要明确给出条目数量(150)与“专家验证”这一来源说明,以及文本世界模型与轨迹组装的方法描述;未报告条目分布或标注一致性细节。
在最先进 LLM 上,最多仅解出 69% 的任务,且超过 50% 的轨迹包含尝试采取违反角色权限的操作。 这一结果把视角感知呈现为一个独立且大体未解决的智能体评测维度,而非已被现有基准覆盖的能力。 摘要报告了任务解决率上限与越权轨迹比例两项量化指标,但未说明参与评测的具体模型清单、评测次数或统计不确定性。
启示与展望
该工作面向需要在角色权限边界内行动的 LLM 智能体,适用于工业维护、设备故障排查等行动会作用于物理设备的高风险场景;其评测载体是文本世界模型,因此结论适用于文本模拟环境中的角色校准能力评估。对构建角色感知智能体的研究者与部署方而言,ReFract 提供了可复用的任务构造方式(匿名化领域支持查询 + 文本世界模型 + 视角感知轨迹)与量化基线(最多 69% 解决率、超过 50% 越权轨迹)。
摘要未列出参与评测的具体模型、评测次数与统计不确定性,也未说明 150 条条目在角色与场景上的分布,因此“最多 69%”与“超过 50%”的稳健性仍需查阅正文确认。文本世界模型对真实设备与权限体系的保真度、以及专家验证的具体流程与一致性,也属于读者需要进一步核对的开放问题。此外,越权操作尝试与实际造成损害之间的差距,摘要未作区分。
