AgentTime 基准测试:GPT-6 Astra 在 Codex 中 63% 的运行按时结束,但部分按时运行实为完成后休眠
核心概要
作者提出 AgentTime 基准,用 18 个来源的 222 个任务在原生 CLI 环境中测试智能体的时长遵循、运行时预测与事后时间估计;GPT-6 Astra 在 Codex 中 63% 的运行落在请求时长 5% 以内,Fable 5.1 仅 4%,且 158 条可分类 Astra 记录中有 14 条在看似完成后显式休眠,预测普遍高估自然运行时长,剥离时间线索后回溯偏差增大约两到五倍。
Figure 1: Astra keeps time; Fable does not. Each point is one of the 1,991 runs in Table 3 . On time is 0.95–1.05 × \times the request, a band about as wide as the dashed line. Dotted lines mark tenfold deviations, and colored lines are log–log fits. Both axes use log ( 1 + t / 30 s ) \log(1+t/30\,\mathrm{s}) .
arXiv深度剖析
AgentTime 把时间能力拆成时长遵循、预测、回溯三项,并在原生 CLI 环境(Claude Code、Codex)中评测,同时保留各基准原生评分,请求时长从约一分钟到 60 小时。 此前评测(如 METR 时间视野、BRIDGE)用人类完成时间作为任务难度代理,未测量智能体对自身运行时的控制或意识;AgentTime 直接测量智能体能否按请求时长工作。 222 个任务来自 18 个基准家族,覆盖编码、计算机使用、智能体工作与自动化研究;时长遵循实验每个任务每个请求时长三次独立运行,共 3,442 次尝试、约 1,700 智能体小时。
时长遵循能力因模型差异很大:GPT-6 Astra 在 Codex 中 63% 的运行落在请求时长 5% 以内,GPT-5.6 Sol 为 39%,Fable 5.1 仅 4%;Fable 在最短请求上 79% 超时(中位 1.8 倍),在最长请求上 89% 提前停止(中位 0.3 倍)。 交换 harness 后差距仍主要跟随模型:Astra 的组内斜率在 Claude Code 中比 Fable 高 0.71,在 Codex 中高 0.69,而换 harness 只移动斜率 0.14 到 0.16。 主实验每个智能体 659 至 666 次运行;harness 交换在 18 道 GPQA/HLE 题与 16 个智能体任务上各 98 次可比运行,并通过 OpenRouter 做了 provider 对照。
按时结束不等于有效利用时间:在 158 条带时间戳、可分类的 Astra 运行中,14 条(9%)在看似完成后显式休眠,74 条(47%)重查先前工作;请求时长延长约 16 倍时,仅约四分之一任务的原始得分提高。 此前工作关注预算或截止时间下的行为,AgentTime 单独记录“显式等待”这一第三种结果,并区分按时返回与真正工作。 转录逐条阅读,样本主要来自 CORE-Bench、TUA-Bench 与 Terminal-Bench;作者指出这些样本较小,且可见输出空白不能证明推理暂停。
预测普遍高估自然运行时长(Sol 83%、Astra 66%、Fable 63% 的预测偏高),而回溯在有时间线索时接近准确,剥离时间戳后典型偏差增大约两到五倍(Sol 从 1.07 到 5.38)。 与人类规划谬误方向相反,这些智能体倾向于高估自身耗时;回溯实验分五级逐步移除时间证据,定位到时间线索是估计的主要依据。 预测与无时长上限的自然运行在全部 222 个任务上分别测量;回溯在 23 个任务上每条件两次独立回答,Oracle 条件下带时钟工具时估计几乎精确。
启示与展望
该基准面向在原生 CLI harness 中运行长时程任务的智能体开发者与评测者,适用于请求时长从约一分钟到 60 小时、任务涵盖问答、软件工程、计算机使用、网页研究、文档编辑与自动化研究的场景。它使研究者能在同一套任务上同时观察任务得分与时长遵循,并区分按时返回、提前返回、超时与显式休眠。对需要按预算调度智能体的工程实践,结果提示应把时长遵循作为独立指标纳入评测,而非仅看最终答案质量。
每个智能体在每个请求时长上只运行一次,单任务结果混合了模型对请求的响应与运行间波动;除 55 次经 OpenRouter 重复的问答运行外未重复测量该波动。仅测试两个实验室的三个模型,时长遵循结果反映单一指令措辞与最大推理努力。超过 8.3 小时的请求仅出现在 METR 与 PostTrainBench 共四个任务中,harness 交换覆盖最长 80 分钟的请求。运行时也受服务速度影响,且运行经过订阅、API 密钥与 OpenRouter 多种路径。时间感知与运行时控制的来源(训练数据中的时间戳工具调用、生成速度假设)尚未区分。显式休眠与提前返回均不构成规避监控的证据,这些行为是否预测监督下的表现仍是开放问题。
