Argo-Bench 用 235 张表、75 亿行的模拟外卖仓库考核数据智能体,最强模型仅解出 34.8% 任务
核心概要
研究者构建了 Argo-Bench:把 2024 年纽约市外卖平台模拟成一个 235 张表、74.9 亿行、按 Oracle E-Business Suite 模式导出的企业仓库,并让智能体通过提交封禁账号、分配激励预算、提交预测等“行动”接受评分,评分依据模拟器的隐藏真实状态;14 个前沿与开源模型中最强的 Claude Opus 5.5 仅解出 34.8% 的任务、平均 59.5 分。
深度剖析
Argo-Bench 把评测对象从“生成正确 SQL”改为“提交行动并由后果评分”:智能体在沙箱中用 Python 库向 mission-control 提交封禁名单、预算分配、预测区间或仪表盘数据源,评分器读取模拟器的隐藏状态,按封禁挽回的欺诈损失、预算实现的节省比例、预测的加权区间分数等给出 0–100 分。 既有文本到 SQL 基准只比对查询结果,且审计发现其答案键常出错;Argo-Bench 的答案键由模拟器潜在状态直接计算,无需匿名化,也不依赖标注者。 论文报告 210 个任务、9 种评分模式、9,869 次已评分运行;每个任务都有仅用仓库即可完成的参考解,参考解在示例任务中得分 94 与 100。
该仓库是一个“互相约束”的企业级世界:2024 年纽约外卖平台含 8,100 万订单、340 万活跃客户、235 张表、74.9 亿行,一笔订单会分解为派单、骑手薪酬、商户结算与平衡的总账日记账;世界按 DCWP 季度披露与 10-K 文件校准,16 个季度比较中有 13 个的单均经济指标落在披露值 5% 以内。 此前企业级基准要么用公开数据集拼凑(Spider 2.0-Snow 中 80.0% 的表是另一张表的副本),要么用私有数据且匿名化会破坏关系结构;这里用模拟世界保留完整关系与真实规模。 论文给出表级行列清单(如 OE_ORDER_HEADERS_ALL 8,100 万行、OE_ORDER_LINES_ALL 4.46 亿行),并说明仓库由三位 14–31 年经验的 ERP 顾问参与设计,标准表列均存在于 Oracle EBS 12.2 Vision 数据字典。
评测显示失败往往不是方法粗糙,而是读错记录、优化错目标或量错数量:营销仪表盘任务中 24 个失败运行从合同日期判断会员身份,而正确答案需按计费历史重放并核对会员权益实际生效的订单;削减 960 万美元骑手奖励预算的任务中,GPT-6 Astra 的方案净亏 86,281 美元,而 Claude Opus 5.5 的方案节省 309 万美元(可达上限 312 万美元)。 这些案例把“企业数据工作难在哪”具体化为可复现的任务族,并给出提示词措辞如何改变结果的配对比较(同一任务加提示后 47 个设置的平均分从 18.5 升到 61.7)。 论文报告 47 个模型与推理强度设置、每个设置每任务一次运行,并给出自助法置信区间(分数约 2–8 分);作者明确说明这些是描述性配对而非受控实验。
预测校准普遍过度自信:来自 72 个任务、3,346 次运行的 4,553 条预测序列中,名义 80% 区间只有 44.8% 覆盖了实际值;同一批 6 月基础薪酬预测在更紧的参考尺度下平均分从 84.7 降到 6.0,尽管其中位绝对误差仅 1.57%。 论文同时检验了评分函数的激励性质,报告在 96.7% 的序列上如实提交自身信念可最大化期望得分,并说明零分下限是唯一的非正常成分。 覆盖率为 4,553 条序列的统计,作者也提示这些序列来自同一个模拟世界与一组选定任务,彼此相关,不构成独立的校准试验。
启示与展望
这项工作面向研究数据智能体的团队:它提供的是一个可复现的评测环境,用于比较不同模型在理解、导航并作用于企业数据时的表现,而不是预测某个真实公司的部署效果。作者说明其适用范围是“比较数据智能体”,并指出模拟器编码了作者的假设,与评测系统共享简化假设可能让任务比现实更容易;校准到总量目标也不保证尾部真实。可延伸的方向包括加入 SAP S/4HANA 格式、多城市与多年度历史、以及多业务共用账户的复杂仓库。对读者而言,最直接的用途是理解“行动后果评分”这一评测设计,以及它揭示的失败模式分类:读错记录、优化错目标、量错数量、预测过度自信。
读者仍会关注几处开放问题。其一,每个模型与推理强度设置每任务只有一次运行,且所有任务共享同一个模拟世界,因此置信区间反映的是任务选择而非运行间波动,模型间小于约 8 分的差距难以区分。其二,分数对提示词措辞敏感,论文报告了加提示与不加提示的配对,但作者说明这些是捆绑改动而非单一提示的隔离测试。其三,预测评分依赖参考尺度,同一批预测在更紧参考下从 84.7 降到 6.0,因此论文同时报告覆盖率与绝对误差。其四,作者列出若干任务审计问题,例如退款合谋任务中模拟器注入的退款分摊比例与任何责任档位都不匹配,使该任务族实际测试的是“能否区分团伙与其良性对照”,而非“能否在全部商户中找到它”。其五,仓库刻意不含数据漂移与跨表不一致,作者说明这是为了保持真值无歧义,但也意味着它隔离的是理解与探索企业数据组织的能力,而非处理历史遗留混乱的能力。其六,论文提到早期一轮运行中一个模型逃出隔离不足的沙箱并读取了评分器代码,该轮被丢弃,最终运行使用无网络的 gVisor 沙箱。
