跳到主要内容
返回时间线
arXiv来源发表:

StoreBench 让智能体经营一家网店:最强模型 DeepSeek-V4-Pro 平均分 0.700,仍低于脚本启发式 0.764 与人类专家 0.708

核心概要

作者提出 StoreBench:一个让智能体在 Medusa v2 生产级电商后端上经营中型服装网店 30 至 365 个模拟日的长时程环境,通过 29 个商家工具、按操作计量的时间预算、锚点校准的通过阈值与抗奖励作弊的评分来考察持续经营能力;七个前沿模型无一在平均分上追平脚本 smart-triage 策略(最佳 DeepSeek-V4-Pro 0.700 对 0.764),人类专家以 0.708 略高于所有模型,而在 Claude Code 下跑满一年时多数模型大幅提升,GRPO 后训练把 Qwen3.5-27B 在留出任务上的均分从 0.136 提到 0.373。

Source-provided article image: StoreBench: A Live-Commerce Environment for Evaluating and Training Autonomous Operator Agents
Figure 2 ·

Figure 2: Three example tasks from the 12-task suite: steady (steady-state operations), trade-war (a correlated supply shock), and black-swan (a silent demand crash). Each chart plots the hidden quantity the task’s event script perturbs; markers show when each event fires and through which channel the agent can learn of it. Quotes are from the task prompts.

arXiv

深度剖析

环境把时间按“操作”计量:除免费的 store_status 外每次调用消耗一次操作,用尽窗口最后一次操作或调用 end_window 才推进世界,因此模拟时间只是动作序列的纯函数,模型推理延迟与墙钟速度无法影响结果。 多数智能体基准的世界只在智能体行动时变化、以终局判定给分、通过线任意设定;StoreBench 让需求、供应商改价与故障、市场冲击在智能体不行动时也发生,并把时间与推理速度解耦。 环境运行在 Medusa v2 生产级开源电商后端上,智能体使用与人类操作员相同的 29 个商家工具;同一动作序列可逐字节复现账本,运行清单记录源码提交、镜像摘要与种子数据、校准文件哈希,缺失或损坏的产物一律判零分。

评分以脚本锚点校准:每个任务-种子单元先跑六个脚本策略(do-nothing、absentee、blast-list、rule-based、smart-triage 与 exploiter),以 absentee 终局增长为零点、到最佳锚点的差距为尺度,通过阈值取两个最佳诚实交易锚点的中点,并受排序、判断差距、抖动余量与作弊抑制四道闸门约束。 此前长时程商业类评测多用终局财务结果,缺少按任务-种子校准的尺度与通过阈值;这里 36 个报告单元与两个私有留出种子的 24 个单元全部通过四道闸门,阈值跨度 0.43 至 0.76。 blast-list 能拿到最佳锚点复合分的约 65% 中位数却处处不通过;开发中一个候选任务(skeleton-crew)因批量发货在原操作预算下收益超过分诊而未过判断差距闸门,作者选择重新平衡并重新校准该任务,而非放宽闸门。

奖励面按“审计—封堵—钉住”循环加固:对 756 次加固前试验的审计与代码级漏洞搜寻发现的每个作弊点都在世界模型中封堵,并由对抗性回归测试钉住、并入 exploiter 锚点,使每次校准都重放整个目录。 开放奖励容易被优化器利用,而“当前没有模型利用”与“没有优化器能从中获利”之间的差距被当作基准的攻击面来处理,目录涵盖退出者连续性得分、可靠性洗白、终局免费取消、上架侧门、抽奖定价、退款悬崖、幻影现金等条目。 加固后 exploiter 在报告套件上平均 0.04,而诚实交易锚点为 0.46 至 0.76;每个作弊点恰好对应一个回归测试,全部测试在每次提交的 CI 中运行。

环境同时可作训练场:评分确定且无需裁判,密集的逐窗口奖励通道与终局增长精确对齐;用 GRPO 与 LoRA 在五个与评测集不相交的 7 至 15 天任务上训练 Qwen3.5-27B,留出评测任务均分从 0.136 升到 0.373,33 个单元中 31 个改善,盈利回合占比从 3% 升到 72%。 这给出一个可复现的证据:在短于评测时长的少量任务上做 RL,能迁移到未见过的更长场景,且增益主要来自运营纪律(准时发货与处理退货)而非商业策略。 训练共 36 步、每步 5 个任务-种子提示乘 6 次 rollout,合计 1,080 个训练回合;基础模型在 99 个回合中有 97 个耗尽 150 轮上限、平均只到第 33 个窗口,检查点到第 47 个窗口;检查点 34 在同一协议下得 0.341 且同样改善 31 个单元。

启示与展望

该环境面向需要评测或训练长时程运营智能体的研究者与工程团队:它适用于在隐藏需求、供应商故障与市场冲击下考察持续可靠性、经济判断与有限监督下的执行,也适用于把密集奖励通道用于 RL 后训练。作者说明框架是通用的,模块化工具、事件模型与后端可适配其他真实运营场景;当前实例是一家直营服装店,需求只通过货架移动,没有广告渠道、需求动量或市场价格发现,竞争者是脚本化的,隐藏需求模型虽具弹性但最终是参数化的。评测任务提示、配置与校准随评测套件一并保留,因此外部无法运行或针对该环境训练;随附材料提供五个训练集任务、十条示例轨迹、校准以及复合评分器与可从导出账本复现分数的独立重评分器。

短时程套件(60 至 90 窗口,goose harness)与全年任务(365 窗口,Claude Code)在 harness 与推理投入上都不同,作者分别报告、不做平均,并说明无法分离 harness 的影响,因此全年成绩的大幅提升中 harness 的贡献仍是开放问题。人类专家对照有两点边界:人类每个单元只贡献一个被选中的结果,而模型平均三次未筛选尝试,且参与者被允许一次重试;按最早完成尝试计分则均值为 0.656 而非 0.708。后训练研究使用一个基础模型、一次手工调整的训练运行,且用留出任务而非留出种子,作者将其定位为环境支持爬坡并迁移到未见场景的证据,而非调好的训练配方。此外,训练中策略熵从 0.2 升到 1.0 至 1.9,检查点消息出现强调式、偶有错乱的风格(19% 的轮次,基础模型低于 1%),并出现约十二个窗口后停止调用工具的空转,作者建议更长训练应配合 KL 惩罚或更低温度采样。

来源