跳到主要内容
返回时间线
arXiv来源发表:

OSWorld-Science 用 146 个科学软件任务测 12 个视觉语言模型:最强智能体平均仅 73.7%,最难任务集只有 40%

核心概要

该工作提出 OSWorld-Science 基准与评测环境,把专家定义的科学任务、基于产物的执行式评分器和统一智能体外壳结合起来,在 7 个科学领域、17 款软件、3 种语言上评测 12 个视觉语言模型,结果显示最强模型 Claude Fable 5.1 平均得分 73.7%、最难任务集约 40%,且失败多发生在交互层与结果校验环节而非科学推理本身。

AI-generated editorial illustration: OSWorld-Science: A Benchmark of Computer Use Agents for Learning and Using Scientific Software

深度剖析

基准由 146 个任务构成,覆盖化学 43、物理 31、医学 26、统计 20、生物 18、地理信息 6、语言学 2,涉及 17 款软件与 14 种已记录配置,任务经专家提案与 AI 协同设计两路生成,并按科学价值与难度筛选。 与 WebArena、OSWorld、Windows Agent Arena 等通用计算机使用基准,以及 ScienceBoard、Terminal-Bench-Science 等科学基准相比,该工作把任务收集锚定在“在职科学家认为重要且困难”的判断上,并同时覆盖 GUI 与 CLI 混合交互。 任务分布、软件配置占比(QuPath 23 项、ChemDraw 与 ASKCOS 各 21 项、SAS/R 20 项)与操作原语统计(点击 124 项、文本输入 101 项、绘图 21 项、支持 CLI 122 项)均在正文与附录中逐项列出。

评测采用基于产物的执行式评分器,直接检查应用状态与生成文件(分子结构、分割掩码、图表、数值结果),并对不完整结果给部分分;配套外壳整合模型适配器、交互循环控制与轨迹日志,使模型与交互策略可比较。 相较只做答案匹配或只看最终文本的评测,该设计把异构科学产物纳入统一评分框架,并把外壳本身当作受控分析对象。 评分被归一化到 0–1 作为通过率;附录给出单值题精确匹配、模拟参数题按误差带判定的两类评分规则,以及 1500 条已发布轨迹的产物级标签流程。

12 个视觉语言模型在同一外壳下评测,Claude Fable 5.1 平均 73.7%(每任务 6.5 美元)最高,Claude Opus 5 为 57.9%、GPT-6 Astra 为 57.4%,GPT-5.6 luna 以 22.6% 和每任务 0.23 美元处于低成本端;领域间排名剧烈变化,如 Astra 在化学约 6% 而在两项语言学任务上 100%。 该结果把“模型能力”与“外壳设计”分开呈现,并给出性能—成本对照,而多数既有基准只报告单一分数。 分数为含部分分的任务加权均值,VOID 记 0;正文与附录 B 同时给出输出 token、总成本与分领域排名。

轨迹分析显示 1500 条已发布运行中仅 402 条(26.3%)获满分,1100 条非满分运行里 667 条(60.6%)没有产出被评分的产物,其中 613 条耗尽预算;叙述与思考是模型签名而非成功预测因子,固定模型与任务效应后没有任何交互指标在 Bonferroni 校正后显著。 这提供了“失败主要发生在交付环节”的量化证据,并说明增加推理强度或上下文窗口难以解决这类问题。 消融在 23 项 QuPath 任务上进行:Opus 5 从 medium 到 max 输出 token 增长约十倍、得分从 44.1% 升至 59.7%;历史窗口从 1 增至 10 张截图使平均步数由 52 降至 22、得分由 35.2% 升至 57.0%。

启示与展望

该基准面向需要在专业科学软件中完成可验证研究流程的评测场景,适用于比较视觉语言模型与交互外壳的组合,也适用于诊断失败发生在交互层、方法层还是交付层。任务、镜像与代码已公开,并加入污染水印以检测训练数据混入;由于部分软件需要许可证,本版本不计划发布全部轨迹。对希望据此选择科研软件智能体或设计新任务的读者,这套框架提供了可复用的任务模板、评分器与轨迹日志规范。

每个模型—任务组合多为单次运行,附录明确说明这些计数不携带方差估计,因此领域排名与消融差异应视为方向性观察。部分结论依赖对轨迹的人工归因,且坐标帧是从点击落点反推的,只拟合多数点击而非全部。若干任务依赖第三方在线服务(如 SynergyFinder 服务器中断)或需要许可证的软件,其可复现性受外部条件影响。此外,部分运行在 Mnova 未预装、评估器版本不同等条件下完成,与发布版任务不完全可比;若读者只读到摘要而未见附录,容易低估这些条件差异对具体数字的影响。

来源