跳到主要内容
返回时间线
arXiv来源发表:

BIABench用16项已发表研究检验AI智能体:常规分析可完成,3D与时间序列任务得分跌至0.00–0.10

核心概要

研究者构建了BIABench,把16项已发表生物学研究还原为原始图像加生物学家指令的端到端生物图像分析任务,用研究自身报告的结果作真值、以确定性指标评结果分并用VLM按专家撰写的评分细则评过程分,在6个智能体、多个模型与两种指令详细度下各重复三次,发现常规2D任务最高可达0.97,而5D核孔定量与3D致癌点状结构定量在所有配置下都不超过0.25。

AI-generated editorial illustration: BIABench: Evaluating AI agents on real-world bioimage analysis tasks

深度剖析

BIABench把已发表研究拆解为可验证任务:每项任务只保留原始图像、生物学家对关键读数的请求,以及论文报告的输出作为真值,任务覆盖11类分析子任务、2D/3D/时间序列数据,模态从H&E组织学到单分子定位显微镜,样本跨6个源生物体。 此前的生物图像基准多评估单一步骤(如细胞核分割、细胞追踪、虚拟染色、质量控制)或让智能体在既有数据集上训练模型再评其留出预测,而这里评的是从原始图像到研究结论的完整循环,且方法选择(含GUI软件)本身计入评分。 任务由已发表研究重建,真值回放(把任务自身真值当作提交)在每个有真值文件的任务上都达到满分,说明指标上限未被压低;每项任务配有机器可读的YAML规格,声明模态、维度、时间模式、子任务、输出格式、评分指标与来源编号。

评分采用结果分与过程分双轨:结果分用领域标准指标(分割用Dice、追踪用Cell Tracking Challenge的SEG与TRA、点检测用F1与定位误差、共定位用显著性方向、动力学用Kolmogorov–Smirnov统计量或派生量相对误差)对照真值;过程分由视觉语言模型按专家撰写的严重度加权细则,对从载入原始数据到最终报告的每个阶段打分。 与完全依赖评委打分的流程级基准不同,这里的排名只依据确定性指标,过程分单独报告并给出与人类专家的一致性;与规定方法的基准不同,这里把“该做哪种分析”留给智能体。 评委验证用20次运行、覆盖全部6个智能体与全部任务,由一位未见过评委判断的专家细胞生物学家逐项盲评;在双方都判定的项目上,采用的评委(Claude Sonnet 5)与专家一致率为0.87(Cohen's κ 0.67,CI 0.61–0.73),对专家判为失败的项目有0.27的过度通过、对判为通过的项目有0.07的误判失败。

在固定模型(GPT-5.6 Sol)比较6个智能体时,任务间差异远大于智能体间差异:NF-κB转位定量、HeLa核/质分割与细胞计数上最好的智能体达到0.85–0.97,而5D核孔组装动力学降至0.00–0.25、3D点状结构定量降至0.00–0.10;生物学专用智能体整体上没有优势,通用智能体在16项任务中的多数取得或并列最高均值,在细菌追踪上领先最多达0.97对0.32。 这给出了一个此前缺失的经验事实:在端到端、方法自选的显微镜分析上,领域专用设计并不自动转化为自主运行时的优势,而失败集中在增加第三维或时间轴的任务上。 每个智能体–任务对独立运行三次,结果分按三次均值汇总并给出跨任务标准差;每个智能体通过统一接口运行,输出文件从文件系统回收,供应商命令行工具被视为模型与外壳混杂的配置。

模型、成本与指令详细度都不能可靠弥合差距:DeepSeek Harness上换用更强模型把均值从0.52提到0.65,而把简要指令换成专家撰写的详细协议后均值几乎不变(V4-Flash上0.52对0.52,GPT-5.6 Sol上0.58对0.58),只是重新分配了任务级表现;最省钱的DeepSeek-V4-Flash以约0.09美元每次运行达到最强配置得分的约80%,而Codex成本高五倍只换来约0.01的提升。 这同时否定了“更强模型”和“更详细指令”两条直觉上的补救路径,并把成本–精度关系摆到台面上:更贵的配置并不必然更准。 模型交换在DeepSeek Harness(6个模型)与Claude Code(3个模型)上分别进行,指令详细度对比在DeepSeek Harness上以GPT-5.6 Sol与V4-Flash重测;成本对Claude Code与DeepSeek-V4-Pro取供应商账单,其余按公开单价对计量token计价,并声明每个智能体暴露了哪些用量信号、缺失值不读作零。

启示与展望

这套基准面向自主运行的生物图像分析智能体,适用于以显微镜图像为输入、以研究自身报告的物理量为输出的任务,覆盖2D、3D与时间序列以及从H&E组织学到单分子定位显微镜的模态;任务构建配方可复用于新研究,接口也可接入napari或模型库类智能体。对读者而言,它提供的是“当前智能体在何种复杂度下仍不可靠”的定位图,以及一套可复用的评测与任务生成方法,而不是某个具体生物学结论。由于每项任务都以研究自身终点计分,该设计在理论上假定人类专家在这些任务上接近满分。

仍待观察的是:过程分与结果分相关性很弱(全部计分运行上Pearson约0.33,剔除近零结果后约0.13),专家给出的过程分同样不预测结果,且评委把评分压缩在很窄的区间内,几乎不给低于某阈值的运行;三次运行中同任务得分差异超过0.2的智能体–任务对占相当比例,取三次最好成绩会让六个智能体中的五个彼此接近,说明智能体间差异更多反映可靠性而非最好水平。评委在“工具选择与使用”这一层与专家一致性最低(0.77,κ 0.47),倾向于凭叙述给分;不同外壳保留的证据量差异很大,专家跳过率从Agentic-J的0.10到CopilotJ的0.44不等,这会影响过程分的可审计性。此外,部分配置因技术原因被排除(GLM-5.1与V4-Flash在Claude Code下因空响应被误记为结束、伤口愈合任务在V4-Flash详细指令下因超出图像尺寸限制而重跑),SARS-CoV-2任务上部分模型被供应商安全过滤阻断,这些排除对总体均值的影响在文中以逐项说明的方式给出,读者可据此判断适用范围。

来源