MBZUAI 团队用 34 项能力、55 个基准评测 GPT-6 Astra 等六个通用系统,发现语义理解已逼近参考水平而精确几何与忠实重建仍是缺口
核心概要
MBZUAI 与 Apertix 的研究者把 GPT-6 Astra 与 Fable 5、Kimi K3、Gemini 3.1 Pro、Qwen 3.8-Max、Muse Spark 1.3 放在同一套指令、输入与评分下,跨 34 项能力、55 个基准、九大计算机视觉领域与专用模型和人类参考对比,发现语义解释、推理与以物体为中心的预测已接近或达到参考水平,而度量几何精度、忠实重建、时序一致的稠密预测和细粒度专家视觉知识仍存在较大差距。
深度剖析
研究给出了一张跨九大领域的能力地图:识别、感知与视觉阅读、视觉推理、空间推理、2D 定位检测分割、3D 感知与几何预测、视频理解与分割、图像生成编辑修复、机器人、专家领域视觉,共 34 项能力、55 个基准。 以往证据分散在不同任务、领域和模型对比中,难以看出单项进展对计算机视觉整体意味着什么;这项工作把六个前沿通用系统放在统一评测基础上,并与专用模型和人类参考并列比较。 六个系统接收相同任务指令、视觉输入与评测样本,输出按对应基准指标打分,并在支持时使用最强推理配置;参考分数来自各能力对应的专用模型与人类表现。
语义类能力正在成为前沿系统的共同强项:OCR 达到 93.7–98.1 对人类的 98.0,文档、图表与信息图理解六个模型全部超过所报告的人类表现,幅度为 +0.2 到 +3.5 分;数学推理六个模型达到或超过人类 78.7,分数区间 78.8–92.5。 这些结果把“通用模型能否读图”的问题推进到“哪些能力已成为前沿系统的共享基线”,并指出视觉阅读与文档理解已越过人类参考。 结论来自多模型在同一基准上的收敛表现,OCR 与文档理解两项均给出六个模型的分数区间与人类对照值。
GPT-6 Astra 在结构化预测与空间推理上拉开差距:2D 空间推理 96.0 对人类的 95.8,3D 空间与多视角推理 89.6 对 94.1;目标检测与分割分别超过专用模型 +10.7 与 +4.3 分,视频分割比次优前沿模型高 +26.6 分,姿态估计高 +22.7 分,图像分割高 +10.4 分,3D 视觉定位高 +10.7 分。 这些增益表明优势已从图像级结构化预测延伸到跨视频帧的稠密预测,而 2D 定位正从专用模型转向通用接口。 分数以对应基准指标报告,并与专用模型参考和次优前沿模型直接对比;Qwen 3.8-Max 也超过专用检测器 +8.6 分,说明这一趋势不限于单一模型。
剩余差距集中在需要精确几何、时序一致、忠实重建与细粒度领域知识之处:图像修复所有通用模型集中在 17.2–17.7 dB PSNR,远低于专用模型的 30.7;显微与病理识别为 14.1–23.8,低于专用模型的 57.1 与人类的 82.0;视频分割中最佳前沿模型仍比专用模型低 7.9 分。 这区分出“共享强项”与“共享短板”:修复与病理上的低分在多个模型上一致出现,说明这是共同的前沿而非个别系统的弱点。 修复与病理两项均给出跨模型的窄分数区间与专用、人类参考值;定性观察显示模型能定位相关结构却难以区分其细粒度类别。
启示与展望
这项工作面向计算机视觉研究社区与构建视觉系统的工程团队,适用于需要判断某项视觉能力是否可由通用接口承担、以及是否需要调用专用工具的场景。它给出的是所评测基准上的能力成熟度分层,而非任务本身已被解决的结论;成熟度参考可能来自专用模型、先前通用 SOTA 或人类表现,参考选择会影响解读,例如通用模型在 3D 视觉定位上超过所评测专用模型,却仍明显低于人类表现。研究还提示了一种分工:语义解释、语言条件推理、任务规划与协调适合在通用模型内部加强,度量几何、忠实重建、稠密对应、高保真修复与稀有专家领域的细粒度判别则可能继续由专用工具提供。
读者仍会关注:附加推理与工具虽能闭合部分差距,但收益随能力而异,工具使用成本为 1.04–1.20 倍,而更高推理可达基线的 13.22 倍且有时只换来小幅提升,分割上的增益还会在高投入下趋于平台期;因此何时该由通用模型直接作答、何时调用专用工具、如何校验输出,仍是开放问题。此外,成熟度分层依赖所选的参考对象,替换参考可能改变某项能力所处层级的解读。本证据包为全文,但主结果表与部分图示未在文本中展开,具体逐项数值与图 9 的完整分层细节仍需查阅原文。
