TAPe+ML v3 用不到 10 万参数在 COCO 检测上取得 84.7 mAP50、65.3 mAP50-95,并在工业矿石堵塞试点中把 30 张图上的准确率从 YOLO 26s 的约 28% 提升到约 65%
核心概要
该工作提出 TAPe+ML v3:以 TAPe(主动感知理论)结构化表示替代原始像素张量,配合背景、指针、原型聚类等子模型与协调器,在不到 10 万参数下于 COCO 检测取得 84.7 mAP50 与 65.3 mAP50-95、COCO 实例分割取得 80.7 mask mAP50 与 58.4 mask mAP50-95,ImageNet-1k Top-1 为 88.1%、ImageNet-Real 为 89.9%,Imagenette 上相同训练条件下 TAPe 输入达 92% 而原始像素基线为 47%,并在矿石堵塞工业试点中显示骨干适配比仅调头部更有效。
深度剖析
系统把识别建立在结构化 TAPe 表示之上,而非原始像素张量:图像被映射为 T-bit 集合与关系图,T-bit 数量比像素少若干数量级,索引内存也小若干数量级。 与 VQ-VAE、BEiT 等学习式 tokenizer 不同,TAPe 被定位为识别之前的感知层,而不是大型预训练管线内部的一环;与 YOLO、RF-DETR 等像素输入检测器不同,它把部分建模负担从网络参数转移到输入表示。 论文给出 TAPe 映射的形式化描述(I↦G(I)=({t1,…,tk},E))与表示性质(局部变换不变性、语义稳定性、简洁可比性),但明确说明完整算法属于专有技术,只能给出输入、输出与表示层面的描述。
在 COCO 检测上,TAPe+ML v3 报告 mAP50=84.7%、mAP50-95=65.3%,总参数少于 10 万;在 COCO 实例分割上报告 mask mAP50=80.7、mask mAP50-95=58.4。 论文将这一结果与 RF-DETR 2XL(约 1.269 亿参数、mAP50-95 约 60.1)和 YOLO11-M(约 2010 万参数、mAP50-95 48.6)等公开基线并列比较,并说明外部检测器结果来自其官方基准表、训练与推理协议可能不同。 检测在标准 COCO train2017/val2017、80 类上评估,使用 mAP50 与 mAP50-95,并用 pycocotools 计算;延迟在 GTX 1070 Ti 8GB、batch size 1、长边限制 1024 像素下测得检测阶段 10.8 ms/帧。
分类实验显示表示本身带来显著差异:Imagenette 上相同 3 层 CNN(约 51.6 万参数)、相同 10% 数据、无增强条件下,TAPe 输入约 92% 验证准确率,原始像素基线约 47%;ImageNet-1k Top-1 为 88.1%,ImageNet-Real 为 89.9%。 论文强调该对比中架构、参数量、数据量与训练流程完全一致,唯一变量是输入表示;同时报告 ImageNet-1k 训练为从零开始,并给出 ObjectNet 78.6、ImageNet v2 80.2、ImageNet-R 90.3、ImageNet-Sketch 75.8 等分布偏移结果。 ImageNet-1k 遵循标准训练/验证划分与预处理;分布偏移基准与 ResNet-50、ConvNeXt-B、DINOv2 ViT-B/14、DINOv3 ViT-7B/16 的公开数值并列,TAPe+ML v3 参数约 0.1M、约 0.1 GFLOPs。
工业矿石堵塞试点中,30 张图下 YOLO 26s 基线准确率约 28%,TAPe+ML 仅调头部约 45%,骨干适配约 65%;85 张图时骨干适配约 85%,500 张图加 NMS 后为 85.7–96%。 论文把这一差距归因于结构化表示与骨干适配的组合,并指出在分布偏移场景下从头部到骨干适配的收益(RF100-VL 上 45.6→52.7→58.5)大于标准场景(64.1→68.2→72.4),说明 TAPe+ML v3 的收益在分布偏移下最大。 试点为传送带矿石堵塞的二分类工业任务,准确率定义为 IoU≥0.5 且 Top-1 分类正确的二值检测判定;骨干适配训练协议为 15 个 epoch、batch size 64、OneCycleLR 峰值学习率 1e-4、第 5 个 epoch 后连续 3 个 epoch 无改善则早停。
启示与展望
该工作面向需要在有限数据、内存与算力下同时完成分类、检测与分割的读者,尤其是工业质检与边缘部署场景;论文给出的适配模式(仅头部、骨干适配、从零训练)与自动标注流程,为在只有几十张标注图的新领域快速搭建系统提供了可操作路径。视频场景切分实验显示 TAPe 索引一小时视频约 10–11 秒、索引小于 1 MB、聚类约 1 秒,提示该表示也适合作为视频检索与场景组织的输入层。
论文自身指出三项范围限制:小物体紧致框定位仍是主要操作限制,最严格的 IoU 区间对预测框与真值框的对齐要求很高;骨干在分布偏移任务上存在 COCO 偏置,需要额外数据集与算力做骨干适配;TAPe 的完整数学与算法规范属于专有技术,未公开。此外,论文未涉及 3D 视觉与完整视频检测(跟踪、时序一致性),因此结论不宜自动外推到帧间一致性起决定作用的场景。分割覆盖与 AP@75 采用 LVIS 方法学,与 RF-DETR-Seg、Mask DINO、Co-DETR 的 COCO Mask AP 不是同一指标,直接比较需谨慎。
