Ultralytics YOLO 演进综述:从 YOLOv5 到 YOLO27 的架构、基准与部署全景
核心概要
这篇综述系统梳理了 Ultralytics YOLO 家族从 YOLOv5、YOLOv8、YOLO11、YOLO26 到 YOLO27 的架构演进,重点介绍 YOLO27 提出的“按规模自适应双架构”策略——紧凑的 n/s 型号采用精简 CNN 与双尺度预测并支持有 NMS 或无 NMS 推理,而 m/l 型号改用基于查询的 Transformer 解码实现原生无 NMS 检测、YOLO27l 进一步引入 UltraViT 深层自注意力,并汇总了 COCO 精度与 TensorRT 延迟等初步数据、跨代对比、导出量化与机器人、农业、监控、制造等部署场景,最后讨论了密集遮挡、域泛化、开放词汇、时序感知与硬件感知优化等未来方向。
Figure 2: YOLO27 scale-adaptive dual-architecture. A unified API dynamically supports scale-dependent internal designs: YOLO27n/s employ streamlined CNN backbones, strengthened high-resolution features, dual-scale prediction, and either NMS-based or one-to-one NMS-free inference, whereas YOLO27m/l use query-based transformer decoding, with UltraViT attention in YOLO27l. Non-detection tasks retain CNN-oriented heads for segmentation, depth, classification, pose, and OBB prediction.
arXiv深度剖析
提出并阐述 YOLO27 的“按规模自适应双架构”设计:n/s 采用精简 CNN、强化高分辨率特征与双尺度预测,m/l 采用基于查询的 Transformer 解码实现原生无 NMS 检测,YOLO27l 引入 UltraViT 深层自注意力。 以往 YOLO 各规模型号通常只是同一计算图的深度/宽度缩放,本文所述 YOLO27 让内部检测范式随模型容量改变,把计算预算当作架构设计变量。 属于架构综述与设计说明,配有 Figure 2 的架构示意;文中给出的初步数据为 640 像素下 COCO mAP 50:95 从 YOLO27n 的 42.3 递增至 YOLO27s 49.6、YOLO27m 55.8、YOLO27l 60.4,TensorRT 11 FP16 延迟约 0.62–2.32 ms,参数量约 3.0M 至 72.3M,800 像素下 YOLO27l 达 61.2 mAP,作者明确标注这些为初步结果。
梳理 YOLO26 的部署导向简化:移除 Distribution Focal Loss、支持原生端到端无 NMS 推理,并引入 Progressive Loss Balancing、Small-Target-Aware Label Assignment 与 MuSGD 优化器。 相对此前仍依赖 NMS 与 DFL 的密集检测流程,YOLO26 把后处理与分布回归从图中去除,使导出图更简洁、更易量化。 综述性描述配合 Table 3 的 COCO 数据:YOLO26n 约 39.8% mAP(端到端模式约 40.3%)在 CPU ONNX 上约 38.9 ms,YOLO26l 约 53.0–53.4% mAP;文中提到早期预览显示 CPU 侧约 43% 加速,并称 INT8 导出可保持接近 FP32 的 mAP。
给出跨代与跨家族基准对照:在 MS COCO 上比较 YOLOv5、YOLOv8、YOLO11、YOLO26 的 mAP、CPU/T4 延迟、参数量与 FLOPs,并与 YOLOv12、YOLOv13、RT-DETR 系列及 DEIM 训练框架对照。 把 Ultralytics 主线与社区/Transformer 路线放在同一张表里,便于按精度—延迟—可导出性权衡选型。 Table 3 与 Table 4 汇总了各型号的 mAP50–95、延迟与复杂度;例如 YOLOv5u-n 约 34.3% mAP、YOLOv8n 约 37.3%、YOLO11n 约 39.5%,YOLOv12l 约 53.2% AP 在 T4 上约 6.14 ms,RT-DETRv3 base 约 54.7% AP 约 54 ms。
系统整理导出格式、量化与部署路径,并给出机器人、农业、监控、制造四类应用场景的适配分析。 把架构选择与 ONNX、TensorRT、CoreML、TFLite、OpenVINO 等导出目标及 FP16/INT8 量化行为联系起来,说明不同规模型号适合的硬件与任务。 Table 5 列出各代导出支持情况;文中提到 ONNX/OpenVINO 导出在 CPU 上通常可达约三倍加速、TensorRT 可达约五倍 GPU 加速,并给出 Jetson Xavier NX 上 YOLOv8n INT8 约 18–20 ms、YOLO26n 在 x86 上约为 YOLOv8n 两倍速度等示例。
启示与展望
本文是一篇综述,其价值在于把架构演进、基准数据、导出量化与部署场景组织成一条可比较的线索,适合需要在边缘设备、机器人、农业、监控或制造场景中选型与规划部署的读者。文中所述 YOLO27 的精度与延迟数据被作者明确标注为初步结果,适用于理解设计意图与量级关系,而非作为最终性能结论;YOLO26 的 CPU 加速与 INT8 表现同样来自早期预览。综述覆盖的部署建议以文中列出的硬件与导出格式为范围,实际收益仍需在目标平台上直接测量延迟、内存、吞吐、能耗与量化行为。
YOLO27 的 mAP、延迟与参数量均为初步数据,最终权重、配置与独立基准尚未确定,因此不同规模之间的精度—延迟关系可能随正式发布而变化。无 NMS 的查询式解码在严重遮挡、密集小目标与查询容量受限条件下的表现,文中列为需要系统评估的开放问题。开放词汇、视觉—语言条件、时序记忆、不确定性估计与硬件在环优化在文中被描述为研究方向而非已发布功能,其能否在保持实时性的前提下落地仍待观察。此外,本文为综述,未包含原始实验的完整配置与图表细节,若需复现或严格比较,仍需查阅各型号的原始来源。
