YOLO 系列总览
🎯 YOLO 系列目标检测算法总览一句话理解 YOLO You Only Look Once —— 只需看一次,就能完成目标检测。 把目标检测从”先找候选区再分类”的两阶段,变成了”一步到位”的回归问题。 版本演进时间线 版本 年份 作者/机构 核心创新 论文/状态 v1 2016 Joseph Redmon 单阶段检测、Grid Cell 划分 1506.02640 v2 2017 Redmon & Farhadi Anchor Box、BN、Darknet-19、细粒度特征 1612.08242 v3 2018 Redmon & Farhadi Darknet-53、多尺度预测(FPN)、逻辑分类器 1804.02767 v4 2020 Alexey Bochkovskiy CSPDarknet53、PAN、Mosaic增强、BoF/BoS 2004.10934 v5 2020 Ultralytics PyTorch实现、工程化、CSPNet+PAN ❌ 无论文 v6 2022 美团 工业级部署...
YOLO26 详解
YOLO26: 魔改终结者, 边缘端到端 状态: 🚧 开发中 (Ultralytics YOLO Vision 2025 预览)作者: Ultralytics定位: 专为边缘和低功耗设备设计 设计哲学 不是堆砌模块,而是精简 + 针对性创新: Simple: 原生端到端,无需 NMS Efficient: CPU 推理提速 43% Innovative: LLM 训练技术跨界引入 CV 三大设计原则1. 简单 (Simple): 原生端到端12345678传统 YOLO: 模型 → NMS 后处理 → 最终输出 ↑ 必须的额外步骤YOLO26: 模型 → 直接输出! (无 DFL, 无 NMS) 继承 v10 的 NMS-Free 理念,进一步简化 移除 DFL (Distribution Focal Loss) 模块:虽然有效,但使导出和硬件兼容复杂化 2. 部署效率 (Deployment Efficiency)1234567传统流程: 预处理 → Backbone → Neck → Head ...
YOLOv10 详解
YOLOv10: 实时端到端目标检测 论文: YOLOv10: Real-Time End-to-End Object Detection (2024)作者: 清华大学 (王敖等)代码: github.com/THU-MIG/yolov10 革命性贡献: NMS-Free! YOLOv10 是首个真正消除 NMS 后处理的 YOLO 版本,实现端到端推理。 核心创新1. 一致双重分配 (Consistent Dual Assignments)这是实现 NMS-Free 的关键。 1234567891011121314训练阶段: ┌─────────────────────┐ │ One-to-Many Head │ → 每个目标 → 多个预测 (丰富监督) │ (一对多) │ ├─────────────────────┤ │ One-to-One Head │ → 每个目标 → 唯一最佳预测 (模拟推理) │ (一对一) │ └─────────────────────┘ ...
YOLOv1 详解
YOLOv1: You Only Look Once 论文: You Only Look Once: Unified, Real-Time Object Detection (CVPR 2016)作者: Joseph Redmon, Santosh Divvala, Ross Girshick, Ali Farhadi 一、核心思想1.1 什么样的任务是”回归问题”? 一句话:输出连续数值的是回归,输出离散标签的是分类。 123456789┌─────────────────────────────────────────────────────────────┐│ 分类问题 (Classification) ││ 输入一张图 → 输出: "猫" (0或1,离散标签) ││ 例: 这张图里有猫吗? → 有/没有 ││ ...
YOLOv11 详解
YOLOv11 / YOLO11: 更少参数, 更高精度 代码: github.com/ultralytics/ultralytics作者: Ultralytics (2024年9月)特点: ❌ 无正式论文,但性能和效率显著提升 一句话总结 YOLO11m 比 YOLOv8m 参数少 22%,精度更高。架构微调 + 训练的胜利。 核心架构改进1. C3k2 模块 (替代 C2f)1234567C2f (v8): Conv → split → Bottleneck×N → concat → Conv ↓ 标准 BottleneckC3k2 (v11): Conv → split → **C3k Bottleneck** → concat → Conv ↓ CSP + **两个小卷积替代一个大卷积** C3k 块细节: 1234传统 Bo...
YOLOv13 详解
YOLOv13: 超图增强自适应视觉感知 论文: YOLOv13: Real-Time Object Detection with Hypergraph-Enhanced Adaptive Visual Perception (2025)作者: 清华大学 + iMoonLab代码: github.com/iMoonLab/yolov13 核心创新问题: 传统特征融合的局限传统 YOLO 的特征融合(FPN+PAN)仅考虑成对关系: 12层 P3 ←→ 层 P4 (两两交互)层 P4 ←→ 层 P5 但实际场景中,多尺度特征之间存在高阶相关性(3个及以上特征间的协同关系)。 YOLOv13 的回答: 超图增强 用超图 (Hypergraph) 来建模多尺度特征之间的高阶关系。 两大核心技术1. HyperACE (基于超图的自适应关联增强)12345678910传统方法: P3 → P4 → P5 (线性序列) 或 FPN+PAN 两两交互HyperACE: ┌── P3 ──┐ │ ↓ │ 超边 (Hyper...
YOLOv12 详解
YOLOv12: 注意力中心的实时目标检测 论文: YOLOv12: Attention-Centric Real-Time Object Detectors (2025)作者: SUNY Buffalo (纽约州立大学布法罗分校) + 中国科学院大学代码: github.com/sunsmarterjie/yolov12 历史性跨越: CNN → Attention YOLO 系列首个完全基于注意力机制的实时检测器! 同时保持了对实时推理至关重要的速度(208 FPS)。 为什么不是之前就用 Attention?CNN vs Attention 的困境 方案 优势 劣势 CNN 计算高效,硬件友好 感受野有限 ViT / DETR 全局感受野,精度高 计算量大,实时性差 YOLOv12 ✅ 两者兼备 — YOLOv12 如何做到?通过三项创新让 Attention 在实时检测器中可行: 区域注意力 (A²) — 大幅降低计算成本 R-ELAN — 解决大模型注意力架构的优化困难 架构精简 — 去除不必要的部分 核...
YOLOv3 详解
YOLOv3: An Incremental Improvement 论文: YOLOv3: An Incremental Improvement (2018)作者: Joseph Redmon, Ali Farhadi代码: pjreddie.com/darknet/yolo 论文标题就叫 “An Incremental Improvement”(一点小改进),作者自嘲”没做啥特别的研究,就是把它做得更好了”。但这篇”技术报告”在工程界大受欢迎,成为后续 v4/v5/v7 的基础,也是 Redmon 关于 YOLO 的最后一篇(2020 年因反对将 YOLO 用于军事/隐私而停止更新)。 一、概述:v3 改了什么1234YOLOv3 = v2 的底座 + 三大新组件: ① Darknet-53 ← 残差骨干网,53 层纯卷积,无池化无全连接 ② FPN 多尺度 ← 3 个尺度同时预测,大幅提升小目标 ③ Logistic 分类器 ← 多标签,BCE 损失,替代 Softmax 1.1...
YOLOv5 详解
YOLOv5: PyTorch 工程化的里程碑 代码: github.com/ultralytics/yolov5作者: Ultralytics (Glenn Jocher)特点: ❌ 无正式论文,但代码、文档、生态最完善 历史意义 v5 没有革命性创新,但它通过 PyTorch 重写 + 极致工程化 + 完善生态,让 YOLO 真正走入大众。 12v4: darknet(C 语言) → 研究者友好但部署难v5: PyTorch → 人人可用,pip install 即可 网络架构整体结构 (与 v4 相似但更优化)12345678910111213141516171819202122输入 640×640×3 ↓┌─────────────────────────┐│ Backbone: 改进CSPDarknet53 ││ ├─ Focus (切片下采样) ││ ├─ Conv + C3 (CSP Bottleneck) ││ └─ SPPF (Fast 金字塔池化) │└──────...
YOLOv4 详解
YOLOv4: Optimal Speed and Accuracy 论文: YOLOv4: Optimal Speed and Accuracy of Object Detection (2020)作者: Alexey Bochkovskiy, Chien-Yao Wang, Hong-Yuan Mark Liao代码: github.com/AlexeyAB/darknet 一、核心思想 —— “炼丹手册”的系统化 YOLOv4 的本质:以 YOLOv3 为基础,筛选了近几年在各种检测器上被验证有效的 tricks,做了一次系统性的消融实验。论文读起来像一本”目标检测炼丹手册”。 最大贡献:三段式架构 + BoF/BoS 方法论1234567YOLOv4 确立的黄金架构: 输入 ──→ Backbone ──→ Neck ──→ Head ──→ 输出 特征提取 特征融合 预测头 此前 v3 已有这三部分的雏形,但 v4 第一次把它们作为明确的架构范式提出来, 后续 v5/v7/v8 都沿用了这个框...