OC-SORT 详解
OC-SORT: Observation-Centric SORT 论文: Observation-Centric SORT: Rethinking SORT for Robust Multi-Object Tracking (CVPR 2023)作者: Jinkun Cao, Xinshuo Weng, Rawal Khirodkar, Kris Kitani, Jiangmiao Pang (CMU / 商汤)代码: noahcao/OC_SORT 一句话总结:OC-SORT 把 SORT 从”以估计为中心”改为”以观测为中心”–当轨迹从遮挡中恢复时,用观测历史修正卡尔曼参数(ORU);在关联代价中加入观测方向一致性(OCM);用最后一次观测做二次恢复匹配(OCR)。 无需外观特征,即超越 DeepSORT。 一、背景:SORT 的三个局限 OC-SORT 的出发点是分析 SORT 的三个根本局限,逐一解决。 1.1 局限一:对状态噪声敏感SORT 假设匀速运动,用卡尔曼滤波估计速度。但在高帧率视频中,连续帧间位移很小,噪声与实际位移量级相当,导...
深度学习多目标跟踪综述梳理
深度学习多目标跟踪(MOT)综述梳理 本笔记是对综述 Deep Learning-Based Multi-Object Tracking: A Comprehensive Survey from Foundations to State-of-the-Art(arXiv:2506.13457)的系统梳理。原始转换文件见 [[Clippings/2506.13457v1.md]]。 一、综述定位与贡献 主题:深度学习驱动的多目标跟踪(MOT),聚焦 2022 年以来的现代方法。 两大范式: Tracking-by-Detection(检测再关联) —— 检测与关联解耦,仍是主流。 End-to-End(端到端) —— 检测与关联联合训练,以 DETR 系(tracking-by-query)为代表。 四大贡献: 系统梳理 2022 年起的现代深度 MOT 方法; 将 tracking-by-detection 划分为 五大类别; 在多基准上跨域对比,并自建加权宏平均基准评估泛化性; 提供详尽背景知识,兼顾不同基础读者。 二、MOT 问题与基础概念2.1 任务...
SORT 详解
SORT: Simple Online and Realtime Tracking 论文: Simple Online and Realtime Tracking (ICIP 2016)作者: Alex Bewley, Zongyuan Ge, Lionel Ott, Fabio Ramos, Ben Upcroft代码: abewley/sort(~200 行 Python) 一句话总结:SORT 用”卡尔曼滤波预测 + IoU 匈牙利匹配”三步循环实现多目标跟踪,极简但奠基–后续 DeepSORT、ByteTrack、OC-SORT 全部基于此框架。 一、背景:多目标跟踪(MOT)1.1 什么是 MOT多目标跟踪(MOT):在视频每一帧检测出所有物体后,还要保持每个物体跨帧的身份(ID)–”第 1 帧的人 A,在第 2 帧还是 A,不是 B”。 1.2 Tracking-by-Detection 范式SORT 采用 tracking-by-detection:先用检测器(YOLO/Faster R-CNN)逐帧出框,再用跟踪算法把相邻帧的框关联起来...
RT-DETR 详解
RT-DETR: Real-Time Detection Transformer 论文: DETRs Beat YOLOs on Real-time Object Detection (CVPR 2024)作者: Yian Zhao, Wenyu Lv, Shangliang Xu, et al. (Baidu / 百度)代码: PaddlePaddle/PP-DETR / lyuwenyu/RT-DETR 一句话总结:RT-DETR 是第一个实时端到端目标检测器–它用混合编码器(CNN + 稀疏 Transformer)解决 DETR 太慢的问题,用 IoU-aware 查询初始化 + CDN 训练加速收敛,全程无 NMS,在同等速度下超越 YOLOv8。 一、概述1.1 为什么要有 RT-DETRDETR(2020)开创了端到端检测(无 NMS、无 anchor、匈牙利匹配),但有两个致命问题: 太慢:Transformer 编码器处理所有特征图的所有位置,计算量巨大; 收敛慢:从头训需要 500 epoch,远多于 YOLO...
YOLOX 详解
YOLOX: Exceeding YOLO Series in 2021 论文: YOLOX: Exceeding YOLO Series in 2021 (2021)作者: Zheng Ge, Songtao Liu, Feng Wang, Zeming Li, Jian Sun (Megvii / 旷视)代码: Megvii/yolox 一句话总结:YOLOX = YOLOv5 结构 + FCOS 检测头 + OTA 标签分配。 它把 YOLO 系列从 anchor-based 推进到 anchor-free,引入解耦头与 SimOTA 动态标签分配,在 COCO 上以同等推理速度超越 YOLOv5。 一、概述YOLOX(2021,旷视)是 YOLO 系列的一个重要转折点。它不是堆叠 trick,而是把检测范式从 anchor-based 切换到 anchor-free,并解决了随之而来的训练稳定性问题(靠解耦头 + SimOTA)。 核心改进三点: Anchor-free:去掉所有预定义 anchor,每个网格点直接预测 1 个框(类...
VIT 详解
ViT: An Image is Worth 16x16 Words 论文: An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (ICLR 2021)作者: Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn, Xiaohua Zhai, Thomas Unterthiner, Mostafa Dehghani, Matthias Minderer, Georg Heigold, Sylvain Gelly, Jakob Uszkoreit, Neil Houlsby (Google Research)代码: google-research/vision_transformer 一句话总结:ViT 把一张图切成若干 patch,每个 patch 当成一个”词”,喂给标准 Transformer Encoder,用 CLS token 做分类。 它证明了 NLP 的 Transf...
Transformer: 详解
Transformer: Attention Is All You Need 论文: Attention Is All You Need (NeurIPS 2017)作者: Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, Illia Polosukhin (Google Brain)代码: tensor2tensor 官方实现 一、背景 把《Attention Is All You Need》放回 2017 年的语境,理解它当时要解决什么问题、采用了哪些关键设计,有助于更准确地把握后续架构细节。 1.1 2017 年的世界:Transformer 诞生时的 NLP 图景2017 年 6 月这篇论文出现时,NLP 学术圈与工业界的图景是这样的: 机器翻译是 NLP 的旗舰任务。Google Translate 在 2016 年 9 月把生产环境从短语统计 MT(PBMT)切到神经 MT(GNMT),翻译质量显著提升,...
FCOS 详解
FCOS: Fully Convolutional One-Stage Object Detection 论文: FCOS: Fully Convolutional One-Stage Object Detection (ICCV 2019)作者: Zhi Tian, Chunhua Shen, Hao Chen, Tong He ( Adelaide / 商汤 )代码: tianzhi0549/FCOS / AdelaiDet 一句话总结:FCOS 抛弃 anchor,把目标检测变成”逐像素预测”–特征图上每个位置直接回归到所在 GT 框四条边的距离 (l, t, r, b)。 它证明了只要配合 FPN 多级预测 + center-ness,anchor-free 检测器就能追平甚至超过 anchor-based。 一、概述:为什么要有 anchor-free主流检测器(RetinaNet / SSD / YOLOv2+ / Faster R-CNN)都依赖预设 anchor。anchor 的问题: 超参敏感...
RetinaNet 详解
RetinaNet: Focal Loss for Dense Object Detection 论文: Focal Loss for Dense Object Detection (ICCV 2017, best paper)作者: Tsung-Yi Lin, Priya Goyal, Ross Girshick, Kaiming He, Piotr Dollár (FAIR)代码: facebookresearch/Detectron 一句话总结:这篇论文找到了”一阶段检测器精度不如两阶段”的根因–类别极度不平衡导致训练被大量易分负样本主导–并用 Focal Loss 一举解决,使 RetinaNet 成为第一个精度超越两阶段的一阶段检测器。 ⚠️ 论文的主角其实是 Focal Loss,RetinaNet 网络本身只是”顺便”提出、用来验证损失函数有效性的载体–结构上并无颠覆性创新(ResNet + FPN + anchor 双头都是已有组件)。 一、背景与动机:一阶段为什么打不过两阶段?12345两阶段 (Faster R-CNN 等): RPN 筛选...
YOLO 系列总览
🎯 YOLO 系列目标检测算法总览一句话理解 YOLO You Only Look Once —— 只需看一次,就能完成目标检测。 把目标检测从”先找候选区再分类”的两阶段,变成了”一步到位”的回归问题。 版本演进时间线 版本 年份 作者/机构 核心创新 论文/状态 v1 2016 Joseph Redmon 单阶段检测、Grid Cell 划分 1506.02640 v2 2017 Redmon & Farhadi Anchor Box、BN、Darknet-19、细粒度特征 1612.08242 v3 2018 Redmon & Farhadi Darknet-53、多尺度预测(FPN)、逻辑分类器 1804.02767 v4 2020 Alexey Bochkovskiy CSPDarknet53、PAN、Mosaic增强、BoF/BoS 2004.10934 v5 2020 Ultralytics PyTorch实现、工程化、CSPNet+PAN ❌ 无论文 v6 2022 美团 工业级部署...