深度学习多目标跟踪(MOT)综述梳理

本笔记是对综述 Deep Learning-Based Multi-Object Tracking: A Comprehensive Survey from Foundations to State-of-the-Art(arXiv:2506.13457)的系统梳理。原始转换文件见 [[Clippings/2506.13457v1.md]]。

一、综述定位与贡献

  • 主题:深度学习驱动的多目标跟踪(MOT),聚焦 2022 年以来的现代方法。
  • 两大范式
    1. Tracking-by-Detection(检测再关联) —— 检测与关联解耦,仍是主流。
    2. End-to-End(端到端) —— 检测与关联联合训练,以 DETR 系(tracking-by-query)为代表。
  • 四大贡献
    1. 系统梳理 2022 年起的现代深度 MOT 方法;
    2. 将 tracking-by-detection 划分为 五大类别
    3. 在多基准上跨域对比,并自建加权宏平均基准评估泛化性;
    4. 提供详尽背景知识,兼顾不同基础读者。

二、MOT 问题与基础概念

2.1 任务定义

  • 在视频中检测给定类别的对象,并跨帧关联(赋予唯一 ID),输出每个对象的轨迹 τ。
  • 核心难点:频繁遮挡(导致 ID 切换/丢失)、外观相似(难区分)、运动不可预测。
  • 应用:自动驾驶、体育分析、零售、机器人、生物、监控等。

2.2 通用流水线

输入视频帧 → 输出每帧的边界框(坐标、类别、ID)。关联发生在检测之后。

2.3 错误类型

类别 错误 说明
关联错误 FP track / FN track / ID switch 虚假轨迹、漏轨迹、ID 混淆
检测错误 FP detection / FN detection / 定位误差 假阳性检测、漏检、框偏移

术语区分:match 指评测时预测与真值配对;association 指推理时轨迹与检测配对。


三、评估指标

指标 匹配层级 侧重 说明
MOTA 检测级 检测为主 1 − (FP+FN+IDSW)/gtDet,受检测性能影响大,范围为 −∞~1
MOTP 检测级 定位精度 匹配对的平均相似度
IDF1 轨迹级 关联为主 对 ID 切换敏感,偏向关联性能
HOTA 检测级 检测+关联平衡 DetA 与 AssA 的几何平均;多阈值(0.05~0.95)平均,是基准主指标
IDSW ID 切换总次数,越低越好
  • DetA = Jaccard 指数(TP/(TP+FP+FN));AssA 评估匹配检测的轨迹对齐质量。
  • 匹配通过匈牙利算法求解二部图最优指派,相似度用 IoU(2D 框)。

四、基准数据集

数据集 场景 帧数 特点 主要挑战
MOT17 14 14,235 非静态相机、行人、线性运动 拥挤、遮挡
MOT20 8 13,410 静态相机、极拥挤(1.65M 框) 重度拥挤
DanceTrack 100 105,855 舞者、外观相似、非线性运动 复杂运动
SportsMOT 240 150,379 篮球/排球/足球、高速多变 极端运动多样性

关键洞察:单数据集评测无法体现泛化性。MOTChallenge 运动可预测但拥挤;DanceTrack/SportsMOT 强调运动多样性与外观相似性。


五、深度学习目标检测模型(三大族)

Tracking-by-detection 的检测器基础,分三类:

代表 特点 NMS 依赖
Proposal-based(两阶段) R-CNN → Fast/Faster R-CNN → Mask R-CNN 区域提议+分类回归,精度高、速度慢
Grid-based(单阶段) YOLO 系列、YOLOX(anchor-free) 实时、回归式;YOLOX 为 MOT 基准默认检测器 是(anchorless 仍需)
Query-based DETR、DAB-DETR、DINO、RT-DETR 集合预测、匈牙利二部匹配、无需 NMS、端到端;收敛慢、小目标弱
  • DETR 是端到端跟踪方法(MOTR 系)的基石。

六、Tracking-by-Detection 范式(核心)

核心论断:所有 tracking-by-detection 算法本质上都是 SORT 的变体。检测与关联解耦,模块化、灵活、可独立优化。

6.1 两大基线

SORT(先驱)

三大组件 + 轨迹管理:

  • 检测:仅保留高置信度框,对检测分数阈值 detτ 极敏感。
  • 运动模型:卡尔曼滤波(KF),线性匀速假设;状态 [x, y, s, r, ẋ, ẏ, ṡ]
  • 关联:匈牙利算法,代价 = 负 IoU,设 IoU 门控阈值。
  • 轨迹管理:四状态 active / lost / deleted / new;试用期(默认 3 帧)、T_lost=1不处理长时遮挡)。
  • 缺点:ID 切换频繁(运动模型精度低,遮挡累积误差)。

Deep SORT

  • 在 SORT 基础上融合外观:CNN(ReID 模型)提取外观嵌入,余弦距离比较。
  • 轨迹维护外观特征缓冲区,用最近邻距离做相似度。
  • ReID 训练:分类模式(Deep SORT)vs 度量学习(JDE,更契合 MOT);混合最优。

6.2 五大方法分类

类别 核心思想 代表方法
① Joint Detection & Embedding (JDE) 单模型同时做检测+外观提取(one-shot) JDE、FairMOT、TransTrack
② Heuristic-based 仅靠关联启发式,无模型改进(基于 SDE) ByteTrack、BoT-SORT、ImprAsso、SparseTrack、C-BIoU、Hybrid-SORT、BoostTrack(++)
③ Motion-based 改进/替换运动模型以处理非线性运动 OC-SORT、Deep OC-SORT、MotionTrack、ETTrack、MoveSORT、DeepMoveSORT、UCMCTrack
④ Affinity learning 学习几何/运动/外观相似度函数 StrongSORT++(AFLink)、TWIX、SMILETrack、QDTrack
⑤ Offline 全局关联(所有检测先获取),基于 GNN MPNTrack、SUSHI、CoNo-Link

6.3 各类方法要点

① JDE 类

  • JDE:检测+ReID 联合,one-shot,比 Deep SORT 快约 4×,但精度略低;用外观特征滑动平均而非缓冲区;度量学习。
  • FairMOT:解决检测/ReID 任务不平衡,用 anchor-free CenterNet + 低维 ReID 特征。
  • TransTrack:介于两范式之间,DETR + 额外 track decoder,track query 基于历史;仍需 IoU 关联(非全端到端)。

② Heuristic 类(”现代 SORT”)

  • ByteTrack:最具影响力。Byte 关联——两层级联:①高分检测关联 active/lost 轨迹(运动+外观);②低分检测关联剩余 active 轨迹(仅运动,因遮挡框外观差)。对 detτ 更鲁棒;配 YOLOX。
  • BoT-SORT:ByteTrack + bag-of-tricks——自适应 KF(噪声随框尺寸)、相机运动补偿 CMC (GMC)、更强 ReID(BoT-SBS50)、新关联代价(含 proximity 门控)。
  • ImprAsso:combined matching,高低分检测单步关联(低分距离乘缩放因子 β);遮挡感知初始化。
  • SparseTrack:基于伪深度(框垂直位置)分层级联关联,拥挤场景强、无需 ReID。
  • C-BIoU / Deep-EIoU:框形状缓冲(扩张 BIoU),级联多级扩张,对非线性运动鲁棒。
  • Hybrid-SORT:tracklet 置信度建模 + HMIoU(高度调制 IoU)。
  • BoostTrack(++):丰富启发式集合——置信度增强、Mahalanobis 距离(softmax 归一化)+ IoU + 形状距离,极拥挤场景(MOT20)强。
  • Tracktor:无额外训练,直接复用 Faster R-CNN 的回归器对齐轨迹框。

③ Motion 类

线性 KF 在 MOTChallenge(线性运动)SOTA,但在 DanceTrack/SportsMOT(非线性)失效。

  • OC-SORT:观察中心化——ORU(遮挡后插值重更新 KF 修正累积误差)、OCM(动量作相似度)、OCR(用最后观测位置关联)。
  • Deep OC-SORT:+ CMC + ReID + 动态外观(动量随检测分数变化)。
  • 深度运动模型:MotionTrack(Transformer + 交互建模)、ETTrack(Transformer+TCN,动量校正损失)、MoveSORT(深度滤波器替代 KF,Bayesian/端到端两族)、DeepMoveSORT(+ ReID,SOTA on 非线性数据集)。
  • UCMCTrack:投到地平面做点跟踪,无需 CMC/ReID 即强;但需手动调相机参数(限制泛化)。

④ Affinity learning 类

  • StrongSORT++:AFLink 模块全局链轨迹(仅用坐标轨迹,1D CNN+MLP 预测连通性)+ GPR 插值;不能修 ID 切换。
  • TWIX / C-TWIX:对比学习检测同对象轨迹对,Transformer 编码,无需 IoU/外观即达 SOTA。
  • SMILETrack:SLM 模块(ViT)预测外观相似度替代标准 ReID。
  • QDTrack:准稠密对比采样,纯外观,可从静态图学习,BDD100K SOTA。

⑤ Offline 类(GNN)

  • MPNTrack:检测为节点、关系为边,消息传递网络(MPN)迭代更新;时间感知;图随视频长度指数增长需剪枝(保留 top-50 近邻)。
  • SUSHI:层次化图,逐级扩展轨迹长度(2→4→…→512),权重共享;+ 运动特征。
  • CoNo-Link:NodeNet(Transformer)建模关联似然,剪枝保留关键边(5~10),含 det-det/det-track/track-track 边;最复杂但多数据集最强。

6.4 范式讨论

  • 优点:模块化,各组件可独立替换(检测器/运动模型/关联)。
  • 缺点依赖数据集特定启发式;KF 需调参且不适非线性;过度工程化(如 DeepMoveSORT 牺牲简洁性)。
  • 作者观点Affinity learning(含 offline GNN)是 tracking-by-detection 最自然的演进方向——可从数据学习,又保留模块化。

七、End-to-End 范式

定义:检测与关联联合训练,关联后无需后处理,仅保留轨迹管理逻辑。多为 DETR 扩展(tracking-by-query)。

方法 核心机制 备注
MOTR DETR + track query(编码历史)+ TAN(时序聚合)迭代更新 先驱;检测弱(新生对象监督少)
TrackFormer 类 MOTR,依赖 NMS、无 TAN 非完全端到端
MOTRv2 引入 YOLOX 生成提案作 anchor 性能强,但引入独立检测器,非真端到端
MOTRv3 改二部匹配(自动平衡 track/detect query)+ YOLOX 伪标签蒸馏(仅训练)+ track group query 与 MOTRv2 持平且保持端到端
MeMOT 时空记忆缓冲区(短/长期)+ memory aggregator 预测 objectness/uniqueness
MeMOTR 长期记忆嵌入(decoder 输出滑动平均)作 key 类 MeMOT
MOTIP MOT as ID Prediction:用轨迹历史作 KV,检测作 query 分类 ID;可学习 ID 字典 与 affinity learning 相似;与最佳 tracking-by-query 持平

讨论:完全可微、可联合优化、泛化性好;但算力需求大(多 GPU 高显存)、推理慢(难实时)、极拥挤场景弱(DETR 小目标密集检测差)。


八、方法对比与实验结论

8.1 总体性能演进(2022→2024,HOTA)

  • MOT17:63.1%(ByteTrack)→ 67.1%(CoNo-Link),+4.0%
  • MOT20:61.3% → 66.4%(BoostTrack++),+5.1%
  • DanceTrack:53.6% → 73.4%(MOTRv2),+19.8%(端到端驱动)

8.2 各数据集结论

数据集 最优范式 关键发现
MOT17/MOT20(拥挤+线性) 启发式 TbD BoostTrack++/ImprAsso/CoNo-Link Pareto 最优;端到端明显落后;KF 足够,可学习运动模型反而次优;CMC 关键(+1.01.5% HOTA on MOT17);ReID 作用小(+0.40.7%)
DanceTrack(非线性) 端到端 MOTRv2 最优(73.4%);连最弱端到端 MeMOTR 也超最佳 TbD 4.7%;可学习运动模型+强 ReID 对 TbD 至关重要(DeepMoveSORT +9.4%)
SportsMOT(极端运动) TbD(检测器优势) DeepMoveSORT 78.7% HOTA 最优;TbD 超端到端达 6.8%(但检测器训练集不同,不完全公平);BoT-SORT(+ReID) 超 ByteTrack 4.6%;框扩张启发式有效

8.3 关联组件有效性(因域而异)

组件 MOTChallenge(线性/拥挤) DanceTrack/SportsMOT(非线性)
运动模型 KF 足够,深度模型无益甚至有害 深度运动模型关键(+最高 4.8%)
ReID 模型 作用小(+0.4~0.7%) 重要(+最高 5.2%)
CMC 关键(MOT17,+1~1.5%) 次要(运动/ReID 模型可替代)
启发式 极有效(拥挤核心) 有益,但不如运动/ReID;框扩张有效

8.4 跨域泛化(加权宏平均基准)

  • Table 7(MOT17/20 + DanceTrack):范式排序 端到端 > offline > TbD;MOTRv2 最优(67.4% HOTA),ByteTrack MOTA 最优(85.7%)。
  • Table 8(+SportsMOT):DeepMoveSORT 最优(67.9% HOTA),ByteTrack MOTA 最优(89.1%)。
  • 局限:很多方法只在 1~2 域评测,难以充分评估泛化性;真端到端在 MOT20 缺结果(推测 DETR 拥挤小目标差)。

九、核心结论与启示

  1. 没有通用最优解,因域而异

    • 拥挤 + 线性运动 → 启发式 TbD(BoostTrack++、ImprAsso、CoNo-Link)。
    • 复杂非线性运动 → 深度学习关联(端到端 MOTRv2/MOTIP;TbD 中 DeepMoveSORT/Deep OC-SORT)。
  2. 启发式的天花板与代价:重工程启发式在 MOTChallenge 刷到 SOTA,但依赖手工调参、难泛化;其性能不随数据规模提升

  3. 可学习方法的潜力:affinity learning(含 GNN offline)与端到端方法可从数据学习、少调参,是更通用的方向;GNN offline 在 TbD 内优于在线变体。

  4. 检测器是隐藏变量:TbD 用 YOLOX,端到端用 DETR,检测质量差异(DetA)使纯关联对比不完全公平。

  5. 评测建议:应在多数据集评估泛化性,而非单一域;理想方案是大规模多域 MOT 数据集。

  6. 范式演进脉络:SORT → Deep SORT(+外观)→ ByteTrack(现代基线)→ BoT-SORT(+CMC/ReID)→ OC-SORT(非线性)→ 深度运动模型 / affinity learning / GNN → 端到端 MOTR 系。TransTrack→TrackFormer→MOTR 为端到端的过渡。


十、方法速查表

方法 年份 类别/范式 一句话特点
SORT 2016 基线 KF + IoU 匈牙利关联,先驱
Deep SORT 2017 基线 + ReID 外观,缓冲区最近邻
JDE / FairMOT 2020/2021 JDE 检测+ReID 联合 one-shot
ByteTrack 2022 启发式 高低分层级联,现代 SORT
BoT-SORT 2022 启发式 +自适应KF+CMC+强ReID
OC-SORT 2023 运动 观察中心化,修 KF 误差
Deep OC-SORT 2023 运动 +CMC+ReID+动态外观
DeepMoveSORT 2024 运动 深度滤波器+ReID,非线性 SOTA
UCMCTrack 2024 运动 地平面点跟踪,无 CMC/ReID
BoostTrack++ 2024 启发式 丰富启发式,MOT20 SOTA
ImprAsso 2023 启发式 combined matching
CoNo-Link 2024 Offline/GNN NodeNet+GNN,多数据集强
SUSHI 2022 Offline/GNN 层次化图
MOTR / MOTRv3 2022/2023 端到端 track query 迭代更新
MOTRv2 2023 端到端* +YOLOX 提案,DanceTrack SOTA(非真端到端)
MOTIP 2024 端到端 MOT as ID Prediction

附:转换说明

  • PDF→Markdown 转换工具:pymupdf4llm(开源,已禁用 OCR,直接提取数字文本)。
  • 图片提取至 Clippings/2506.13457_images/(43 张)。
  • 公式以图片形式保留在转换文件 [[Clippings/2506.13457v1.md]] 中。