深度学习多目标跟踪综述梳理
深度学习多目标跟踪(MOT)综述梳理
本笔记是对综述 Deep Learning-Based Multi-Object Tracking: A Comprehensive Survey from Foundations to State-of-the-Art(arXiv:2506.13457)的系统梳理。原始转换文件见 [[Clippings/2506.13457v1.md]]。
一、综述定位与贡献
- 主题:深度学习驱动的多目标跟踪(MOT),聚焦 2022 年以来的现代方法。
- 两大范式:
- Tracking-by-Detection(检测再关联) —— 检测与关联解耦,仍是主流。
- End-to-End(端到端) —— 检测与关联联合训练,以 DETR 系(tracking-by-query)为代表。
- 四大贡献:
- 系统梳理 2022 年起的现代深度 MOT 方法;
- 将 tracking-by-detection 划分为 五大类别;
- 在多基准上跨域对比,并自建加权宏平均基准评估泛化性;
- 提供详尽背景知识,兼顾不同基础读者。
二、MOT 问题与基础概念
2.1 任务定义
- 在视频中检测给定类别的对象,并跨帧关联(赋予唯一 ID),输出每个对象的轨迹 τ。
- 核心难点:频繁遮挡(导致 ID 切换/丢失)、外观相似(难区分)、运动不可预测。
- 应用:自动驾驶、体育分析、零售、机器人、生物、监控等。
2.2 通用流水线
输入视频帧 → 输出每帧的边界框(坐标、类别、ID)。关联发生在检测之后。
2.3 错误类型
| 类别 | 错误 | 说明 |
|---|---|---|
| 关联错误 | FP track / FN track / ID switch | 虚假轨迹、漏轨迹、ID 混淆 |
| 检测错误 | FP detection / FN detection / 定位误差 | 假阳性检测、漏检、框偏移 |
术语区分:match 指评测时预测与真值配对;association 指推理时轨迹与检测配对。
三、评估指标
| 指标 | 匹配层级 | 侧重 | 说明 |
|---|---|---|---|
| MOTA | 检测级 | 检测为主 | 1 − (FP+FN+IDSW)/gtDet,受检测性能影响大,范围为 −∞~1 |
| MOTP | 检测级 | 定位精度 | 匹配对的平均相似度 |
| IDF1 | 轨迹级 | 关联为主 | 对 ID 切换敏感,偏向关联性能 |
| HOTA | 检测级 | 检测+关联平衡 | DetA 与 AssA 的几何平均;多阈值(0.05~0.95)平均,是基准主指标 |
| IDSW | — | — | ID 切换总次数,越低越好 |
- DetA = Jaccard 指数(TP/(TP+FP+FN));AssA 评估匹配检测的轨迹对齐质量。
- 匹配通过匈牙利算法求解二部图最优指派,相似度用 IoU(2D 框)。
四、基准数据集
| 数据集 | 场景 | 帧数 | 特点 | 主要挑战 |
|---|---|---|---|---|
| MOT17 | 14 | 14,235 | 非静态相机、行人、线性运动 | 拥挤、遮挡 |
| MOT20 | 8 | 13,410 | 静态相机、极拥挤(1.65M 框) | 重度拥挤 |
| DanceTrack | 100 | 105,855 | 舞者、外观相似、非线性运动 | 复杂运动 |
| SportsMOT | 240 | 150,379 | 篮球/排球/足球、高速多变 | 极端运动多样性 |
关键洞察:单数据集评测无法体现泛化性。MOTChallenge 运动可预测但拥挤;DanceTrack/SportsMOT 强调运动多样性与外观相似性。
五、深度学习目标检测模型(三大族)
Tracking-by-detection 的检测器基础,分三类:
| 族 | 代表 | 特点 | NMS 依赖 |
|---|---|---|---|
| Proposal-based(两阶段) | R-CNN → Fast/Faster R-CNN → Mask R-CNN | 区域提议+分类回归,精度高、速度慢 | 是 |
| Grid-based(单阶段) | YOLO 系列、YOLOX(anchor-free) | 实时、回归式;YOLOX 为 MOT 基准默认检测器 | 是(anchorless 仍需) |
| Query-based | DETR、DAB-DETR、DINO、RT-DETR | 集合预测、匈牙利二部匹配、无需 NMS、端到端;收敛慢、小目标弱 | 否 |
- DETR 是端到端跟踪方法(MOTR 系)的基石。
六、Tracking-by-Detection 范式(核心)
核心论断:所有 tracking-by-detection 算法本质上都是 SORT 的变体。检测与关联解耦,模块化、灵活、可独立优化。
6.1 两大基线
SORT(先驱)
三大组件 + 轨迹管理:
- 检测:仅保留高置信度框,对检测分数阈值
detτ极敏感。 - 运动模型:卡尔曼滤波(KF),线性匀速假设;状态
[x, y, s, r, ẋ, ẏ, ṡ]。 - 关联:匈牙利算法,代价 = 负 IoU,设 IoU 门控阈值。
- 轨迹管理:四状态
active / lost / deleted / new;试用期(默认 3 帧)、T_lost=1(不处理长时遮挡)。 - 缺点:ID 切换频繁(运动模型精度低,遮挡累积误差)。
Deep SORT
- 在 SORT 基础上融合外观:CNN(ReID 模型)提取外观嵌入,余弦距离比较。
- 轨迹维护外观特征缓冲区,用最近邻距离做相似度。
- ReID 训练:分类模式(Deep SORT)vs 度量学习(JDE,更契合 MOT);混合最优。
6.2 五大方法分类
| 类别 | 核心思想 | 代表方法 |
|---|---|---|
| ① Joint Detection & Embedding (JDE) | 单模型同时做检测+外观提取(one-shot) | JDE、FairMOT、TransTrack |
| ② Heuristic-based | 仅靠关联启发式,无模型改进(基于 SDE) | ByteTrack、BoT-SORT、ImprAsso、SparseTrack、C-BIoU、Hybrid-SORT、BoostTrack(++) |
| ③ Motion-based | 改进/替换运动模型以处理非线性运动 | OC-SORT、Deep OC-SORT、MotionTrack、ETTrack、MoveSORT、DeepMoveSORT、UCMCTrack |
| ④ Affinity learning | 学习几何/运动/外观相似度函数 | StrongSORT++(AFLink)、TWIX、SMILETrack、QDTrack |
| ⑤ Offline | 全局关联(所有检测先获取),基于 GNN | MPNTrack、SUSHI、CoNo-Link |
6.3 各类方法要点
① JDE 类
- JDE:检测+ReID 联合,one-shot,比 Deep SORT 快约 4×,但精度略低;用外观特征滑动平均而非缓冲区;度量学习。
- FairMOT:解决检测/ReID 任务不平衡,用 anchor-free CenterNet + 低维 ReID 特征。
- TransTrack:介于两范式之间,DETR + 额外 track decoder,track query 基于历史;仍需 IoU 关联(非全端到端)。
② Heuristic 类(”现代 SORT”)
- ByteTrack:最具影响力。Byte 关联——两层级联:①高分检测关联 active/lost 轨迹(运动+外观);②低分检测关联剩余 active 轨迹(仅运动,因遮挡框外观差)。对
detτ更鲁棒;配 YOLOX。 - BoT-SORT:ByteTrack + bag-of-tricks——自适应 KF(噪声随框尺寸)、相机运动补偿 CMC (GMC)、更强 ReID(BoT-SBS50)、新关联代价(含 proximity 门控)。
- ImprAsso:combined matching,高低分检测单步关联(低分距离乘缩放因子 β);遮挡感知初始化。
- SparseTrack:基于伪深度(框垂直位置)分层级联关联,拥挤场景强、无需 ReID。
- C-BIoU / Deep-EIoU:框形状缓冲(扩张 BIoU),级联多级扩张,对非线性运动鲁棒。
- Hybrid-SORT:tracklet 置信度建模 + HMIoU(高度调制 IoU)。
- BoostTrack(++):丰富启发式集合——置信度增强、Mahalanobis 距离(softmax 归一化)+ IoU + 形状距离,极拥挤场景(MOT20)强。
- Tracktor:无额外训练,直接复用 Faster R-CNN 的回归器对齐轨迹框。
③ Motion 类
线性 KF 在 MOTChallenge(线性运动)SOTA,但在 DanceTrack/SportsMOT(非线性)失效。
- OC-SORT:观察中心化——ORU(遮挡后插值重更新 KF 修正累积误差)、OCM(动量作相似度)、OCR(用最后观测位置关联)。
- Deep OC-SORT:+ CMC + ReID + 动态外观(动量随检测分数变化)。
- 深度运动模型:MotionTrack(Transformer + 交互建模)、ETTrack(Transformer+TCN,动量校正损失)、MoveSORT(深度滤波器替代 KF,Bayesian/端到端两族)、DeepMoveSORT(+ ReID,SOTA on 非线性数据集)。
- UCMCTrack:投到地平面做点跟踪,无需 CMC/ReID 即强;但需手动调相机参数(限制泛化)。
④ Affinity learning 类
- StrongSORT++:AFLink 模块全局链轨迹(仅用坐标轨迹,1D CNN+MLP 预测连通性)+ GPR 插值;不能修 ID 切换。
- TWIX / C-TWIX:对比学习检测同对象轨迹对,Transformer 编码,无需 IoU/外观即达 SOTA。
- SMILETrack:SLM 模块(ViT)预测外观相似度替代标准 ReID。
- QDTrack:准稠密对比采样,纯外观,可从静态图学习,BDD100K SOTA。
⑤ Offline 类(GNN)
- MPNTrack:检测为节点、关系为边,消息传递网络(MPN)迭代更新;时间感知;图随视频长度指数增长需剪枝(保留 top-50 近邻)。
- SUSHI:层次化图,逐级扩展轨迹长度(2→4→…→512),权重共享;+ 运动特征。
- CoNo-Link:NodeNet(Transformer)建模关联似然,剪枝保留关键边(5~10),含 det-det/det-track/track-track 边;最复杂但多数据集最强。
6.4 范式讨论
- 优点:模块化,各组件可独立替换(检测器/运动模型/关联)。
- 缺点:依赖数据集特定启发式;KF 需调参且不适非线性;过度工程化(如 DeepMoveSORT 牺牲简洁性)。
- 作者观点:Affinity learning(含 offline GNN)是 tracking-by-detection 最自然的演进方向——可从数据学习,又保留模块化。
七、End-to-End 范式
定义:检测与关联联合训练,关联后无需后处理,仅保留轨迹管理逻辑。多为 DETR 扩展(tracking-by-query)。
| 方法 | 核心机制 | 备注 |
|---|---|---|
| MOTR | DETR + track query(编码历史)+ TAN(时序聚合)迭代更新 | 先驱;检测弱(新生对象监督少) |
| TrackFormer | 类 MOTR,依赖 NMS、无 TAN | 非完全端到端 |
| MOTRv2 | 引入 YOLOX 生成提案作 anchor | 性能强,但引入独立检测器,非真端到端 |
| MOTRv3 | 改二部匹配(自动平衡 track/detect query)+ YOLOX 伪标签蒸馏(仅训练)+ track group query | 与 MOTRv2 持平且保持端到端 |
| MeMOT | 时空记忆缓冲区(短/长期)+ memory aggregator | 预测 objectness/uniqueness |
| MeMOTR | 长期记忆嵌入(decoder 输出滑动平均)作 key | 类 MeMOT |
| MOTIP | MOT as ID Prediction:用轨迹历史作 KV,检测作 query 分类 ID;可学习 ID 字典 | 与 affinity learning 相似;与最佳 tracking-by-query 持平 |
讨论:完全可微、可联合优化、泛化性好;但算力需求大(多 GPU 高显存)、推理慢(难实时)、极拥挤场景弱(DETR 小目标密集检测差)。
八、方法对比与实验结论
8.1 总体性能演进(2022→2024,HOTA)
- MOT17:63.1%(ByteTrack)→ 67.1%(CoNo-Link),+4.0%
- MOT20:61.3% → 66.4%(BoostTrack++),+5.1%
- DanceTrack:53.6% → 73.4%(MOTRv2),+19.8%(端到端驱动)
8.2 各数据集结论
| 数据集 | 最优范式 | 关键发现 |
|---|---|---|
| MOT17/MOT20(拥挤+线性) | 启发式 TbD | BoostTrack++/ImprAsso/CoNo-Link Pareto 最优;端到端明显落后;KF 足够,可学习运动模型反而次优;CMC 关键(+1.0 |
| DanceTrack(非线性) | 端到端 | MOTRv2 最优(73.4%);连最弱端到端 MeMOTR 也超最佳 TbD 4.7%;可学习运动模型+强 ReID 对 TbD 至关重要(DeepMoveSORT +9.4%) |
| SportsMOT(极端运动) | TbD(检测器优势) | DeepMoveSORT 78.7% HOTA 最优;TbD 超端到端达 6.8%(但检测器训练集不同,不完全公平);BoT-SORT(+ReID) 超 ByteTrack 4.6%;框扩张启发式有效 |
8.3 关联组件有效性(因域而异)
| 组件 | MOTChallenge(线性/拥挤) | DanceTrack/SportsMOT(非线性) |
|---|---|---|
| 运动模型 | KF 足够,深度模型无益甚至有害 | 深度运动模型关键(+最高 4.8%) |
| ReID 模型 | 作用小(+0.4~0.7%) | 重要(+最高 5.2%) |
| CMC | 关键(MOT17,+1~1.5%) | 次要(运动/ReID 模型可替代) |
| 启发式 | 极有效(拥挤核心) | 有益,但不如运动/ReID;框扩张有效 |
8.4 跨域泛化(加权宏平均基准)
- Table 7(MOT17/20 + DanceTrack):范式排序 端到端 > offline > TbD;MOTRv2 最优(67.4% HOTA),ByteTrack MOTA 最优(85.7%)。
- Table 8(+SportsMOT):DeepMoveSORT 最优(67.9% HOTA),ByteTrack MOTA 最优(89.1%)。
- 局限:很多方法只在 1~2 域评测,难以充分评估泛化性;真端到端在 MOT20 缺结果(推测 DETR 拥挤小目标差)。
九、核心结论与启示
没有通用最优解,因域而异:
- 拥挤 + 线性运动 → 启发式 TbD(BoostTrack++、ImprAsso、CoNo-Link)。
- 复杂非线性运动 → 深度学习关联(端到端 MOTRv2/MOTIP;TbD 中 DeepMoveSORT/Deep OC-SORT)。
启发式的天花板与代价:重工程启发式在 MOTChallenge 刷到 SOTA,但依赖手工调参、难泛化;其性能不随数据规模提升。
可学习方法的潜力:affinity learning(含 GNN offline)与端到端方法可从数据学习、少调参,是更通用的方向;GNN offline 在 TbD 内优于在线变体。
检测器是隐藏变量:TbD 用 YOLOX,端到端用 DETR,检测质量差异(DetA)使纯关联对比不完全公平。
评测建议:应在多数据集评估泛化性,而非单一域;理想方案是大规模多域 MOT 数据集。
范式演进脉络:SORT → Deep SORT(+外观)→ ByteTrack(现代基线)→ BoT-SORT(+CMC/ReID)→ OC-SORT(非线性)→ 深度运动模型 / affinity learning / GNN → 端到端 MOTR 系。TransTrack→TrackFormer→MOTR 为端到端的过渡。
十、方法速查表
| 方法 | 年份 | 类别/范式 | 一句话特点 |
|---|---|---|---|
| SORT | 2016 | 基线 | KF + IoU 匈牙利关联,先驱 |
| Deep SORT | 2017 | 基线 | + ReID 外观,缓冲区最近邻 |
| JDE / FairMOT | 2020/2021 | JDE | 检测+ReID 联合 one-shot |
| ByteTrack | 2022 | 启发式 | 高低分层级联,现代 SORT |
| BoT-SORT | 2022 | 启发式 | +自适应KF+CMC+强ReID |
| OC-SORT | 2023 | 运动 | 观察中心化,修 KF 误差 |
| Deep OC-SORT | 2023 | 运动 | +CMC+ReID+动态外观 |
| DeepMoveSORT | 2024 | 运动 | 深度滤波器+ReID,非线性 SOTA |
| UCMCTrack | 2024 | 运动 | 地平面点跟踪,无 CMC/ReID |
| BoostTrack++ | 2024 | 启发式 | 丰富启发式,MOT20 SOTA |
| ImprAsso | 2023 | 启发式 | combined matching |
| CoNo-Link | 2024 | Offline/GNN | NodeNet+GNN,多数据集强 |
| SUSHI | 2022 | Offline/GNN | 层次化图 |
| MOTR / MOTRv3 | 2022/2023 | 端到端 | track query 迭代更新 |
| MOTRv2 | 2023 | 端到端* | +YOLOX 提案,DanceTrack SOTA(非真端到端) |
| MOTIP | 2024 | 端到端 | MOT as ID Prediction |
附:转换说明
- PDF→Markdown 转换工具:
pymupdf4llm(开源,已禁用 OCR,直接提取数字文本)。 - 图片提取至
Clippings/2506.13457_images/(43 张)。 - 公式以图片形式保留在转换文件 [[Clippings/2506.13457v1.md]] 中。
