ITADN
IDEA-Research/TAPTR · 文件 下载 ZIP
文件最后提交记录最后更新时间
README.md
以下内容由 AI 翻译,如有问题请点此提交 issue 反馈

TAPTR: Tracking Any Point TRansformers

我们在本仓库中开源了 TAPTRv1、TAPTRv2 和 TAPTRv3(尚未发布)。您可以在相应的分支中找到它们。

这些工作由 Hongyang LiJinyuan QuHao ZhangShilong LiuZhaoyang ZengTianhe RenFeng LiBohan LiLei Zhang :email: 完成。

论文链接: TAPTRv1 | TAPTRv2 | TAPTRv3

更多链接: TAPTR 项目主页 | 演示 (v3) | BibTeX | IDEA-Research

:fire: 新闻

[2026/2/10] TAPTRv3 的代码已发布。

[2026/1/26] TAPTRv3 已被 ICLR2026 接收。

[2024/11/28] 我们发布了 TAPTRv3 论文。

[2024/11/25] TAPTRv2 的代码已发布。

[2024/9/26] TAPTRv2 已被 NeurIPS2024 接收。

[2024/7/24] 我们发布了 TAPTRv2 论文。

[2024/7/16] TAPTRv1 的代码已发布。

[2024/7/9] TAPTRv1 已被 ECCV2024 接收。

[2024/3/15] 我们发布了 TAPTRv1 论文。

:dna: 什么是 TAPTR。

受近期基于视觉提示的检测 [1] 启发,我们提出将 Track Any Point (TAP) 任务转化为点级视觉提示检测任务。基于近期先进的 DEtection TRansformer (DETR) [2, 3, 4, 5],我们提出了我们的 Track Any Point TRansformer (TAPTR)。

[1] T-rex2: Towards Generic Object Detection via Text-visual Prompt Synergy. IDEA-Research. ECCV2024.

[2] DAB-DETR: Dynamic Anchor Boxes are Better Queries for DETR. IDEA-Research. ICLR2022.

[3] DN-DETR: Accelerate DETR Training by Introducing Query DeNoising. IDEA-Research. CVPR2022.

[4] DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection. IDEA-Research. ICLR2023.

[5] DINO-X: A Unified Vision Model for Open-World Object Detection and Understanding. IDEA-Research. ArXiv2024.

:footprints: 从 V1 到 V3 的简要概述。

TAPTRv1 - 简单而强大的基线。

TAPTRv1 首次提出从检测的角度来解决 TAP 任务。TAPTRv1 没有基于传统的光流方法,而是首个提出采用更先进的 DETR 类框架用于 TAP 任务。与之前的方法相比,TAPTRv1 具有更清晰、更简单的点查询定义以及更好的性能。

尽管 TAPTRv1 使用 DETR 类框架实现了 SoTA 性能,但 TAPTRv1 仍然需要消耗源的成本体积来获得其最佳性能。

TAPTRv1

TAPTRv2 - 更简单且更强。

TAPTRv2 发现对 cost-volume 的依赖源于__训练数据与评估数据之间的领域差距__。TAPTRv1 中 cost-volume 的使用也会__污染点查询__。TAPTRv2 发现__注意力权重与 cost-volume 本质上是相同的__(key-aware deformable cross attention 中的注意力权重可视为稀疏 cost-volume)。TAPTRv2 提出了__基于注意力的位置更新(APU)__,以利用这种与领域无关的信息,同时防止点查询被污染。消除 cost-volume 使 TAPTRv2__统一__了对象级和点级感知的框架。

尽管 TAPTRv2 实现了更简单的框架和更好的性能,但 TAPTRv2 在长视频中的性能仍不尽如人意。

TAPTRv2

TAPTRv3 - 性能大幅提升,尤其在长期跟踪方面。

TAPTRv3 发现 TAPTRv2 在长视频上表现不佳是由于其在长视频的空间和时间维度上特征查询不足。为了__更好地进行时间特征查询__,TAPTRv3 没有使用类 RNN 的长时建模,而是将时间注意力从小窗口扩展到任意长度,同时考虑目标跟踪点的可见性,并提出了__可见性感知的长时注意力__(VLTA)。为了__更好地进行空间特征查询__,TAPTRv3 利用空间上下文来提高交叉注意力中注意力权重的质量,并提出了__上下文感知的交叉注意力__(CCA)。为了帮助 TAPTRv3 在长视频中常见的场景切换伴随突然大幅运动时重新建立跟踪,TAPTRv3 提出__在检测到场景切换时触发全局匹配模块以重置点查询的初始位置__。TAPTRv3 在几乎所有 TAP 数据集上均达到了 SoTA 性能,即使与使用大规模额外内部数据训练的方法相比,TAPTRv3 仍具有竞争力。

TAPTRv3

:100: 性能

performance

经过三个版本的优化,TAPTRv3 达到了最先进的性能。即使与使用大规模额外内部数据训练的方法相比(我们仅在小型合成数据集上训练 TAPTRv3,而 BootsTAPIR 和 CoTracker3 在其大规模内部真实世界数据集上进行了微调),TAPTRv3 仍然具有竞争力。

:spiral_calendar: 未来工作与合作机会。

  1. 将 TAPTR 扩展为 Track Any Visual Prompt TRansformer (TAVTR)。
  2. 探索 TAPTR 在具身智能场景中的应用。

如果您对合作感兴趣,请随时联系我们!

:herb: 致谢

我们感谢 TAP-VidCo-Tracker 公开发布了他们的代码和数据。

:black_nib: 引用

@inproceedings{li2024taptr,
  title={{TAPTR: Tracking Any Point with Transformers as Detection}},
  author={Li, Hongyang and Zhang, Hao and Liu, Shilong and Zeng, Zhaoyang and Ren, Tianhe and Li, Feng and Zhang, Lei},
  booktitle={European Conference on Computer Vision},
  pages={57--75},
  year={2024},
  organization={Springer}
}
@article{li2024taptrv2
  title={{TAPTRv2: Attention-based Position Update Improves Tracking Any Point}},
  author={Li, Hongyang and Zhang, Hao and Liu, Shilong and Zeng, Zhaoyang and Li, Feng and Ren, Tianhe and Li, Bohan and Zhang, Lei},
  journal={Advances in Neural Information Processing Systems},
  year={2024}
}
@article{qu2024taptrv3,
  title={{TAPTRv3: Spatial and Temporal Context Foster Robust Tracking of Any Point in Long Video}},
  author={Qu, Jinyuan and Li, Hongyang and Liu, Shilong and Ren, Tianhe and Zeng, Zhaoyang and Zhang, Lei},
  journal={arXiv preprint arXiv:2411.18671},
  year={2024}
}