Cross-View Referring Multi-Object Tracking
Sijia Chen, En Yu, Wenbing Tao
摘要
Referring Multi-Object Tracking (RMOT) is an important topic in the current tracking field. Its task form is to guide the tracker to track objects that match the language description. Current research mainly focuses on referring multi-object tracking under single-view, which refers to a view sequence or multiple unrelated view sequences. However, in the single-view, some appearances of objects are easily invisible, resulting in incorrect matching of objects with the language description. In this work, we propose a new task, called Cross-view Referring Multi-Object Tracking (CRMOT). It introduces the cross-view to obtain the appearances of objects from multiple views, avoiding the problem of the invisible appearances of objects in RMOT task. CRMOT is a more challenging task of accurately tracking the objects that match the language description and maintaining the identity consistency of objects in each cross-view. To advance CRMOT task, we construct a cross-view referring multi-object tracking benchmark based on CAMPUS and DIVOTrack datasets, named CRTrack. Specifically, it provides 13 different scenes and 221 language descriptions. Furthermore, we propose an end-to-end cross-view referring multi-object tracking method, named CRTracker. Extensive experiments on the CRTrack benchmark verify the effectiveness of our method.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper5
- PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched TrainingWeifu Fu, Jinyang Li, Bin-Bin Gao, Jialin Li 等CVPR 2026 · 被引用 3 次
- Disentangling Instance and Scene Contexts for 3D Semantic Scene CompletionEnyu Liu, En Yu, Sijia Chen, Wenbing TaoICCV 2025 · 被引用 2 次
- AerialMind: Towards Referring Multi-Object Tracking in UAV ScenariosChenglizhao Chen, Shaofeng Liang, Runwei Guan, Xiaolou Sun 等AAAI 2026 · 被引用 2 次
- Multi-view Crowd Tracking Transformer with View-Ground Interactions Under Large Real-World ScenesQi Zhang, Jixuan Chen, Zhang Kaiyi, Xinquan Yu 等CVPR 2026
- OVTR: End-to-End Open-Vocabulary Multiple Object Tracking with TransformerJinyang Li, En Yu, Sijia Chen, Wenbing TaoICLR 2025
它引用的顶会 Paper10
- Swin Transformer: Hierarchical Vision Transformer using Shifted WindowsZe Liu, Yutong Lin, Yue Cao, Han Hu 等ICCV 2021 · 被引用 31,683 次
- Towards Unified Text-based Person Retrieval: A Large-scale Multi-Attribute and Language Search BenchmarkShuyu Yang, Yinan Zhou, Zhedong Zheng, Yaxiong Wang 等ACM MM 2023 · 被引用 162 次
- UCMCTrack: Multi-Object Tracking with Uniform Camera Motion CompensationKefu Yi, Kai Luo, Xiaolei Luo, Jiangui Huang 等AAAI 2024 · 被引用 119 次
- Self-supervised Multi-view Multi-Human Association and TrackingYiyang Gan, Ruize Han, Liqiang Yin, Wei Feng 等ACM MM 2021 · 被引用 44 次
- ReST: A Reconfigurable Spatial-Temporal Graph Model for Multi-Camera Multi-Object TrackingCheng-Che Cheng, Min-Xuan Qiu, Chen-Kuo Chiang, Shang-Hong LaiICCV 2023 · 被引用 39 次
相关 Paper
- Referring Multi-Object TrackingDongming Wu, Wencheng Han, Tiancai Wang, Xingping Dong 等CVPR 2023
- Language Decoupling with Fine-Grained Knowledge Guidance for Referring Multi-Object TrackingGuangyao Li, Siping Zhuang, Yajun Jian, Yan Yan 等ICCV 2025 · 被引用 8 次
- Rethinking Two-Stage Referring-by-Tracking in Referring Multi-Object Tracking: Make it Strong AgainWeize Li, Yunhao Du, Qixiang Yin, Zhicheng Zhao 等CVPR 2026
- Long-RVOS: A Comprehensive Benchmark for Long-term Referring Video Object SegmentationTianming Liang, Haichao Jiang, Yuting Yang, Chaolei Tan 等CVPR 2026 · 被引用 8 次
- MITracker: Multi-View Integration for Visual Object TrackingMengjie Xu, Yitao Zhu, Haotian Jiang, Jiaming Li 等CVPR 2025
