SMILEtrack: SiMIlarity LEarning for Occlusion-Aware Multiple Object Tracking
Yu-Hsiang Wang, Jun-Wei Hsieh, Ping-Yang Chen, Ming-Ching Chang, Hung-Hin So, Xin Li
Abstract
Despite recent progress in Multiple Object Tracking (MOT), several obstacles such as occlusions, similar objects, and complex scenes remain an open challenge. Meanwhile, a systematic study of the cost-performance tradeoff for the popular tracking-by-detection paradigm is still lacking. This paper introduces SMILEtrack, an innovative object tracker that effectively addresses these challenges by integrating an efficient object detector with a Siamese network-based Similarity Learning Module (SLM). The technical contributions of SMILETrack are twofold. First, we propose an SLM that calculates the appearance similarity between two objects, overcoming the limitations of feature descriptors in Separate Detection and Embedding (SDE) models. The SLM incorporates a Patch Self-Attention (PSA) block inspired by the vision Transformer, which generates reliable features for accurate similarity matching. Second, we develop a Similarity Matching Cascade (SMC) module with a novel GATE function for robust object matching across consecutive video frames, further enhancing MOT performance. Together, these innovations help SMILETrack achieve an improved trade-off between the cost (e.g., running speed) and performance (e.g., tracking accuracy) over several existing state-of-the-art benchmarks, including the popular BYTE-Track method. SMILETrack outperforms BYTETrack by 0.4-0.8 MOTA and 2.1-2.2 HOTA points on MOT17 and MOT20 datasets. Code is available at https://github.com/ pingyang1117/SMILEtrack_official.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 70d9e774-17e1-4e6d-bb7d-1c56eeed3039Cited by top-tier papers10
- LA-MOTR: End-to-End Multi-Object Tracking by Learnable AssociationPeng Wang, Yongcai Wang, Hualong Cao, Wang Chen et al.ICCV 2025 · 9 citations
- DanceFix: An Exploration in Group Dance Neatness Assessment Through Fixing Abnormal Challenges of Human PoseHuangbiao Xu, Xiao Ke, Huanqi Wu, Rui Xu et al.AAAI 2025 · 8 citations
- Tracking the Unstable: Appearance-Guided Motion Modeling for Robust Multi-Object Tracking in UAV-Captured VideosJianbo Ma, Hui Luo, Qi Chen, Yuankai Qi et al.AAAI 2026 · 2 citations
- Out of Sight, Out of Track: Adversarial Attacks on Propagation-based Multi-Object Trackers via Query State ManipulationHalima Bouzidi, Haoyu Liu, Yonatan Achamyeleh, Praneetsai Iddamsetty et al.CVPR 2026 · 1 citation
- Occlusion-Aware SORT: Observing Occlusion for Robust Multi-Object TrackingChunjiang Li, Jianbo Ma, Li Shen, Yanru Chen et al.CVPR 2026 · 1 citation
Builds on9
- An Image is Worth 16x16 Words: Transformers for Image Recognition at ScaleAlexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn et al.ICLR 2021 · 21,477 citations
- Deformable DETR: Deformable Transformers for End-to-End Object DetectionXizhou Zhu, Weijie Su, Lewei Lu, Bin Li et al.ICLR 2021 · 7,353 citations
- TrackFormer: Multi-Object Tracking with TransformersTim Meinhardt, Alexander Kirillov, Laura Leal-Taixé, Christoph FeichtenhoferCVPR 2022 · 927 citations
- Learning to Track with Object PermanencePavel Tokmakov, Jie Li, Wolfram Burgard, Adrien GaidonICCV 2021 · 241 citations
- TubeTK: Adopting Tubes to Track Multi-Object in a One-Step Training ModelBo Pang, Yizhuo Li, Yifan Zhang, Muchen Li et al.CVPR 2020
Related papers
- MotionTrack: Learning Robust Short-Term and Long-Term Motions for Multi-Object TrackingZheng Qin, Sanping Zhou, Le Wang, Jinghai Duan et al.CVPR 2023
- ADA-Track: End-to-End Multi-Camera 3D Multi-Object Tracking with Alternating Detection and AssociationShuxiao Ding, Lukas Schneider, Marius Cordts, Juergen GallCVPR 2024
- Quasi-Dense Similarity Learning for Multiple Object TrackingJiangmiao Pang, Linlu Qiu, Xia Li, Haofeng Chen et al.CVPR 2021
- SeqTrack: Sequence to Sequence Learning for Visual Object TrackingXin Chen, Houwen Peng, Dong Wang, Huchuan Lu et al.CVPR 2023
- Simple Cues Lead to a Strong Multi-Object TrackerJenny Seidenschwarz, Guillem Brasó, Victor Castro Serrano, Ismail Elezi et al.CVPR 2023
