Multi-Label Activity Recognition Using Activity-Specific Features and Activity Correlations
Yanyi Zhang, Xinyu Li, Ivan Marsic
Abstract
Multi-label activity recognition is designed for recognizing multiple activities that are performed simultaneously or sequentially in each video. Most recent activity recognition networks focus on single-activities, that assume only one activity in each video. These networks extract shared features for all the activities, which are not designed for multi-label activities. We introduce an approach to multilabel activity recognition that extracts independent feature descriptors for each activity and learns activity correlations. This structure can be trained end-to-end and plugged into any existing network structures for video classification. Our method outperformed state-of-the-art approaches on four multi-label activity recognition datasets. To better understand the activity-specific features that the system generated, we visualized these activity-specific features in the Charades dataset. The code will be released later.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 8e1edc1c-13ac-4822-be03-e40a29fcd3d4Cited by top-tier papers5
- TubeR: Tubelet Transformer for Video Action DetectionJiaojiao Zhao, Yanyi Zhang, Xinyu Li, Hao Chen et al.CVPR 2022 · 77 citations
- Detector-Free Weakly Supervised Group Activity RecognitionDongkeun Kim, Jinsung Lee, Minsu Cho, Suha KwakCVPR 2022 · 62 citations
- AdaFPP: Adapt-Focused Bi-Propagating Prototype Learning for Panoramic Activity RecognitionMeiqi Cao, Rui Yan, Xiangbo Shu, Guangzhao Dai et al.ACM MM 2024 · 3 citations
- Open Set Action Recognition via Multi-Label Evidential LearningChen Zhao, Dawei Du, Anthony Hoogs, Christopher FunkCVPR 2023
- DeCo: Decomposition and Reconstruction for Compositional Temporal Grounding via Coarse-to-Fine Contrastive RankingLijin Yang, Quan Kong, Hsuan-Kung Yang, Wadim Kehl et al.CVPR 2023
Builds on7
- SlowFast Networks for Video RecognitionChristoph Feichtenhofer, Haoqi Fan, Jitendra Malik, Kaiming HeICCV 2019 · 4,104 citations
- Video Classification With Channel-Separated Convolutional NetworksDu Tran, Heng Wang, Matt Feiszli, Lorenzo TorresaniICCV 2019 · 647 citations
- Hallucinating IDT Descriptors and I3D Optical Flow Features for Action Recognition With CNNsLei Wang, Piotr Koniusz, Du HuynhICCV 2019 · 100 citations
- Action Genome: Actions As Compositions of Spatio-Temporal Scene GraphsJingwei Ji, Ranjay Krishna, Li Fei-Fei, Juan Carlos NieblesCVPR 2020
- Actor-Transformers for Group Activity RecognitionKirill Gavrilyuk, Ryan Sanford, Mehrsan Javan, Cees G. M. SnoekCVPR 2020
Related papers
- Weakly-Guided Self-Supervised Pretraining for Temporal Activity DetectionKumara Kahatapitiya, Zhou Ren, Haoxiang Li, Zhenyu Wu et al.AAAI 2023 · 7 citations
- ZSTAD: Zero-Shot Temporal Activity DetectionLingling Zhang, Xiaojun Chang, Jun Liu, Minnan Luo et al.CVPR 2020
- Beyond Short Clips: End-to-End Video-Level Learning With Collaborative MemoriesXitong Yang, Haoqi Fan, Lorenzo Torresani, Larry S. Davis et al.CVPR 2021
- Modeling Multi-Label Action Dependencies for Temporal Action LocalizationPraveen Tirupattur, Kevin Duarte, Yogesh S. Rawat, Mubarak ShahCVPR 2021
- Multi-Label Classification with Label Graph SuperimposingYa Wang, Dongliang He, Fu Li, Xiang Long et al.AAAI 2020 · 192 citations
