Recognizing Actions in Videos From Unseen Viewpoints
A. J. Piergiovanni, Michael S. Ryoo
摘要
Standard methods for video recognition use large CNNs designed to capture spatio-temporal data. However, training these models requires a large amount of labeled training data, containing a wide variety of actions, scenes, settings and camera viewpoints. In this paper, we show that current convolutional neural network models are unable to recognize actions from camera viewpoints not present in their training data (i.e., unseen view action recognition). To address this, we develop approaches based on 3D representations and introduce a new geometric convolutional layer that can learn viewpoint invariant representations. Further, we introduce a new, challenging dataset for unseen view recognition and show the approaches ability to learn viewpoint invariant representations.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper8
- Learning Fine-grained View-Invariant Representations from Unpaired Ego-Exo Videos via Temporal AlignmentZihui Xue, Kristen GraumanNeurIPS 2023 · 被引用 64 次
- DVANet: Disentangling View and Action Features for Multi-View Action RecognitionNyle Siddiqui, Praveen Tirupattur, Mubarak ShahAAAI 2024 · 被引用 39 次
- Weakly-Supervised Online Action Segmentation in Multi-View Instructional VideosReza Ghoddoosian, Isht Dwivedi, Nakul Agarwal, Chiho Choi 等CVPR 2022 · 被引用 22 次
- Learning Viewpoint-Agnostic Visual Representations by Recovering Tokens in 3D SpaceJinghuan Shang, Srijan Das, Michael S. RyooNeurIPS 2022 · 被引用 18 次
- Self-Supervised Video Representation Learning via Latent Time NavigationDi Yang, Yaohui Wang, Quan Kong, Antitza Dantcheva 等AAAI 2023 · 被引用 18 次
它引用的顶会 Paper5
- SlowFast Networks for Video RecognitionChristoph Feichtenhofer, Haoqi Fan, Jitendra Malik, Kaiming HeICCV 2019 · 被引用 4,104 次
- Camera Distance-Aware Top-Down Approach for 3D Multi-Person Pose Estimation From a Single RGB ImageGyeongsik Moon, Ju Yong Chang, Kyoung Mu LeeICCV 2019 · 被引用 368 次
- Toyota Smarthome: Real-World Activities of Daily LivingSrijan Das, Rui Dai, Michal Koperski, Luca Minciullo 等ICCV 2019 · 被引用 182 次
- Equivariant Multi-View NetworksCarlos Esteves, Yinshuang Xu, Christine Allen-Blanchette, Kostas DaniilidisICCV 2019 · 被引用 108 次
- SynSin: End-to-End View Synthesis From a Single ImageOlivia Wiles, Georgia Gkioxari, Richard Szeliski, Justin JohnsonCVPR 2020
相关 Paper
- Deep Analysis of CNN-Based Spatio-Temporal Representations for Action RecognitionChun-Fu (Richard) Chen, Rameswar Panda, Kandan Ramakrishnan, Rogério Feris 等CVPR 2021
- ViSt3D: Video Stylization with 3D CNNAyush Pande, Gaurav SharmaNeurIPS 2023 · 被引用 7 次
- Rethinking Zero-Shot Video Classification: End-to-End Training for Realistic ApplicationsBiagio Brattoli, Joseph Tighe, Fedor Zhdanov, Pietro Perona 等CVPR 2020
- Recognizing Objects From Any View With Object and Viewer-Centered RepresentationsSainan Liu, Vincent Nguyen, Isaac Rehg, Zhuowen TuCVPR 2020
- CATER: A diagnostic dataset for Compositional Actions & TEmporal ReasoningRohit Girdhar, Deva RamananICLR 2020 · 被引用 198 次
