ViSTec: Video Modeling for Sports Technique Recognition and Tactical Analysis
Yuchen He, Zeqing Yuan, Yihong Wu, Liqi Cheng, Dazhen Deng, Yingcai Wu
摘要
The immense popularity of racket sports has fueled substantial demand in tactical analysis with broadcast videos. However, existing manual methods require laborious annotation, and recent attempts leveraging video perception models are limited to low-level annotations like ball trajectories, overlooking tactics that necessitate an understanding of stroke techniques. State-of-the-art action segmentation models also struggle with technique recognition due to frequent occlusions and motion-induced blurring in racket sports videos. To address these challenges, We propose ViSTec, a Video-based Sports Technique recognition model inspired by human cognition that synergizes sparse visual data with rich contextual insights. Our approach integrates a graph to explicitly model strategic knowledge in stroke sequences and enhance technique recognition with contextual inductive bias. A two-stage action perception model is jointly trained to align with the contextual knowledge in the graph. Experiments demonstrate that our method outperforms existing models by a significant margin. Case studies with experts from the Chinese national table tennis team validate our model's capacity to automate analysis for technical actions and tactical strategies. More details are available at: https://ViSTec2024.github.io/ .
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper3
- CLOT: Closed Loop Optimal Transport for Unsupervised Action SegmentationElena Belén Bueno-Benito, Mariella DimiccoliICCV 2025 · 被引用 3 次
- F3Set: Towards Analyzing Fast, Frequent, and Fine-grained Events from VideosZhaoyu Liu, Kan Jiang, Murong Ma, Zhe Hou 等ICLR 2025
- SPORTU: A Comprehensive Sports Understanding Benchmark for Multimodal Large Language ModelsHaotian Xia, Zhengbang Yang, Junbo Zou, Rhys Tracy 等ICLR 2025
它引用的顶会 Paper12
- VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-TrainingZhan Tong, Yibing Song, Jue Wang, Limin WangNeurIPS 2022 · 被引用 2,336 次
- BMN: Boundary-Matching Network for Temporal Action Proposal GenerationTianwei Lin, Xiao Liu, Xin Li, Errui Ding 等ICCV 2019 · 被引用 709 次
- Fast Learning of Temporal Action Proposal via Dense Boundary GeneratorChuming Lin, Jian Li, Yabiao Wang, Ying Tai 等AAAI 2020 · 被引用 226 次
- ShuttleSpace: Exploring and Analyzing Movement Trajectory in Immersive VisualizationShuainan Ye, Chen Zhu-Tian, Xiangtong Chu, Yifan Wang 等IEEE VIS 2020 · 被引用 94 次
- TIVEE: Visual Exploration and Explanation of Badminton Tactics in Immersive VisualizationsXiangtong Chu, Xiao Xie, Shuainan Ye, Haolin Lu 等IEEE VIS 2021 · 被引用 68 次
相关 Paper
- EventAnchor: Reducing Human Interactions in Event Annotation of Racket Sports VideosDazhen Deng, Jiang Wu, Jiachen Wang, Yihong Wu 等CHI 2021 · 被引用 29 次
- RacketVision: A Multiple Racket Sports Benchmark for Unified Ball and Racket AnalysisLinfeng Dong, Yuchen Yang, Hao Wu, Wei Wang 等AAAI 2026 · 被引用 1 次
- Augmenting Sports Videos with VisCommentatorChen Zhu-Tian, Shuainan Ye, Xiangtong Chu, Haijun Xia 等IEEE VIS 2021 · 被引用 60 次
- Where Will Players Move Next? Dynamic Graphs and Hierarchical Fusion for Movement Forecasting in BadmintonKai-Shiang Chang, Wei-Yao Wang, Wen-Chih PengAAAI 2023 · 被引用 24 次
- VisMimic: Integrating Motion Chain in Feedback Video Generation for Motor CoachingLiqi Cheng, Xiao Xie, Yiwei Peng, Minghao Feng 等UIST 2025 · 被引用 2 次
