HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation
Trong-Thuan Nguyen, Pha A. Nguyen, Jackson David Cothren, Alper Yilmaz, Khoa Luu
2025Year
6Top-tier citations
Abstract
uark-cviu.github.io/projects/HyperGLM Figure 1. Our HyperGLM framework supports Video Scene Graph Generation, Anticipation, and Reasoning. HyperGLM constructs scene graphs from observed video frames and predicts relationships in unseen frames by leveraging a unified hypergraph for temporal modeling and comprehensive understanding.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 89ad1067-81ab-46a5-b6da-2085e11dceefCited by top-tier papers6
- Directed-Tokens: A Robust Multi-Modality Alignment Approach to Large Language-Vision ModelsThanh-Dat Truong, Huu-Thien Tran, Tran Thai Son, Bhiksha Raj et al.NeurIPS 2025 · 6 citations
- φ-DPO: Fairness Direct Preference Optimization Approach to Continual Learning in Large Multimodal ModelsThanh-Dat Truong, Huu-Thien Tran, Jackson David Cothren, Bhiksha Raj et al.CVPR 2026 · 2 citations
- Video-CoE: Reinforcing Video Event Prediction via Chain of EventsQile Su, Jing Tang, Rui Chen, Lei Sun et al.CVPR 2026 · 2 citations
- Streaming Video Crime Anticipation with Spatio-Temporal Causal ReasoningYusong Wang, Zheyuan Gu, Keyu Mao, Minghao Shao et al.CVPR 2026 · 1 citation
- Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video UnderstandingKe Ma, Jiaqi Tang, Bin Guo, Xueting Han et al.ACL 2026
Builds on34
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh et al.ICML 2021 · 47,906 citations
- An Image is Worth 16x16 Words: Transformers for Image Recognition at ScaleAlexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn et al.ICLR 2021 · 21,477 citations
- LoRA: Low-Rank Adaptation of Large Language ModelsEdward J. Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu et al.ICLR 2022 · 18,833 citations
- Visual Instruction TuningHaotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae LeeNeurIPS 2023 · 11,349 citations
- Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language ModelsMuhammad Maaz, Hanoona Abdul Rasheed, Salman Khan, Fahad KhanACL 2024 · 279 citations
Related papers
- Dynamic Scene Graph Generation via Anticipatory Pre-trainingYiming Li, Xiaoshan Yang, Changsheng XuCVPR 2022 · 38 citations
- From Pixels to Graphs: Open-Vocabulary Scene Graph Generation with Vision-Language ModelsRongjie Li, Songyang Zhang, Dahua Lin, Kai Chen et al.CVPR 2024
- Weakly-supervised Video Scene Graph Generation via Unbiased Cross-modal LearningZiyue Wu, Junyu Gao, Changsheng XuACM MM 2023 · 5 citations
- Learning Situation Hyper-Graphs for Video Question AnsweringAisha Urooj Khan, Hilde Kuehne, Bo Wu, Kim Chheu et al.CVPR 2023
- Unified Graph Structured Models for Video UnderstandingAnurag Arnab, Chen Sun, Cordelia SchmidICCV 2021 · 57 citations
