DeepQAMVS: Query-Aware Hierarchical Pointer Networks for Multi-Video Summarization
Safa Messaoud, Ismini Lourentzou, Assma Boughoula, Mona Zehni, Zhizhen Zhao, Chengxiang Zhai, Alexander G. Schwing
摘要
The recent growth of web video sharing platforms has increased the demand for systems that can efficiently browse, retrieve and summarize video content. Query-aware multi-video summarization is a promising technique that caters to this demand. In this work, we introduce a novel Query-Aware Hierarchical Pointer Network for Multi-Video Summarization, termed DeepQAMVS, that jointly optimizes multiple criteria: (1) conciseness, (2) representativeness of important query-relevant events and (3) chronological soundness. We design a hierarchical attention model that factorizes over three distributions, each collecting evidence from a different modality, followed by a pointer network that selects frames to include in the summary. DeepQAMVS is trained with reinforcement learning, incorporating rewards that capture representativeness, diversity, query-adaptability and temporal coherence. We achieve state-of-the-art results on the MVS1K dataset, with inference time scaling linearly with the number of input video frames.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper4
- Prompt Switch: Efficient CLIP Adaptation for Text-Video RetrievalChaorui Deng, Qi Chen, Pengda Qin, Da Chen 等ICCV 2023 · 被引用 52 次
- IntentVizor: Towards Generic Query Guided Interactive Video SummarizationGuande Wu, Jianzhe Lin, Cláudio T. SilvaCVPR 2022 · 被引用 36 次
- AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generationMilton Zhou, Sizhong Qin, Yongzhi Li, Quan Chen 等CVPR 2026 · 被引用 4 次
- Asynchronous Temporal Modeling with Two-Agent Framework for Streaming Dense Video CaptioningYolo Yunlong Tang, Chao Huang, Susan Liang, Jing Bi 等CVPR 2026 · 被引用 2 次
它引用的顶会 Paper1
相关 Paper
- Convolutional Hierarchical Attention Network for Query-Focused Video SummarizationShuwen Xiao, Zhou Zhao, Zijian Zhang, Xiaohui Yan 等AAAI 2020 · 被引用 2 次
- Be Relevant, Non-Redundant, and Timely: Deep Reinforcement Learning for Real-Time Event SummarizationMin Yang, Chengming Li, Fei Sun, Zhou Zhao 等AAAI 2020 · 被引用 8 次
- Query-Focused Multimodal Summarization with Gate-Guided Mixture-of-ExpertsJiajun Han, Xuran Yang, Hui ZhangACM MM 2025 · 被引用 1 次
- Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-CaptioningYunbin Tu, Liang Li, Li Su, Qingming HuangAAAI 2025 · 被引用 1 次
- TripleSumm: Adaptive Triple-Modality Fusion for Video SummarizationSumin Kim, Hyemin Jeong, Mingu Kang, Yejin Kim 等ICLR 2026 · 被引用 2 次
