MISP-Meeting: A Real-World Dataset with Multimodal Cues for Long-form Meeting Transcription and Summarization
Hang Chen, Chao-Han Huck Yang, Jia-Chen Gu, Sabato Marco Siniscalchi, Jun Du
摘要
We introduce MISP-Meeting, a new real-world, multimodal dataset that covers subject-oriented long-form content. MISP-Meeting integrates information from speech, vision, and text modalities to facilitate automatic meeting transcription and summarization (AMTS). Challenging conditions in human meetings, including far-field speech recognition, audio-visual understanding, and long-term summarization, have been carefully evaluated. We benchmark state-of-the-art automatic speech recognition (ASR) and large language models (LLMs) on this dataset, enhanced with multimodal cues. Experiments demonstrate that incorporating multimodal cues, such as lip movements and visual focus of attention, significantly enhances transcription accuracy, reducing the character error rate (CER) from 36.60% to 20.27% via guided source separation (GSS), fine-tuning, and audio-visual fusion. Furthermore, our summarization analysis reveals a direct correlation between ASR quality and summary coherence, underscoring the importance of robust multimodal modeling. Our dataset and codebase have been released as open source. 1
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper9
- Robust Speech Recognition via Large-Scale Weak SupervisionAlec Radford, Jong Wook Kim, Tao Xu, Greg Brockman 等ICML 2023 · 被引用 6,966 次
- PEGASUS: Pre-training with Extracted Gap-sentences for Abstractive SummarizationJingqing Zhang, Yao Zhao, Mohammad Saleh, Peter J. LiuICML 2020 · 被引用 2,453 次
- BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and ComprehensionMike Lewis, Yinhan Liu, Naman Goyal, Marjan Ghazvininejad 等ACL 2020 · 被引用 1,224 次
- Reconstruct Before Summarize: An Efficient Two-Step Framework for Condensing and Summarizing Meeting TranscriptsHaochen Tan, Han Wu, Wei Shao, Xinyun Zhang 等EMNLP 2023 · 被引用 3 次
- GIFT: Graph-Induced Fine-Tuning for Multi-Party Conversation UnderstandingJia-Chen Gu, Zhenhua Ling, Quan Liu, Cong Liu 等ACL 2023 · 被引用 3 次
相关 Paper
- MeetingQA: Extractive Question-Answering on Meeting TranscriptsArchiki Prasad, Trung Bui, Seunghyun Yoon, Hanieh Deilamsalehy 等ACL 2023 · 被引用 4 次
- FinCall-Surprise: A Large Scale Multi-modal Benchmark for Earning Surprise PredictionDong Shu, Yanguang Liu, Huopu Zhang, Mengnan DuACL 2026 · 被引用 1 次
- REFINESUMM: Self-Refining MLLM for Generating a Multimodal Summarization DatasetVaidehi Patil, Leonardo F. R. Ribeiro, Mengwen Liu, Mohit Bansal 等ACL 2024
- MixSpeech: Cross-Modality Self-Learning with Audio-Visual Stream Mixup for Visual Speech Translation and RecognitionXize Cheng, Tao Jin, Rongjie Huang, Linjun Li 等ICCV 2023 · 被引用 30 次
- MIntRec: A New Dataset for Multimodal Intent RecognitionHanlei Zhang, Hua Xu, Xin Wang, Qianrui Zhou 等ACM MM 2022 · 被引用 66 次
