Data Augmentation for Abstractive Query-Focused Multi-Document Summarization
Ramakanth Pasunuru, Asli Celikyilmaz, Michel Galley, Chenyan Xiong, Yizhe Zhang, Mohit Bansal, Jianfeng Gao
摘要
The progress in Query-focused Multi-Document Summarization (QMDS) has been limited by the lack of sufficient largescale high-quality training datasets. We present two QMDS training datasets, which we construct using two data augmentation methods: (1) transferring the commonly used single-document CNN/Daily Mail summarization dataset to create the QMDSCNN dataset, and (2) mining search-query logs to create the QMDSIR dataset. These two datasets have complementary properties, i.e., QMDSCNN has real summaries but queries are simulated, while QMDSIR has real queries but simulated summaries. To cover both these real summary and query aspects, we build abstractive end-to-end neural network models on the combined datasets that yield new state-of-the-art transfer results on DUC datasets. We also introduce new hierarchical encoders that enable a more efficient encoding of the query together with multiple documents. Empirical results demonstrate that our data augmentation and encoding methods outperform baseline models on automatic metrics, as well as on human evaluations along multiple attributes.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper7
- Z-Code++: A Pre-trained Language Model Optimized for Abstractive SummarizationPengcheng He, Baolin Peng, Song Wang, Yang Liu 等ACL 2023 · 被引用 27 次
- Towards Explainable Search Results: A Listwise Explanation GeneratorPuxuan Yu, Razieh Rahimi, James AllanSIGIR 2022 · 被引用 26 次
- Summarize-then-Answer: Generating Concise Explanations for Multi-hop Reading ComprehensionNaoya Inoue, Harsh Trivedi, Steven Sinha, Niranjan Balasubramanian 等EMNLP 2021 · 被引用 14 次
- MDCure: A Scalable Pipeline for Multi-Document Instruction-FollowingGabrielle Kaili-May Liu, Bowen Shi, Avi Caciularu, Idan Szpektor 等ACL 2025 · 被引用 13 次
- WikiHowQA: A Comprehensive Benchmark for Multi-Document Non-Factoid Question AnsweringValeria Bolotova-Baranova, Vladislav Blinov, Sofya Filippova, Falk Scholer 等ACL 2023 · 被引用 12 次
相关 Paper
- QuerySum: A Multi-Document Query-Focused Summarization Dataset Augmented with Similar Query ClustersYushan Liu, Zili Wang, Ruifeng YuanAAAI 2024 · 被引用 14 次
- Pre-training for Abstractive Document Summarization by Reinstating Source TextYanyan Zou, Xingxing Zhang, Wei Lu, Furu Wei 等EMNLP 2020 · 被引用 42 次
- Leveraging Graph to Improve Abstractive Multi-Document SummarizationWei Li, Xinyan Xiao, Jiachen Liu, Hua Wu 等ACL 2020 · 被引用 118 次
- Learning to Generate Overlap Summaries through Noisy Synthetic DataNaman Bansal, Mousumi Akter, Shubhra Kanti Karmaker SantuEMNLP 2022 · 被引用 1 次
- Peek Across: Improving Multi-Document Modeling via Cross-Document Question-AnsweringAvi Caciularu, Matthew E. Peters, Jacob Goldberger, Ido Dagan 等ACL 2023 · 被引用 8 次
