Simple Conversational Data Augmentation for Semi-supervised Abstractive Dialogue Summarization
Jiaao Chen, Diyi Yang
摘要
Abstractive conversation summarization has received growing attention while most current state-of-the-art summarization models heavily rely on human-annotated summaries. To reduce the dependence on labeled summaries, in this work, we present a simple yet effective set of Conversational Data Augmentation (CODA) methods for semisupervised abstractive conversation summarization, such as random swapping/deletion to perturb the discourse relations inside conversations, dialogue-acts-guided insertion to interrupt the development of conversations, and conditional-generation-based substitution to substitute utterances with their paraphrases generated based on the conversation context. To further utilize unlabeled conversations, we combine CODA with two-stage noisy selftraining where we first pre-train the summarization model on unlabeled conversations with pseudo summaries and then fine-tune it on labeled conversations. Experiments conducted on the recent conversation summarization datasets demonstrate the effectiveness of our methods over several state-of-the-art data augmentation baselines. We have publicly released our code at https://github.com/ GT-SALT/CODA .
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper4
- Champagne: Learning Real-world Conversation from Large-Scale Web VideosSeungju Han, Jack Hessel, Nouha Dziri, Yejin Choi 等ICCV 2023 · 被引用 22 次
- Curriculum Prompt Learning with Self-Training for Abstractive Dialogue SummarizationChangqun Li, Linlin Wang, Xin Lin, Gerard de Melo 等EMNLP 2022 · 被引用 8 次
- Compositional Data Augmentation for Abstractive Conversation SummarizationSiru Ouyang, Jiaao Chen, Jiawei Han, Diyi YangACL 2023 · 被引用 4 次
- Co-training for Low Resource Scientific Natural Language InferenceMobashir Sadat, Cornelia CarageaACL 2024
它引用的顶会 Paper9
- BERTScore: Evaluating Text Generation with BERTTianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger 等ICLR 2020 · 被引用 8,443 次
- Unsupervised Data Augmentation for Consistency TrainingQizhe Xie, Zihang Dai, Eduard H. Hovy, Thang Luong 等NeurIPS 2020 · 被引用 2,774 次
- BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and ComprehensionMike Lewis, Yinhan Liu, Naman Goyal, Marjan Ghazvininejad 等ACL 2020 · 被引用 1,224 次
- FreeLB: Enhanced Adversarial Training for Natural Language UnderstandingChen Zhu, Yu Cheng, Zhe Gan, Siqi Sun 等ICLR 2020 · 被引用 502 次
- MixText: Linguistically-Informed Interpolation of Hidden Space for Semi-Supervised Text ClassificationJiaao Chen, Zichao Yang, Diyi YangACL 2020 · 被引用 340 次
相关 Paper
- Pre-training for Abstractive Document Summarization by Reinstating Source TextYanyan Zou, Xingxing Zhang, Wei Lu, Furu Wei 等EMNLP 2020 · 被引用 42 次
- Target-Side Input Augmentation for Sequence to Sequence GenerationShufang Xie, Ang Lv, Yingce Xia, Lijun Wu 等ICLR 2022 · 被引用 16 次
- Unsupervised Abstractive Dialogue Summarization for Tete-a-TetesXinyuan Zhang, Ruiyi Zhang, Manzil Zaheer, Amr AhmedAAAI 2021 · 被引用 27 次
- RepSum: Unsupervised Dialogue Summarization based on Replacement StrategyXiyan Fu, Yating Zhang, Tianyi Wang, Xiaozhong Liu 等ACL 2021
- Planning and Generating Natural and Diverse Disfluent Texts as Augmentation for Disfluency DetectionJingfeng Yang, Diyi Yang, Zhaoran MaEMNLP 2020 · 被引用 13 次
