XWikiGen: Cross-lingual Summarization for Encyclopedic Text Generation in Low Resource Languages
Dhaval Taunk, Shivprasad Sagare, Anupam Patil, Shivansh Subramanian, Manish Gupta, Vasudeva Varma
摘要
Lack of encyclopedic text contributors, especially on Wikipedia, makes automated text generation for low resource (LR) languages a critical problem. Existing work on Wikipedia text generation has focused on English only where English reference articles are summarized to generate English Wikipedia pages. But, for low-resource languages, the scarcity of reference articles makes monolingual summarization ineffective in solving this problem. Hence, in this work, we propose XWikiGen, which is the task of cross-lingual multi-document summarization of text from multiple reference articles, written in various languages, to generate Wikipedia-style text. Accordingly, we contribute a benchmark dataset, XWikiRef, spanning ∼ 69K Wikipedia articles covering five domains and eight languages. We harness this dataset to train a two-stage system where the input is a set of citations and a section title and the output is a section-specific LR summary. The proposed system is based on a novel idea of neural unsupervised extractive summarization to coarsely identify salient information followed by a neural abstractive model to generate the section-specific text. Extensive experiments show that multi-domain training is better than the multi-lingual setup on average. We make our code and dataset publicly available1.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper6
- Reformer: The Efficient TransformerNikita Kitaev, Lukasz Kaiser, Anselm LevskayaICLR 2020 · 被引用 2,878 次
- Unsupervised Cross-lingual Representation Learning at ScaleAlexis Conneau, Kartikay Khandelwal, Naman Goyal, Vishrav Chaudhary 等ACL 2020 · 被引用 539 次
- XGLUE: A New Benchmark Datasetfor Cross-lingual Pre-training, Understanding and GenerationYaobo Liang, Nan Duan, Yeyun Gong, Ning Wu 等EMNLP 2020 · 被引用 232 次
- Cross-Lingual Natural Language Generation via Pre-TrainingZewen Chi, Li Dong, Furu Wei, Wenhui Wang 等AAAI 2020 · 被引用 142 次
- mT6: Multilingual Pretrained Text-to-Text Transformer with Translation PairsZewen Chi, Li Dong, Shuming Ma, Shaohan Huang 等EMNLP 2021 · 被引用 60 次
相关 Paper
- Models and Datasets for Cross-Lingual SummarisationLaura Perez-Beltrachini, Mirella LapataEMNLP 2021 · 被引用 1 次
- Design Challenges in Low-resource Cross-lingual Entity LinkingXingyu Fu, Weijia Shi, Xiaodong Yu, Zian Zhao 等EMNLP 2020 · 被引用 9 次
- Low-Resource Dialogue Summarization with Domain-Agnostic Multi-Source PretrainingYicheng Zou, Bolin Zhu, Xingwu Hu, Tao Gui 等EMNLP 2021 · 被引用 18 次
- MultiSumm: Towards a Unified Model for Multi-Lingual Abstractive SummarizationYue Cao, Xiaojun Wan, Jin-ge Yao, Dian YuAAAI 2020 · 被引用 28 次
- MassiveSumm: a very large-scale, very multilingual, news summarisation datasetDaniel Varab, Natalie SchluterEMNLP 2021 · 被引用 42 次
