Revisiting non-English Text Simplification: A Unified Multilingual Benchmark
Michael J. Ryan, Tarek Naous, Wei Xu
Abstract
Recent advancements in high-quality, large-scale English resources have pushed the frontier of English Automatic Text Simplification (ATS) research. However, less work has been done on multilingual text simplification due to the lack of a diverse evaluation benchmark that covers complex-simple sentence pairs in many languages. This paper introduces the MultiSim benchmark, a collection of 27 resources in 12 distinct languages containing over 1.7 million complex-simple sentence pairs. This benchmark will encourage research in developing more effective multilingual text simplification models and evaluation metrics. Our experiments using MultiSim with pre-trained multilingual language models reveal exciting performance improvements from multilingual training in non-English settings. We observe strong performance from Russian in zero-shot cross-lingual transfer to low-resource languages. We further show that few-shot prompting with BLOOM-176b achieves comparable quality to reference simplifications outperforming fine-tuned models in most languages. We validate these findings through human evaluation.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext ffb35d5d-13fc-4f62-a835-90ebdd4fe623Cited by top-tier papers9
- Beyond the Chat: Executable and Verifiable Text-Editing with LLMsPhilippe Laban, Jesse Vig, Marti A. Hearst, Caiming Xiong et al.UIST 2024 · 29 citations
- Multilingual Simplification of Medical TextsSebastian Joseph, Kathryn Kazanas, Keziah Reina, Vishnesh J. Ramanathan et al.EMNLP 2023 · 16 citations
- BLESS: Benchmarking Large Language Models on Sentence SimplificationTannon Kew, Alison Chi, Laura Vásquez-Rodríguez, Sweta Agrawal et al.EMNLP 2023 · 15 citations
- Digital Comprehensibility Assessment of Simplified Texts among Persons with Intellectual DisabilitiesAndreas Säuberli, Franz Holzknecht, Patrick Haller, Silvana Deilen et al.CHI 2024 · 10 citations
- Dancing Between Success and Failure: Edit-level Simplification Evaluation using SALSADavid Heineman, Yao Dou, Mounica Maddela, Wei XuEMNLP 2023 · 5 citations
Builds on6
- XGLUE: A New Benchmark Datasetfor Cross-lingual Pre-training, Understanding and GenerationYaobo Liang, Nan Duan, Yeyun Gong, Ning Wu et al.EMNLP 2020 · 232 citations
- MLQA: Evaluating Cross-lingual Extractive Question AnsweringPatrick Lewis, Barlas Oguz, Ruty Rinott, Sebastian Riedel et al.ACL 2020 · 52 citations
- Zero-Shot Crosslingual Sentence SimplificationJonathan Mallinson, Rico Sennrich, Mirella LapataEMNLP 2020 · 20 citations
- XCOPA: A Multilingual Dataset for Causal Commonsense ReasoningEdoardo Maria Ponti, Goran Glavas, Olga Majewska, Qianchu Liu et al.EMNLP 2020 · 6 citations
- MLSUM: The Multilingual Summarization CorpusThomas Scialom, Paul-Alexis Dray, Sylvain Lamprier, Benjamin Piwowarski et al.EMNLP 2020 · 4 citations
Related papers
- In-context Mixing (ICM): Code-mixed Prompts for Multilingual LLMsBhavani Shankar, Preethi Jyothi, Pushpak BhattacharyyaACL 2024
- Crosslingual Generalization through Multitask FinetuningNiklas Muennighoff, Thomas Wang, Lintang Sutawika, Adam Roberts et al.ACL 2023 · 319 citations
- BLOOM+1: Adding Language Support to BLOOM for Zero-Shot PromptingZheng Xin Yong, Hailey Schoelkopf, Niklas Muennighoff, Alham Fikri Aji et al.ACL 2023 · 20 citations
- Evaluating LLMs for Portuguese Sentence Simplification with Linguistic InsightsArthur Mariano Rocha De Azevedo Scalercio, Elvis A. de Souza, Maria José Bocorny Finatto, Aline PaesACL 2025 · 2 citations
- A New Dataset and Empirical Study for Sentence Simplification in ChineseShiping Yang, Renliang Sun, Xiaojun WanACL 2023 · 4 citations
