Arabic Diacritics in the Wild: Exploiting Opportunities for Improved Diacritization
Salman Elgamal, Ossama Obeid, Mhd Tameem Kabbani, Go Inoue, Nizar Habash
摘要
The widespread absence of diacritical marks in Arabic text poses a significant challenge for Arabic natural language processing (NLP). This paper explores instances of naturally occurring diacritics, referred to as "diacritics in the wild," to unveil patterns and latent information across six diverse genres: news articles, novels, children's books, poetry, political documents, and ChatGPT outputs. We present a new annotated dataset that maps realworld partially diacritized words to their maximal full diacritization in context. Additionally, we propose extensions to the analyze-anddisambiguate approach in Arabic NLP to leverage these diacritics, resulting in notable improvements. Our contributions encompass a thorough analysis, valuable datasets, and an extended diacritization algorithm. We release our code and datasets as open source.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper3
- Advancements in Arabic Grammatical Error Detection and Correction: An Empirical InvestigationBashar Alhafni, Go Inoue, Christian Khairallah, Nizar HabashEMNLP 2023 · 被引用 10 次
- Joint Diacritization, Lemmatization, Normalization, and Fine-Grained Morphological TaggingNasser Zalmout, Nizar HabashACL 2020 · 被引用 3 次
- A Multitask Learning Approach for Diacritic RestorationSawsan Alqahtani, Ajay Mishra, Mona T. DiabACL 2020 · 被引用 2 次
相关 Paper
- Advancing Arabic Diacritization: Improved Datasets, Benchmarking, and State-of-the-Art ModelsAbubakr Mohamed, Hamdy MubarakEMNLP 2025
- ALDi: Quantifying the Arabic Level of Dialectness of TextAmr Keleg, Sharon Goldwater, Walid MagdyEMNLP 2023 · 被引用 4 次
- To Distill or Not to Distill? On the Robustness of Robust Knowledge DistillationAbdul Waheed, Karima Kadaoui, Muhammad Abdul-MageedACL 2024
- Casablanca: Data and Models for Multidialectal Arabic Speech RecognitionBashar Talafha, Karima Kadaoui, Samar Mohamed Magdy, Mariem Habiboullah 等EMNLP 2024 · 被引用 5 次
- Alexandria: A Multi-Domain Dialectal Arabic Machine Translation Dataset for Culturally Inclusive and Linguistically Diverse LLMsAbdellah El Mekki, Samar Mohamed Magdy, Houdaifa Atou, Ruwa AbuHweidi 等ACL 2026
