Multilingual Pretraining for Pixel Language Models
Ilker Kesen, Jonas F. Lotz, Ingo Ziegler, Phillip Rust, Desmond Elliott
Abstract
Pixel language models operate directly on images of rendered text, eliminating the need for a fixed vocabulary. While these models have demonstrated strong capabilities for downstream cross-lingual transfer, multilingual pretraining remains underexplored. We introduce PIXEL-M4, a model pretrained on four visually and linguistically diverse languages: English, Hindi, Ukrainian, and Simplified Chinese. Multilingual evaluations on semantic and syntactic tasks show that PIXEL-M4 outperforms an English-only counterpart on non-Latin scripts. Word-level probing analyses confirm that PIXEL-M4 captures rich linguistic features, even in languages not seen during pretraining. Furthermore, an analysis of its hidden representations shows that multilingual pretraining yields a semantic embedding space closely aligned across the languages used for pretraining. This work demonstrates that multilingual pretraining substantially enhances the capability of pixel language models to effectively support a diverse set of languages.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 4e4b5b37-dc47-4eb0-85cd-90b61d754c91Builds on10
- Robust Open-Vocabulary Translation from Visual Text RepresentationsElizabeth Salesky, David Etter, Matt PostEMNLP 2021 · 33 citations
- Naamapadam: A Large-Scale Named Entity Annotated Data for Indic LanguagesArnav Mhaske, Harshit Kedia, Sumanth Doddapaneni, Mitesh M. Khapra et al.ACL 2023 · 24 citations
- Language Modelling with PixelsPhillip Rust, Jonas F. Lotz, Emanuele Bugliarello, Elizabeth Salesky et al.ICLR 2023 · 17 citations
- FOCUS: Effective Embedding Initialization for Monolingual Specialization of Multilingual ModelsKonstantin Dobler, Gerard de MeloEMNLP 2023 · 4 citations
- Text Rendering Strategies for Pixel Language ModelsJonas F. Lotz, Elizabeth Salesky, Phillip Rust, Desmond ElliottEMNLP 2023 · 3 citations
Related papers
- Pixology: Probing the Linguistic and Visual Capabilities of Pixel-based Language ModelsKushal Tatariya, Vladimir Araujo, Thomas Bauwens, Miryam de LhoneuxEMNLP 2024 · 2 citations
- UC2: Universal Cross-Lingual Cross-Modal Vision-and-Language Pre-TrainingMingyang Zhou, Luowei Zhou, Shuohang Wang, Yu Cheng et al.CVPR 2021
- Multi-Lingual Acquisition on Multimodal Pre-training for Cross-modal RetrievalLiang Zhang, Anwen Hu, Qin JinNeurIPS 2022 · 3 citations
- Subword Evenness (SuE) as a Predictor of Cross-lingual Transfer to Low-resource LanguagesOlga Pelloni, Anastassia Shaitarova, Tanja SamardzicEMNLP 2022 · 4 citations
- M3P: Learning Universal Representations via Multitask Multilingual Multimodal Pre-TrainingMinheng Ni, Haoyang Huang, Lin Su, Edward Cui et al.CVPR 2021
