Model Selection for Cross-lingual Transfer
Yang Chen, Alan Ritter
摘要
Transformers that are pre-trained on multilingual corpora, such as, mBERT and XLM-RoBERTa, have achieved impressive cross-lingual transfer capabilities. In the zero-shot transfer setting, only English training data is used, and the fine-tuned model is evaluated on another target language. While this works surprisingly well, substantial variance has been observed in target language performance between different fine-tuning runs, and in the zero-shot setup, no target-language development data is available to select among multiple fine-tuned models. Prior work has relied on English dev data to select among models that are fine-tuned with different learning rates, number of steps and other hyperparameters, often resulting in suboptimal choices. In this paper, we show that it is possible to select consistently better models when small amounts of annotated data are available in auxiliary pivot languages. We propose a machine learning approach to model selection that uses the fine-tuned model's own internal representations to predict its cross-lingual capabilities. In extensive experiments we find that this method consistently selects better models than English validation data across twenty five languages (including eight low-resource languages), and often achieves results that are comparable to model selection using target language development data.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper3
- Constrained Decoding for Cross-lingual Label ProjectionDuong Minh Le, Yang Chen, Alan Ritter, Wei XuICLR 2024 · 被引用 14 次
- Meta-Tuning LLMs to Leverage Lexical Knowledge for Generalizable Language Style UnderstandingRuohao Guo, Wei Xu, Alan RitterACL 2024 · 被引用 2 次
- Towards Fast and Accurate Modeling for Cross-Lingual Label ProjectionThang Le, Huy Huu Nguyen, Anh Tuan Luu, Thamar Solorio 等ACL 2026
它引用的顶会 Paper8
- Unsupervised Cross-lingual Representation Learning at ScaleAlexis Conneau, Kartikay Khandelwal, Naman Goyal, Vishrav Chaudhary 等ACL 2020 · 被引用 539 次
- Task2Vec: Task Embedding for Meta-LearningAlessandro Achille, Michael Lam, Rahul Tewari, Avinash Ravichandran 等ICCV 2019 · 被引用 359 次
- From Zero to Hero: On the Limitations of Zero-Shot Language Transfer with Multilingual TransformersAnne Lauscher, Vinit Ravishankar, Ivan Vulic, Goran GlavasEMNLP 2020 · 被引用 235 次
- XGLUE: A New Benchmark Datasetfor Cross-lingual Pre-training, Understanding and GenerationYaobo Liang, Nan Duan, Yeyun Gong, Ning Wu 等EMNLP 2020 · 被引用 232 次
- MLQA: Evaluating Cross-lingual Extractive Question AnsweringPatrick Lewis, Barlas Oguz, Ruty Rinott, Sebastian Riedel 等ACL 2020 · 被引用 52 次
相关 Paper
- Multi Task Learning For Zero Shot Performance Prediction of Multilingual ModelsKabir Ahuja, Shanu Kumar, Sandipan Dandapat, Monojit ChoudhuryACL 2022
- How Linguistically Fair Are Multilingual Pre-Trained Language Models?Monojit Choudhury, Amit DeshpandeAAAI 2021 · 被引用 59 次
- Free Lunch: Robust Cross-Lingual Transfer via Model Checkpoint AveragingFabian David Schmidt, Ivan Vulic, Goran GlavasACL 2023 · 被引用 3 次
- Cross-Lingual Pre-Training Based Transfer for Zero-Shot Neural Machine TranslationBaijun Ji, Zhirui Zhang, Xiangyu Duan, Min Zhang 等AAAI 2020 · 被引用 67 次
- ZGUL: Zero-shot Generalization to Unseen Languages using Multi-source Ensembling of Language AdaptersVipul Rathore, Rajdeep Dhingra, Parag Singla, MausamEMNLP 2023
