Hyper-X: A Unified Hypernetwork for Multi-Task Multilingual Transfer
Ahmet Üstün, Arianna Bisazza, Gosse Bouma, Gertjan van Noord, Sebastian Ruder
Abstract
Massively multilingual models are promising for transfer learning across tasks and languages. However, existing methods are unable to fully leverage training data when it is available in different task-language combinations. To exploit such heterogeneous supervision, we propose Hyper-X, a single hypernetwork that unifies multi-task and multilingual learning with efficient adaptation. This model generates weights for adapter modules conditioned on both tasks and language embeddings. By learning to combine task and language-specific knowledge, our model enables zero-shot transfer for unseen languages and task-language combinations. Our experiments on a diverse set of languages demonstrate that Hyper-X achieves the best or competitive gain when a mixture of multiple resources is available, while being on par with strong baselines in the standard scenario. Hyper-X is also considerably more efficient in terms of parameters and resources compared to methods that train separate adapters. Finally, Hyper-X consistently produces strong results in few-shot scenarios for new languages, showing the versatility of our approach beyond zero-shot transfer. 1
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 1326a96d-ad8f-4dc6-ba07-4e996a8ec28bCited by top-tier papers9
- When MOE Meets LLMs: Parameter Efficient Fine-tuning for Multi-task Medical ApplicationsQidong Liu, Xian Wu, Xiangyu Zhao, Yuanshao Zhu et al.SIGIR 2024 · 89 citations
- Multilingual Machine Translation with Hyper-AdaptersChristos Baziotis, Mikel Artetxe, James Cross, Shruti BhosaleEMNLP 2022 · 20 citations
- Don't Stop Fine-Tuning: On Training Regimes for Few-Shot Cross-Lingual Transfer with Multilingual Language ModelsFabian David Schmidt, Ivan Vulic, Goran GlavasEMNLP 2022 · 12 citations
- Teaching LLMs to Abstain across Languages via Multilingual FeedbackShangbin Feng, Weijia Shi, Yike Wang, Wenxuan Ding et al.EMNLP 2024 · 4 citations
- Soft Language Clustering for Multilingual Model Pre-trainingJiali Zeng, Yufan Jiang, Yongjing Yin, Yi Jing et al.ACL 2023 · 1 citation
Builds on7
- Unsupervised Cross-lingual Representation Learning at ScaleAlexis Conneau, Kartikay Khandelwal, Naman Goyal, Vishrav Chaudhary et al.ACL 2020 · 539 citations
- On Negative Interference in Multilingual Models: Findings and A Meta-Learning TreatmentZirui Wang, Zachary C. Lipton, Yulia TsvetkovEMNLP 2020 · 72 citations
- HyperGrid Transformers: Towards A Single Model for Multiple TasksYi Tay, Zhe Zhao, Dara Bahri, Donald Metzler et al.ICLR 2021 · 44 citations
- UDapter: Language Adaptation for Truly Universal Dependency ParsingAhmet Üstün, Arianna Bisazza, Gosse Bouma, Gertjan van NoordEMNLP 2020 · 10 citations
- What to Pre-Train on? Efficient Intermediate Task SelectionClifton Poth, Jonas Pfeiffer, Andreas Rücklé, Iryna GurevychEMNLP 2021 · 8 citations
Related papers
- Unifying Cross-Lingual Transfer across Scenarios of Resource ScarcityAlan Ansell, Marinela Parovic, Ivan Vulic, Anna Korhonen et al.EMNLP 2023 · 1 citation
- ZGUL: Zero-shot Generalization to Unseen Languages using Multi-source Ensembling of Language AdaptersVipul Rathore, Rajdeep Dhingra, Parag Singla, MausamEMNLP 2023
- FILTER: An Enhanced Fusion Method for Cross-lingual Language UnderstandingYuwei Fang, Shuohang Wang, Zhe Gan, Siqi Sun et al.AAAI 2021 · 61 citations
- Free Lunch: Robust Cross-Lingual Transfer via Model Checkpoint AveragingFabian David Schmidt, Ivan Vulic, Goran GlavasACL 2023 · 3 citations
- MAD-X: An Adapter-Based Framework for Multi-Task Cross-Lingual TransferJonas Pfeiffer, Ivan Vulic, Iryna Gurevych, Sebastian RuderEMNLP 2020 · 36 citations
