Multilingual Machine Translation with Hyper-Adapters
Christos Baziotis, Mikel Artetxe, James Cross, Shruti Bhosale
摘要
Multilingual machine translation suffers from negative interference across languages. A common solution is to relax parameter sharing with language-specific modules like adapters. However, adapters of related languages are unable to transfer information, and their total number of parameters becomes prohibitively expensive as the number of languages grows. In this work, we overcome these drawbacks using hyper-adapters – hyper-networks that generate adapters from language and layer embeddings. While past work had poor results when scaling hyper-networks, we propose a rescaling fix that significantly improves convergence and enables training larger hyper-networks. We find that hyper-adapters are more parameter efficient than regular adapters, reaching the same performance with up to 12 times less parameters. When using the same number of parameters and FLOPS, our approach consistently outperforms regular adapters. Also, hyper-adapters converge faster than alternative approaches and scale better than regular dense networks. Our analysis shows that hyper-adapters learn to encode language relatedness, enabling positive transfer across languages.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper9
- EBBS: An Ensemble with Bi-Level Beam Search for Zero-Shot Machine TranslationYuqiao Wen, Behzad Shayegh, Chenyang Huang, Yanshuai Cao 等AAAI 2025 · 被引用 8 次
- Learning Language-Specific Layers for Multilingual Machine TranslationTelmo Pires, Robin M. Schmidt, Yi-Hsiu Liao, Stephan PeitzACL 2023 · 被引用 8 次
- From Instance Training to Instruction Learning: Task Adapters Generation from InstructionsHuanxuan Liao, Shizhu He, Yao Xu, Yuanzhe Zhang 等NeurIPS 2024 · 被引用 6 次
- Condensing Multilingual Knowledge with Lightweight Language-Specific ModulesHaoran Xu, Weiting Tan, Shuyue Stella Li, Yunmo Chen 等EMNLP 2023 · 被引用 3 次
- Gradient-based Gradual Pruning for Language-Specific Multilingual Neural Machine TranslationDan He, Minh-Quang Pham, Thanh-Le Ha, Marco TurchiEMNLP 2023 · 被引用 2 次
它引用的顶会 Paper9
- Improving Massively Multilingual Neural Machine Translation and Zero-Shot TranslationBiao Zhang, Philip Williams, Ivan Titov, Rico SennrichACL 2020 · 被引用 213 次
- Principled Weight Initialization for HypernetworksOscar Chang, Lampros Flokas, Hod LipsonICLR 2020 · 被引用 87 次
- HyperGrid Transformers: Towards A Single Model for Multiple TasksYi Tay, Zhe Zhao, Dara Bahri, Donald Metzler 等ICLR 2021 · 被引用 44 次
- MAD-X: An Adapter-Based Framework for Multi-Task Cross-Lingual TransferJonas Pfeiffer, Ivan Vulic, Iryna Gurevych, Sebastian RuderEMNLP 2020 · 被引用 36 次
- VL-ADAPTER: Parameter-Efficient Transfer Learning for Vision-and-Language TasksYi-Lin Sung, Jaemin Cho, Mohit BansalCVPR 2022 · 被引用 22 次
相关 Paper
- Language Constrained Multimodal Hyper Adapter For Many-to-Many Multimodal SummarizationNayu Liu, Fanglong Yao, Haoran Luo, Yong Yang 等ACL 2025
- Hyper-X: A Unified Hypernetwork for Multi-Task Multilingual TransferAhmet Üstün, Arianna Bisazza, Gosse Bouma, Gertjan van Noord 等EMNLP 2022 · 被引用 13 次
- ATLAS: Adaptive Transfer Scaling Laws for Multilingual Pretraining, Finetuning, and Decoding the Curse of MultilingualityShayne Longpre, Sneha Kudugunta, Niklas Muennighoff, I-Hung Hsu 等ICLR 2026 · 被引用 20 次
- Beyond Shared Vocabulary: Increasing Representational Word Similarities across Languages for Multilingual Machine TranslationDi Wu, Christof MonzEMNLP 2023 · 被引用 5 次
- Parameter-efficient Multi-task Fine-tuning for Transformers via Shared HypernetworksRabeeh Karimi Mahabadi, Sebastian Ruder, Mostafa Dehghani, James HendersonACL 2021
