On the Crucial Role of Initialization for Matrix Factorization
Bingcong Li, Liang Zhang, Aryan Mokhtari, Niao He
摘要
This work revisits the classical low-rank matrix factorization problem and unveils the critical role of initialization in shaping convergence rates for such nonconvex and nonsmooth optimization. We introduce Nyström initialization, which significantly improves the global convergence of Scaled Gradient Descent (ScaledGD) in both symmetric and asymmetric matrix factorization tasks. Specifically, we prove that ScaledGD with Nyström initialization achieves quadratic convergence in cases where only linear rates were previously known. Finally, we equip low-rank adapters (LoRA) with Nyström initialization for practical merits. The effectiveness of the resultant approach, NoRA, is demonstrated on several representative tasks for finetuning large language models (LLMs).
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper6
- PoLAR: Polar-Decomposed Low-Rank Adapter RepresentationKai Lion, Liang Zhang, Bingcong Li, Niao HeNeurIPS 2025 · 被引用 21 次
- RefLoRA: Refactored Low-Rank Adaptation for Efficient Fine-Tuning of Large ModelsYilang Zhang, Bingcong Li, Georgios B. GiannakisNeurIPS 2025 · 被引用 9 次
- The Primacy of Magnitude in Low-Rank AdaptationZicheng Zhang, Haoran Li, Yifeng Zhang, Guoqiang Gong 等NeurIPS 2025 · 被引用 7 次
- On the Benefits of Weight Normalization for Overparameterized Matrix SensingYudong Wei, Liang Zhang, Bingcong Li, Niao HeICLR 2026 · 被引用 4 次
- LoRA-One: One-Step Full Gradient Could Suffice for Fine-Tuning Large Language Models, Provably and EfficientlyYuanhe Zhang, Fanghui Liu, Yudong ChenICML 2025
它引用的顶会 Paper33
- LoRA: Low-Rank Adaptation of Large Language ModelsEdward J. Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu 等ICLR 2022 · 被引用 18,833 次
- QLoRA: Efficient Finetuning of Quantized LLMsTim Dettmers, Artidoro Pagnoni, Ari Holtzman, Luke ZettlemoyerNeurIPS 2023 · 被引用 5,863 次
- WinoGrande: An Adversarial Winograd Schema Challenge at ScaleKeisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, Yejin ChoiAAAI 2020 · 被引用 3,037 次
- PIQA: Reasoning about Physical Commonsense in Natural LanguageYonatan Bisk, Rowan Zellers, Ronan Le Bras, Jianfeng Gao 等AAAI 2020 · 被引用 2,916 次
- Fine-Tuning Language Models with Just Forward PassesSadhika Malladi, Tianyu Gao, Eshaan Nichani, Alex Damian 等NeurIPS 2023 · 被引用 495 次
相关 Paper
- On the Convergence Rate of LoRA Gradient DescentSiqiao Mu, Diego KlabjanICML 2026 · 被引用 8 次
- ScaLoRA: Optimally Scaled Low-Rank Adaptation for Efficient High-Rank Fine-TuningYilang Zhang, Xiaodong Yang, Yiwei Cai, Georgios B. GiannakisICML 2026 · 被引用 1 次
- Parameter Efficient Fine-tuning via Explained Variance AdaptationFabian Paischer, Lukas Hauzenberger, Thomas Schmied, Benedikt Alkin 等NeurIPS 2025 · 被引用 25 次
- LoRA-GA: Low-Rank Adaptation with Gradient ApproximationShaowen Wang, Linxi Yu, Jian LiNeurIPS 2024 · 被引用 194 次
- ConsNoTrainLoRA: Data-driven Weight Initialization of Low-Rank Adapters Using ConstraintsDebasmit Das, Hyoungwoo Park, Munawar Hayat, Seokeon Choi 等ICCV 2025 · 被引用 1 次
