Rethinking Optimization and Architecture for Tiny Language Models
Yehui Tang, Kai Han, Fangcheng Liu, Yunsheng Ni, Yuchuan Tian, Zheyuan Bai, Yi-Qi Hu, Sichao Liu, Shangling Jui, Yunhe Wang
摘要
The power of large language models (LLMs) has been demonstrated through numerous data and computing resources. However, the application of language models on mobile devices is facing huge challenge on the computation and memory costs, that is, tiny language models with high performance are urgently required. Limited by the highly complex training process, there are many details for optimizing language models that are seldom studied carefully. In this study, based on a tiny language model with 1B parameters, we carefully design a series of empirical study to analyze the effect of each component. Three perspectives are mainly discussed, i.e., neural architecture, parameter initialization, and optimization strategy. Several design formulas are empirically proved especially effective for tiny language models, including tokenizer compression, architecture tweaking, parameter inheritance and multiple-round training. Then we train PanGu-π-1B Pro and PanGu-π-1.5B Pro on 1.6T multilingual corpora, following the established formulas. Experimental results demonstrate the improved optimization and architecture yield a notable average improvement of 8.87 on benchmark evaluation sets for PanGu-π-1B Pro. Besides, PanGuπ-1.5B Pro surpasses a range of SOTA models with larger model sizes, validating its superior performance. The code is available 1 .
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper17
- Kangaroo: Lossless Self-Speculative Decoding for Accelerating LLMs via Double Early ExitingFangcheng Liu, Yehui Tang, Zhenhua Liu, Yunsheng Ni 等NeurIPS 2024 · 被引用 43 次
- DeepDiver: Adaptive Web-Search Intensity Scaling via Reinforcement LearningWenxuan Shi, Haochen Tan, Chuqiao Kuang, Xiaoguang Li 等NeurIPS 2025 · 被引用 26 次
- Memory-Space Visual Prompting for Efficient Vision-Language Fine-TuningShibo Jie, Yehui Tang, Ning Ding, Zhi-Hong Deng 等ICML 2024 · 被引用 24 次
- Star-Agents: Automatic Data Optimization with LLM Agents for Instruction TuningHang Zhou, Yehui Tang, Haochen Qin, Yujie Yang 等NeurIPS 2024 · 被引用 21 次
- Nemotron-Flash: Towards Latency-Optimal Hybrid Small Language ModelsYonggan Fu, Xin Dong, Shizhe Diao, Matthijs Van Keirsbilck 等NeurIPS 2025 · 被引用 19 次
它引用的顶会 Paper8
- Language Models are Few-Shot LearnersTom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah 等NeurIPS 2020 · 被引用 64,255 次
- Measuring Massive Multitask Language UnderstandingDan Hendrycks, Collin Burns, Steven Basart, Andy Zou 等ICLR 2021 · 被引用 7,905 次
- Large Batch Optimization for Deep Learning: Training BERT in 76 minutesYang You, Jing Li, Sashank J. Reddi, Jonathan Hseu 等ICLR 2020 · 被引用 1,170 次
- LLM-Pruner: On the Structural Pruning of Large Language ModelsXinyin Ma, Gongfan Fang, Xinchao WangNeurIPS 2023 · 被引用 994 次
- Pruning neural networks without any data by iteratively conserving synaptic flowHidenori Tanaka, Daniel Kunin, Daniel L. K. Yamins, Surya GanguliNeurIPS 2020 · 被引用 884 次
相关 Paper
- MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use CasesZechun Liu, Changsheng Zhao, Forrest N. Iandola, Chen Lai 等ICML 2024 · 被引用 227 次
- Demystifying Small Language Models for Edge DeploymentZhenyan Lu, Xiang Li, Dongqi Cai, Rongjie Yi 等ACL 2025 · 被引用 14 次
- MeRino: Entropy-Driven Design for Generative Language Models on IoT DevicesYoupeng Zhao, Ming Lin, Huadong Tang, Qiang Wu 等AAAI 2025 · 被引用 3 次
- Cross-model Control: Improving Multiple Large Language Models in One-time TrainingJiayi Wu, Hao Sun, Hengyi Cai, Lixin Su 等NeurIPS 2024 · 被引用 3 次
- AutoTinyBERT: Automatic Hyper-parameter Optimization for Efficient Pre-trained Language ModelsYichun Yin, Cheng Chen, Lifeng Shang, Xin Jiang 等ACL 2021
