Meta-rater: A Multi-dimensional Data Selection Method for Pre-training Language Models
Xinlin Zhuang, Jiahui Peng, Ren Ma, Yinfan Wang, Tianyi Bai, Xingjian Wei, Jiantao Qiu, Chi Zhang, Ying Qian, Conghui He
Abstract
The composition of pre-training datasets for large language models (LLMs) remains largely undisclosed, hindering transparency and efforts to optimize data quality-a critical driver of model performance. Current data selection methods, such as natural language quality assessments, diversity-based filters, and classifier-based approaches, are limited by single-dimensional evaluation or redundancyfocused strategies. To address these gaps, we propose four dimensions to evaluate data quality: professionalism, readability, reasoning, and cleanliness. We further introduce Meta-rater, a multi-dimensional data selection method that integrates these dimensions with existing quality metrics through learned optimal weightings. Meta-rater employs proxy models to train a regression model that predicts validation loss, enabling the identification of optimal combinations of quality scores. Experiments demonstrate that Meta-rater doubles convergence speed for 1.3B parameter models and improves downstream task performance by 3.23%, with advantages that scale to models as large as 7.2B parameters. Our work establishes that holistic, multi-dimensional quality integration significantly outperforms conventional single-dimension approaches, offering a scalable paradigm for enhancing pretraining efficiency and model capability. To advance future research, we release scripts, data, and models at https://github.com/ opendatalab/Meta-rater .
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext dd00c24e-4649-407b-b9a5-ed22b7cc654dCited by top-tier papers5
- Towards Efficient Medical Reasoning with Minimal Fine-Tuning DataXinlin Zhuang, Feilong Tang, Haolin Yang, Xiwei Liu et al.CVPR 2026 · 3 citations
- OptimSyn: Influence-Guided Rubrics Optimization for Synthetic Data GenerationZhiting Fan, Ruizhe Chen, Tianxiang Hu, Ru Peng et al.ICLR 2026 · 3 citations
- TamEdit: Trajectory-Aware Meta-Learning for Specificity-Preserving Continual Knowledge EditingShiqiang Tian, Cheng Ding, Qin Chen, Jie Zhou et al.ACL 2026 · 1 citation
- Decoding Dynamic Visual Experience from Calcium Imaging via Cell-Pattern-Aware PretrainingSangyoon Bae, Mehdi Azabou, Blake Aaron Richards, Jiook ChaICLR 2026
- Removing Noise, not Finding Gold: Quality Filtering for Large-Scale PretrainingThiziri Nait Saada, Louis Béthune, Michal Klein, David Grangier et al.ICML 2026
Builds on10
- WinoGrande: An Adversarial Winograd Schema Challenge at ScaleKeisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, Yejin ChoiAAAI 2020 · 3,037 citations
- FlashAttention-2: Faster Attention with Better Parallelism and Work PartitioningTri DaoICLR 2024 · 2,600 citations
- Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and InferenceBenjamin Warner, Antoine Chaffin, Benjamin Clavié, Orion Weller et al.ACL 2025 · 552 citations
- QuRating: Selecting High-Quality Data for Training Language ModelsAlexander Wettig, Aatmik Gupta, Saumya Malik, Danqi ChenICML 2024 · 138 citations
- MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence ModelsZichun Yu, Spandan Das, Chenyan XiongNeurIPS 2024 · 117 citations
Related papers
- FIRE: Flexible Integration of Data Quality Ratings for Effective PretrainingLiangyu Xu, Xuemiao Zhang, Feiyu Duan, Sirui Wang et al.EMNLP 2025
- R-Select: A Robust Multi-Metric Data Selection Approach for Fine-Tuning Large Language ModelsXin Gao, Xiaoyang Wang, Yun Zhu, Zheng Liu et al.KDD 2026
- ScalingFilter: Assessing Data Quality through Inverse Utilization of Scaling LawsRuihang Li, Yixuan Wei, Miaosen Zhang, Nenghai Yu et al.EMNLP 2024 · 1 citation
- MuRating: A High Quality Data Selecting Approach to Multilingual Large Language Model PretrainingZhixun Chen, Ping Guo, Wenhan Han, Yifan Zhang et al.NeurIPS 2025 · 4 citations
- Beyond URLs: Metadata Diversity and Position for Efficient LLM PretrainingDongyang Fan, Diba Hashemi, Sai Praneeth Karimireddy, Martin JaggiICLR 2026 · 1 citation
