Meta-rater: A Multi-dimensional Data Selection Method for Pre-training Language Models
Xinlin Zhuang, Jiahui Peng, Ren Ma, Yinfan Wang, Tianyi Bai, Xingjian Wei, Jiantao Qiu, Chi Zhang, Ying Qian, Conghui He
摘要
The composition of pre-training datasets for large language models (LLMs) remains largely undisclosed, hindering transparency and efforts to optimize data quality-a critical driver of model performance. Current data selection methods, such as natural language quality assessments, diversity-based filters, and classifier-based approaches, are limited by single-dimensional evaluation or redundancyfocused strategies. To address these gaps, we propose four dimensions to evaluate data quality: professionalism, readability, reasoning, and cleanliness. We further introduce Meta-rater, a multi-dimensional data selection method that integrates these dimensions with existing quality metrics through learned optimal weightings. Meta-rater employs proxy models to train a regression model that predicts validation loss, enabling the identification of optimal combinations of quality scores. Experiments demonstrate that Meta-rater doubles convergence speed for 1.3B parameter models and improves downstream task performance by 3.23%, with advantages that scale to models as large as 7.2B parameters. Our work establishes that holistic, multi-dimensional quality integration significantly outperforms conventional single-dimension approaches, offering a scalable paradigm for enhancing pretraining efficiency and model capability. To advance future research, we release scripts, data, and models at https://github.com/ opendatalab/Meta-rater .
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper5
- Towards Efficient Medical Reasoning with Minimal Fine-Tuning DataXinlin Zhuang, Feilong Tang, Haolin Yang, Xiwei Liu 等CVPR 2026 · 被引用 3 次
- OptimSyn: Influence-Guided Rubrics Optimization for Synthetic Data GenerationZhiting Fan, Ruizhe Chen, Tianxiang Hu, Ru Peng 等ICLR 2026 · 被引用 3 次
- TamEdit: Trajectory-Aware Meta-Learning for Specificity-Preserving Continual Knowledge EditingShiqiang Tian, Cheng Ding, Qin Chen, Jie Zhou 等ACL 2026 · 被引用 1 次
- Decoding Dynamic Visual Experience from Calcium Imaging via Cell-Pattern-Aware PretrainingSangyoon Bae, Mehdi Azabou, Blake Aaron Richards, Jiook ChaICLR 2026
- Removing Noise, not Finding Gold: Quality Filtering for Large-Scale PretrainingThiziri Nait Saada, Louis Béthune, Michal Klein, David Grangier 等ICML 2026
它引用的顶会 Paper10
- WinoGrande: An Adversarial Winograd Schema Challenge at ScaleKeisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, Yejin ChoiAAAI 2020 · 被引用 3,037 次
- FlashAttention-2: Faster Attention with Better Parallelism and Work PartitioningTri DaoICLR 2024 · 被引用 2,600 次
- Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and InferenceBenjamin Warner, Antoine Chaffin, Benjamin Clavié, Orion Weller 等ACL 2025 · 被引用 552 次
- QuRating: Selecting High-Quality Data for Training Language ModelsAlexander Wettig, Aatmik Gupta, Saumya Malik, Danqi ChenICML 2024 · 被引用 138 次
- MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence ModelsZichun Yu, Spandan Das, Chenyan XiongNeurIPS 2024 · 被引用 117 次
相关 Paper
- FIRE: Flexible Integration of Data Quality Ratings for Effective PretrainingLiangyu Xu, Xuemiao Zhang, Feiyu Duan, Sirui Wang 等EMNLP 2025
- R-Select: A Robust Multi-Metric Data Selection Approach for Fine-Tuning Large Language ModelsXin Gao, Xiaoyang Wang, Yun Zhu, Zheng Liu 等KDD 2026
- ScalingFilter: Assessing Data Quality through Inverse Utilization of Scaling LawsRuihang Li, Yixuan Wei, Miaosen Zhang, Nenghai Yu 等EMNLP 2024 · 被引用 1 次
- MuRating: A High Quality Data Selecting Approach to Multilingual Large Language Model PretrainingZhixun Chen, Ping Guo, Wenhan Han, Yifan Zhang 等NeurIPS 2025 · 被引用 4 次
- Beyond URLs: Metadata Diversity and Position for Efficient LLM PretrainingDongyang Fan, Diba Hashemi, Sai Praneeth Karimireddy, Martin JaggiICLR 2026 · 被引用 1 次
