Prototypical Reward Network for Data-Efficient RLHF
Jinghan Zhang, Xiting Wang, Yiqiao Jin, Changyu Chen, Xinhao Zhang, Kunpeng Liu
摘要
The reward model for Reinforcement Learning from Human Feedback (RLHF) has proven effective in fine-tuning Large Language Models (LLMs). Notably, collecting human feedback for RLHF can be resource-intensive and lead to scalability issues for LLMs and complex tasks. Our proposed framework Proto-RM leverages prototypical networks to enhance reward models under limited human feedback. By enabling stable and reliable structural learning from fewer samples, Proto-RM significantly enhances LLMs' adaptability and accuracy in interpreting human preferences. Extensive experiments on various datasets demonstrate that Proto-RM significantly improves the performance of reward models and LLMs in human feedback tasks, achieving comparable and usually better results than traditional methods, while requiring significantly less data. in datalimited scenarios. This research offers a promising direction for enhancing the efficiency of reward models and optimizing the fine-tuning of language models under restricted feedback conditions.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了最后一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper5
- Large Language Models Can Be Contextual Privacy Protection LearnersYijia Xiao, Yiqiao Jin, Yushi Bai, Yue Wu 等EMNLP 2024 · 被引用 18 次
- Automated Creation of Reusable and Diverse Toolsets for Enhancing LLM ReasoningZhiyuan Ma, Zhenya Huang, Jiayu Liu, Minmao Wang 等AAAI 2025 · 被引用 8 次
- ProtoTS: Learning Hierarchical Prototypes for Explainable Time Series ForecastingZiheng Peng, Shijie Ren, Xinyue Gu, Linxiao Yang 等ICLR 2026 · 被引用 2 次
- Long-form RewardBench: Evaluating Reward Models for Long-form GenerationHui Huang, Yancheng He, Wei Liu, Muyun Yang 等AAAI 2026 · 被引用 1 次
- Broaden your SCOPE! Efficient Multi-turn Conversation Planning for LLMs with Semantic SpaceZhiliang Chen, Xinyuan Niu, Chuan-Sheng Foo, Bryan Kian Hsiang LowICLR 2025
它引用的顶会 Paper6
- Training language models to follow instructions with human feedbackLong Ouyang, Jeffrey Wu, Xu Jiang, Diogo Almeida 等NeurIPS 2022 · 被引用 24,707 次
- Preference Ranking Optimization for Human AlignmentFeifan Song, Bowen Yu, Minghao Li, Haiyang Yu 等AAAI 2024 · 被引用 357 次
- Learning to summarize with human feedbackNisan Stiennon, Long Ouyang, Jeffrey Wu, Daniel M. Ziegler 等NeurIPS 2020 · 被引用 124 次
- Semi-Offline Reinforcement Learning for Optimized Text GenerationChangyu Chen, Xiting Wang, Yiqiao Jin, Victor Ye Dong 等ICML 2023 · 被引用 18 次
- Prototypical Fine-Tuning: Towards Robust Performance under Varying Data SizesYiqiao Jin, Xiting Wang, Yaru Hao, Yizhou Sun 等AAAI 2023 · 被引用 15 次
相关 Paper
- Real-Time Aligned Reward Model beyond SemanticsZixuan Huang, Xin Xia, Yuxi Ren, Jianbin Zheng 等ICML 2026 · 被引用 18 次
- Uncertainty and Influence aware Reward Model Refinement for Reinforcement Learning from Human FeedbackZexu Sun, Yiju Guo, Yankai Lin, Xu Chen 等ICLR 2025
- RLTHF: Targeted Human Feedback for LLM AlignmentYifei Xu, Tusher Chakraborty, Emre Kiciman, Bibek Aryal 等ICML 2025
- A Systematic Analysis of Base Model Choice for Reward ModelingKian Ahrabian, Pegah Jandaghi, Negar Mokhberian, Sai Praneeth Karimireddy 等EMNLP 2025
- RED: Unleashing Token-Level Rewards from Holistic Feedback via Reward RedistributionJiahui Li, Lin Li, Tai-Wei Chang, Kun Kuang 等EMNLP 2025
