Whose Boat Does it Float? Improving Personalization in Preference Tuning via Inferred User Personas
Nishant Balepur, Vishakh Padmakumar, Fumeng Yang, Shi Feng, Rachel Rudinger, Jordan Lee Boyd-Graber
摘要
Sure! To liven up your party, you could… or even hire a bartender to make specialty cocktails… Direct Preference Opt. (DPO) Sure! … Whatever you decide, make sure it's something that everyone can enjoy and stay safe! DPO + Persona Tailoring (Ours) Sure! Here are some ideas to liven up your party tonight: ... 10. Have an icebreaker activity Prompt My school is having a cake drive. Would brownies be okay to take? Chosen Persona The user values simplicity and prefers direct, concise answers without additional details Prompt: My school is having a cake drive… Persona: The user values simplicity and prefers direct… Response: Yes, brownies would be a great… Rejected Persona The user is practical, preferring responses that include logistical considerations Response: Yes, brownies would be a great contribution… Persona Inference ( §2, 3) Persona Tailoring ( §4, 5) Prompt: My school is having a cake… Persona: The user values simplicity… 1) Few-shot Prompting 2) Supervised Fine-Tuning 3) Direct Preference Optimization Typical Preference Dataset Can abductive reasoning reveal why users may prefer responses? Prompt: My school is having… Persona: The user values sim… Chosen Response: Yes, brownies would be a great… Rejected Response: Yes.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper5
- Direct Alignment with Heterogeneous PreferencesAli Shirali, Arash Nasr-Esfahany, Abdullah Omar Alomar, Parsa Mirtaheri 等NeurIPS 2025 · 被引用 26 次
- P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic ChecklistKwangwook Seo, Dongha LeeACL 2026 · 被引用 2 次
- Principled Content Selection to Generate Diverse and Personalized Multi-Document SummariesVishakh Padmakumar, Zichao Wang, David Arbour, Jennifer HealeyACL 2025 · 被引用 1 次
- Language Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real UsersNishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman 等ACL 2026 · 被引用 1 次
- BESPOKE: Benchmark for Search-Augmented Large Language Model Personalization via Diagnostic FeedbackHyunseo Kim, Sangam Lee, Kwangwook Seo, Dongha LeeICML 2026
它引用的顶会 Paper27
- Language Models are Few-Shot LearnersTom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah 等NeurIPS 2020 · 被引用 64,255 次
- LoRA: Low-Rank Adaptation of Large Language ModelsEdward J. Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu 等ICLR 2022 · 被引用 18,833 次
- Direct Preference Optimization: Your Language Model is Secretly a Reward ModelRafael Rafailov, Archit Sharma, Eric Mitchell, Christopher D. Manning 等NeurIPS 2023 · 被引用 10,924 次
- Towards Understanding Sycophancy in Language ModelsMrinank Sharma, Meg Tong, Tomasz Korbak, David Duvenaud 等ICLR 2024 · 被引用 762 次
- G-Eval: NLG Evaluation using Gpt-4 with Better Human AlignmentYang Liu, Dan Iter, Yichong Xu, Shuohang Wang 等EMNLP 2023 · 被引用 549 次
相关 Paper
- Quantifying and Optimizing Global Faithfulness in Persona-driven Role-playingLetian Peng, Jingbo ShangNeurIPS 2024 · 被引用 21 次
- What Matters in Data for DPO?Yu Pan, Zhongze Cai, Huaiyang Zhong, Guanting Chen 等NeurIPS 2025 · 被引用 13 次
- PrefDisco: Benchmarking Proactive Personalized ReasoningShuyue Stella Li, Avinandan Bose, Faeze Brahman, Simon S. Du 等ICLR 2026 · 被引用 8 次
- Expectation Preference Optimization: Reliable Preference Estimation for Improving the Reasoning Capability of Large Language ModelsZelin Li, Dawei SongEMNLP 2025
- Active Preference Learning for Large Language ModelsWilliam Muldrew, Peter Hayes, Mingtian Zhang, David BarberICML 2024 · 被引用 53 次
