Policy Optimization with Advantage Regularization for Long-Term Fairness in Decision Systems
Eric Yang Yu, Zhizhen Qin, Min Kyung Lee, Sicun Gao
摘要
Long-term fairness is an important factor of consideration in designing and deploying learning-based decision systems in high-stake decision-making contexts. Recent work has proposed the use of Markov Decision Processes (MDPs) to formulate decision-making with long-term fairness requirements in dynamically changing environments, and demonstrated major challenges in directly deploying heuristic and rule-based policies that worked well in static environments. We show that policy optimization methods from deep reinforcement learning can be used to find strictly better decision policies that can often achieve both higher overall utility and less violation of the fairness requirements, compared to previously-known strategies. In particular, we propose new methods for imposing fairness requirements in policy optimization by regularizing the advantage evaluation of different actions. Our proposed methods make it easy to impose fairness constraints without reward engineering or sacrificing training efficiency. We perform detailed analyses in three established case studies, including attention allocation in incident monitoring, bank loan approval, and vaccine distribution in population networks. Related Work Long-term Fairness in Algorithmic Decision-Making. The work in [16] is the first to formulate long-term fairness problems in decision systems as Markov Decision Processes (MDPs). The simulation environments proposed in the work allow us to consider the agent design problem in ways
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper6
- Iterative Reachability Estimation for Safe Reinforcement LearningMilan Ganai, Zheng Gong, Chenning Yu, Sylvia L. Herbert 等NeurIPS 2023 · 被引用 56 次
- Fair Off-Policy Learning from Observational DataDennis Frauen, Valentyn Melnychuk, Stefan FeuerriegelICML 2024 · 被引用 11 次
- Adapting Static Fairness to Sequential Decision-Making: Bias Mitigation Strategies towards Equal Long-term Benefit RateYuancheng Xu, Chenghao Deng, Yanchao Sun, Ruijie Zheng 等ICML 2024 · 被引用 7 次
- Retention Depolarization in Recommender SystemXiaoying Zhang, Hongning Wang, Yang LiuWWW 2024 · 被引用 2 次
- Long-term Fairness with Selective LabelsGiovani Valdrighi, Isabel Valera, Marcos M. RaimundoICML 2026
它引用的顶会 Paper5
- The Effects of Reward Misspecification: Mapping and Mitigating Misaligned ModelsAlexander Pan, Kush Bhatia, Jacob SteinhardtICLR 2022 · 被引用 293 次
- How do fair decisions fare in long-term qualification?Xueru Zhang, Ruibo Tu, Yang Liu, Mingyan Liu 等NeurIPS 2020 · 被引用 87 次
- Causal Modeling for Fairness In Dynamical SystemsElliot Creager, David Madras, Toniann Pitassi, Richard S. ZemelICML 2020 · 被引用 72 次
- Bringing Fairness to Actor-Critic Reinforcement Learning for Network Utility OptimizationJingdi Chen, Yimeng Wang, Tian LanINFOCOM 2021 · 被引用 23 次
- Learning Fair Policies in Multi-Objective (Deep) Reinforcement Learning with Average and Discounted RewardsUmer Siddique, Paul Weng, Matthieu ZimmerICML 2020 · 被引用 1 次
相关 Paper
- FairSense: Long-Term Fairness Analysis of ML-Enabled SystemsYining She, Sumon Biswas, Christian Kästner, Eunsuk KangICSE 2025 · 被引用 4 次
- Long-Term Fairness with Unknown DynamicsTongxin Yin, Reilly Raab, Mingyan Liu, Yang LiuNeurIPS 2023 · 被引用 33 次
- MAFE: Enabling Equitable Algorithm Design in Multi-Agent Multi-Stage Decision-Making SystemsZachary Lazri, Anirudh Nakra, Ivan Brugere, Danial Dervovic 等ICML 2026
- Achieving Fairness in Multi-Agent MDP Using Reinforcement LearningPeizhong Ju, Arnob Ghosh, Ness B. ShroffICLR 2024 · 被引用 8 次
- Personalized Reinforcement Learning with a Budget of PoliciesDmitry Ivanov, Omer Ben-PoratAAAI 2024 · 被引用 4 次
