Policy Optimization with Advantage Regularization for Long-Term Fairness in Decision Systems
Eric Yang Yu, Zhizhen Qin, Min Kyung Lee, Sicun Gao
Abstract
Long-term fairness is an important factor of consideration in designing and deploying learning-based decision systems in high-stake decision-making contexts. Recent work has proposed the use of Markov Decision Processes (MDPs) to formulate decision-making with long-term fairness requirements in dynamically changing environments, and demonstrated major challenges in directly deploying heuristic and rule-based policies that worked well in static environments. We show that policy optimization methods from deep reinforcement learning can be used to find strictly better decision policies that can often achieve both higher overall utility and less violation of the fairness requirements, compared to previously-known strategies. In particular, we propose new methods for imposing fairness requirements in policy optimization by regularizing the advantage evaluation of different actions. Our proposed methods make it easy to impose fairness constraints without reward engineering or sacrificing training efficiency. We perform detailed analyses in three established case studies, including attention allocation in incident monitoring, bank loan approval, and vaccine distribution in population networks. Related Work Long-term Fairness in Algorithmic Decision-Making. The work in [16] is the first to formulate long-term fairness problems in decision systems as Markov Decision Processes (MDPs). The simulation environments proposed in the work allow us to consider the agent design problem in ways
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 717545c7-c4b4-487b-bd03-ac6a03ebebafCited by top-tier papers6
- Iterative Reachability Estimation for Safe Reinforcement LearningMilan Ganai, Zheng Gong, Chenning Yu, Sylvia L. Herbert et al.NeurIPS 2023 · 56 citations
- Fair Off-Policy Learning from Observational DataDennis Frauen, Valentyn Melnychuk, Stefan FeuerriegelICML 2024 · 11 citations
- Adapting Static Fairness to Sequential Decision-Making: Bias Mitigation Strategies towards Equal Long-term Benefit RateYuancheng Xu, Chenghao Deng, Yanchao Sun, Ruijie Zheng et al.ICML 2024 · 7 citations
- Retention Depolarization in Recommender SystemXiaoying Zhang, Hongning Wang, Yang LiuWWW 2024 · 2 citations
- Long-term Fairness with Selective LabelsGiovani Valdrighi, Isabel Valera, Marcos M. RaimundoICML 2026
Builds on5
- The Effects of Reward Misspecification: Mapping and Mitigating Misaligned ModelsAlexander Pan, Kush Bhatia, Jacob SteinhardtICLR 2022 · 293 citations
- How do fair decisions fare in long-term qualification?Xueru Zhang, Ruibo Tu, Yang Liu, Mingyan Liu et al.NeurIPS 2020 · 87 citations
- Causal Modeling for Fairness In Dynamical SystemsElliot Creager, David Madras, Toniann Pitassi, Richard S. ZemelICML 2020 · 72 citations
- Bringing Fairness to Actor-Critic Reinforcement Learning for Network Utility OptimizationJingdi Chen, Yimeng Wang, Tian LanINFOCOM 2021 · 23 citations
- Learning Fair Policies in Multi-Objective (Deep) Reinforcement Learning with Average and Discounted RewardsUmer Siddique, Paul Weng, Matthieu ZimmerICML 2020 · 1 citation
Related papers
- FairSense: Long-Term Fairness Analysis of ML-Enabled SystemsYining She, Sumon Biswas, Christian Kästner, Eunsuk KangICSE 2025 · 4 citations
- Long-Term Fairness with Unknown DynamicsTongxin Yin, Reilly Raab, Mingyan Liu, Yang LiuNeurIPS 2023 · 33 citations
- MAFE: Enabling Equitable Algorithm Design in Multi-Agent Multi-Stage Decision-Making SystemsZachary Lazri, Anirudh Nakra, Ivan Brugere, Danial Dervovic et al.ICML 2026
- Achieving Fairness in Multi-Agent MDP Using Reinforcement LearningPeizhong Ju, Arnob Ghosh, Ness B. ShroffICLR 2024 · 8 citations
- Personalized Reinforcement Learning with a Budget of PoliciesDmitry Ivanov, Omer Ben-PoratAAAI 2024 · 4 citations
