An Alternative to Variance: Gini Deviation for Risk-averse Policy Gradient
Yudong Luo, Guiliang Liu, Pascal Poupart, Yangchen Pan
Abstract
Restricting the variance of a policy's return is a popular choice in risk-averse Reinforcement Learning (RL) due to its clear mathematical definition and easy interpretability. Traditional methods directly restrict the total return variance. Recent methods restrict the per-step reward variance as a proxy. We thoroughly examine the limitations of these variance-based methods, such as sensitivity to numerical scale and hindering of policy learning, and propose to use an alternative risk measure, Gini deviation, as a substitute. We study various properties of this new risk measure and derive a policy gradient algorithm to minimize it. Empirical evaluation in domains where risk-aversion can be clearly defined, shows that our algorithm can mitigate the limitations of variance-based risk measures and achieves high return with low risk in terms of variance and Gini deviation when others fail to learn a reasonable policy.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 2e5f84ba-7854-46c1-82b2-e927281800a9Cited by top-tier papers7
- Uncertainty-aware Constraint Inference in Inverse Constrained Reinforcement LearningSheng Xu, Guiliang LiuICLR 2024 · 12 citations
- Last-Iterate Global Convergence of Policy Gradients for Constrained Reinforcement LearningAlessandro Montenegro, Marco Mussi, Matteo Papini, Alberto Maria MetelliNeurIPS 2024 · 3 citations
- ORVIT: Near-Optimal Online Distributionally Robust Reinforcement LearningDebamita Ghosh, George K. Atia, Yue WangAAAI 2026 · 2 citations
- Policy Newton Methods for Distortion RiskmetricsSoumen Pachal, Mizhaan Prajit Maniyar, Prashanth L. A.AAAI 2026
- Risk-Sensitive Exponential Actor CriticAlonso Granados Baca, Jason PachecoAAAI 2026
Builds on7
- WCSAC: Worst-Case Soft Actor Critic for Safety-Constrained Reinforcement LearningQisong Yang, Thiago D. Simão, Simon H. Tindemans, Matthijs T. J. SpaanAAAI 2021 · 168 citations
- Efficient Risk-Averse Reinforcement LearningIdo Greenberg, Yinlam Chow, Mohammad Ghavamzadeh, Shie MannorNeurIPS 2022 · 61 citations
- Mean-Variance Policy Iteration for Risk-Averse Reinforcement LearningShangtong Zhang, Bo Liu, Shimon WhitesonAAAI 2021 · 44 citations
- Implicit Distributional Reinforcement LearningYuguang Yue, Zhendong Wang, Mingyuan ZhouNeurIPS 2020 · 18 citations
- Distributional Reinforcement Learning with Monotonic SplinesYudong Luo, Guiliang Liu, Haonan Duan, Oliver Schulte et al.ICLR 2022 · 18 citations
Related papers
- Variance Penalized On-Policy and Off-Policy Actor-CriticArushi Jain, Gandharv Patil, Ayush Jain, Khimya Khetarpal et al.AAAI 2021 · 11 citations
- Policy Evaluation for Variance in Average Reward Reinforcement LearningShubhada Agrawal, Prashanth L. A., Siva Theja MaguluriICML 2024 · 5 citations
- Risk-averse Total-reward MDPs with ERM and EVaRXihong Su, Marek Petrik, Julien Grand-ClémentAAAI 2025 · 3 citations
- Pitfall of Optimism: Distributional Reinforcement Learning by Randomizing Risk CriterionTaehyun Cho, Seungyub Han, Heesoo Lee, Kyungjae Lee et al.NeurIPS 2023 · 10 citations
- Learning Anisotropic Value Geometry with Finsler Reinforcement LearningJumman Hossain, Nirmalya RoyICML 2026
