An Alternative to Variance: Gini Deviation for Risk-averse Policy Gradient
Yudong Luo, Guiliang Liu, Pascal Poupart, Yangchen Pan
摘要
Restricting the variance of a policy's return is a popular choice in risk-averse Reinforcement Learning (RL) due to its clear mathematical definition and easy interpretability. Traditional methods directly restrict the total return variance. Recent methods restrict the per-step reward variance as a proxy. We thoroughly examine the limitations of these variance-based methods, such as sensitivity to numerical scale and hindering of policy learning, and propose to use an alternative risk measure, Gini deviation, as a substitute. We study various properties of this new risk measure and derive a policy gradient algorithm to minimize it. Empirical evaluation in domains where risk-aversion can be clearly defined, shows that our algorithm can mitigate the limitations of variance-based risk measures and achieves high return with low risk in terms of variance and Gini deviation when others fail to learn a reasonable policy.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper7
- Uncertainty-aware Constraint Inference in Inverse Constrained Reinforcement LearningSheng Xu, Guiliang LiuICLR 2024 · 被引用 12 次
- Last-Iterate Global Convergence of Policy Gradients for Constrained Reinforcement LearningAlessandro Montenegro, Marco Mussi, Matteo Papini, Alberto Maria MetelliNeurIPS 2024 · 被引用 3 次
- ORVIT: Near-Optimal Online Distributionally Robust Reinforcement LearningDebamita Ghosh, George K. Atia, Yue WangAAAI 2026 · 被引用 2 次
- Policy Newton Methods for Distortion RiskmetricsSoumen Pachal, Mizhaan Prajit Maniyar, Prashanth L. A.AAAI 2026
- Risk-Sensitive Exponential Actor CriticAlonso Granados Baca, Jason PachecoAAAI 2026
它引用的顶会 Paper7
- WCSAC: Worst-Case Soft Actor Critic for Safety-Constrained Reinforcement LearningQisong Yang, Thiago D. Simão, Simon H. Tindemans, Matthijs T. J. SpaanAAAI 2021 · 被引用 168 次
- Efficient Risk-Averse Reinforcement LearningIdo Greenberg, Yinlam Chow, Mohammad Ghavamzadeh, Shie MannorNeurIPS 2022 · 被引用 61 次
- Mean-Variance Policy Iteration for Risk-Averse Reinforcement LearningShangtong Zhang, Bo Liu, Shimon WhitesonAAAI 2021 · 被引用 44 次
- Implicit Distributional Reinforcement LearningYuguang Yue, Zhendong Wang, Mingyuan ZhouNeurIPS 2020 · 被引用 18 次
- Distributional Reinforcement Learning with Monotonic SplinesYudong Luo, Guiliang Liu, Haonan Duan, Oliver Schulte 等ICLR 2022 · 被引用 18 次
相关 Paper
- Variance Penalized On-Policy and Off-Policy Actor-CriticArushi Jain, Gandharv Patil, Ayush Jain, Khimya Khetarpal 等AAAI 2021 · 被引用 11 次
- Policy Evaluation for Variance in Average Reward Reinforcement LearningShubhada Agrawal, Prashanth L. A., Siva Theja MaguluriICML 2024 · 被引用 5 次
- Risk-averse Total-reward MDPs with ERM and EVaRXihong Su, Marek Petrik, Julien Grand-ClémentAAAI 2025 · 被引用 3 次
- Pitfall of Optimism: Distributional Reinforcement Learning by Randomizing Risk CriterionTaehyun Cho, Seungyub Han, Heesoo Lee, Kyungjae Lee 等NeurIPS 2023 · 被引用 10 次
- Learning Anisotropic Value Geometry with Finsler Reinforcement LearningJumman Hossain, Nirmalya RoyICML 2026
