First-Order Methods for Wasserstein Distributionally Robust MDP
Julien Grand-Clément, Christian Kroer
摘要
Markov Decision Processes (MDPs) are known to be sensitive to parameter specification. Distributionally robust MDPs alleviate this issue by allowing for ambiguity sets which give a set of possible distributions over parameter sets. The goal is to find an optimal policy with respect to the worst-case parameter distribution. We propose a first-order methods framework for solving Distributionally robust MDPs, and instantiate it for several types of Wasserstein ambiguity sets. By developing efficient proximal updates, our algorithms achieve a convergence rate of for the number of kernels in the support of the nominal distribution, states , and actions (this rate varies slightly based on the Wasserstein setup). Our dependence on , and is significantly better than existing methods; compared to Value Iteration, it is better by a factor of . Numerical experiments on random instances and instances inspired from a machine replacement example show that our algorithm is significantly more scalable than state-of-the-art approaches.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了最后一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper10
- Fast Bellman Updates for Wasserstein Distributionally Robust MDPsZhuodong Yu, Ling Dai, Shaohang Xu, Siyang Gao 等NeurIPS 2023 · 被引用 15 次
- Finite-Sample Analysis of Policy Evaluation for Robust Average Reward Reinforcement LearningYang Xu, Washim Uddin Mondal, Vaneet AggarwalNeurIPS 2025 · 被引用 9 次
- Distributionally Robust Optimization with Bias and Variance ReductionRonak Mehta, Vincent Roulet, Krishna Pillutla, Zaïd HarchaouiICLR 2024 · 被引用 6 次
- Conic Blackwell Algorithm: Parameter-Free Convex-Concave Saddle-Point SolvingJulien Grand-Clément, Christian KroerNeurIPS 2021 · 被引用 6 次
- Percentile Criterion Optimization in Offline Reinforcement LearningCyrus Cousins, Elita A. Lobo, Marek Petrik, Yair ZickNeurIPS 2023 · 被引用 5 次
它引用的顶会 Paper3
- Efficiently Solving MDPs with Stochastic Mirror DescentYujia Jin, Aaron SidfordICML 2020 · 被引用 83 次
- Scalable First-Order Methods for Robust MDPsJulien Grand-Clément, Christian KroerAAAI 2021 · 被引用 33 次
- Increasing Iterate Averaging for Solving Saddle-Point ProblemsYuan Gao, Christian Kroer, Donald GoldfarbAAAI 2021 · 被引用 17 次
相关 Paper
- Robust -Divergence MDPsChin Pang Ho, Marek Petrik, Wolfram WiesemannNeurIPS 2022 · 被引用 13 次
- Robust Satisficing MDPsHaolin Ruan, Siyu Zhou, Zhi Chen, Chin Pang HoICML 2023 · 被引用 2 次
- Sample Complexity of Distributionally Robust Average-Reward Reinforcement LearningZijun Chen, Shengbo Wang, Nian SiNeurIPS 2025 · 被引用 9 次
- The Curious Price of Distributional Robustness in Reinforcement Learning with a Generative ModelLaixi Shi, Gen Li, Yuting Wei, Yuxin Chen 等NeurIPS 2023 · 被引用 66 次
- Fast Epigraphical Projection-based Incremental Algorithms for Wasserstein Distributionally Robust Support Vector MachineJiajin Li, Caihua Chen, Anthony Man-Cho SoNeurIPS 2020 · 被引用 27 次
