Approximate Bilevel Difference Convex Programming for Bayesian Risk Markov Decision Processes
Yifan Lin, Enlu Zhou
摘要
We consider infinite-horizon Markov Decision Processes where parameters, such as transition probabilities, are unknown and estimated from data. The popular distributionally robust approach to addressing the parameter uncertainty can sometimes be overly conservative. In this paper, we utilize the recently proposed formulation, Bayesian risk Markov Decision Process (BR-MDP), to address parameter (or epistemic) uncertainty in MDPs. To solve the infinite-horizon BR-MDP with a class of convex risk measures, we propose a computationally efficient approach called approximate bilevel difference convex programming (ABDCP). The optimization is performed offline and produces the optimal policy that is represented as a finite state controller with desirable performance guarantees. We also demonstrate the empirical performance of the BR-MDP formulation and the proposed algorithm.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper5
- Policy Gradient Method For Robust Reinforcement LearningYue Wang, Shaofeng ZouICML 2022 · 被引用 104 次
- Risk-Averse Bayes-Adaptive Reinforcement LearningMarc Rigter, Bruno Lacerda, Nick HawesNeurIPS 2021 · 被引用 50 次
- Constrained Risk-Averse Markov Decision ProcessesMohamadreza Ahmadi, Ugo Rosolia, Michel D. Ingham, Richard M. Murray 等AAAI 2021 · 被引用 31 次
- Bayesian Risk Markov Decision ProcessesYifan Lin, Yuxuan Ren, Enlu ZhouNeurIPS 2022 · 被引用 18 次
- Percentile Criterion Optimization in Offline Reinforcement LearningCyrus Cousins, Elita A. Lobo, Marek Petrik, Yair ZickNeurIPS 2023 · 被引用 5 次
相关 Paper
- Bayesian Risk-Averse Q-Learning with Streaming ObservationsYuhao Wang, Enlu ZhouNeurIPS 2023 · 被引用 8 次
- Efficient Solution and Learning of Robust Factored MDPsYannik Schnitzer, Alessandro Abate, David ParkerAAAI 2026 · 被引用 1 次
- Dynamic Programming for Epistemic Uncertainty in Markov Decision ProcessesAxel Benyamine, Julien Grand-Clément, Marek Petrik, Michael Jordan 等ICML 2026 · 被引用 1 次
- Solving Robust Markov Decision Processes: Generic, Reliable, EfficientTobias Meggendorfer, Maximilian Weininger, Patrick WienhöftAAAI 2025
- Robust Anytime Learning of Markov Decision ProcessesMarnix Suilen, Thiago D. Simão, David Parker, Nils JansenNeurIPS 2022 · 被引用 31 次
