Improved Worst-Case Regret Bounds for Randomized Least-Squares Value Iteration
Priyank Agrawal, Jinglin Chen, Nan Jiang
2021年份
24被引次数
12顶会引用
摘要
This paper studies regret minimization with randomized value functions in reinforcement learning. In tabular finite-horizon Markov Decision Processes, we introduce a clipping variant of one classical Thompson Sampling (TS)-like algorithm, randomized least-squares value iteration (RLSVI). Our Õ(H 2 S √ AT ) high-probability worst-case regret bound improves the previous sharpest worst-case regret bounds for RLSVI and matches the existing state-of-the-art worst-case TS-based regret bounds. * These two authors contributed equally. 1 Õ (•) hides dependence on logarithmic factors.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper12
- Making RL with Preference-based Feedback Efficient via RandomizationRunzhe Wu, Wen SunICLR 2024 · 被引用 44 次
- A Provably Efficient Model-Free Posterior Sampling Method for Episodic Reinforcement LearningChristoph Dann, Mehryar Mohri, Tong Zhang, Julian ZimmertNeurIPS 2021 · 被引用 43 次
- Towards Deployment-Efficient Reinforcement Learning: Lower Bound and OptimalityJiawei Huang, Jinglin Chen, Li Zhao, Tao Qin 等ICLR 2022 · 被引用 32 次
- Randomized Exploration in Cooperative Multi-Agent Reinforcement LearningHao-Lun Hsu, Weixin Wang, Miroslav Pajic, Pan XuNeurIPS 2024 · 被引用 25 次
- A Self-Play Posterior Sampling Algorithm for Zero-Sum Markov GamesWei Xiong, Han Zhong, Chengshuai Shi, Cong Shen 等ICML 2022 · 被引用 24 次
它引用的顶会 Paper1
相关 Paper
- Near-Optimal Randomized Exploration for Tabular Markov Decision ProcessesZhihan Xiong, Ruoqi Shen, Qiwen Cui, Maryam Fazel 等NeurIPS 2022 · 被引用 17 次
- Concurrent Reinforcement Learning with Aggregated States via Randomized Least Squares Value IterationYan Chen, Qinxun Bai, Yiteng Zhang, Maria Dimakopoulou 等ICML 2025
- Randomized Exploration in Reinforcement Learning with General Value Function ApproximationHaque Ishfaq, Qiwen Cui, Viet Nguyen, Alex Ayoub 等ICML 2021 · 被引用 3 次
- Model-free Posterior Sampling via Learning Rate RandomizationDaniil Tiapkin, Denis Belomestny, Daniele Calandriello, Eric Moulines 等NeurIPS 2023 · 被引用 8 次
- Q-learning with Posterior SamplingPriyank Agrawal, Shipra Agrawal, Azmat AzatiICLR 2026 · 被引用 3 次
