Optimistic Initialization for Exploration in Continuous Control
Sam Lobel, Omer Gottesman, Cameron Allen, Akhil Bagaria, George Konidaris
摘要
Optimistic initialization underpins many theoretically sound exploration schemes in tabular domains; however, in the deep function approximation setting, optimism can quickly disappear if initialized naïvely. We propose a framework for more effectively incorporating optimistic initialization into reinforcement learning for continuous control. Our approach uses metric information about the state-action space to estimate which transitions are still unexplored, and explicitly maintains the initial Q-value optimism for the corresponding state-action pairs. We also develop methods for efficiently approximating these training objectives, and for incorporating domain knowledge into the optimistic envelope to improve sample efficiency. We empirically evaluate these approaches on a variety of hard exploration problems in continuous control, where our method outperforms existing exploration techniques. All code to reproduce experiments can be found at this link. 1
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper3
- Exploration and Anti-Exploration with Distributional Random Network DistillationKai Yang, Jian Tao, Jiafei Lyu, Xiu LiICML 2024 · 被引用 37 次
- Flipping Coins to Estimate Pseudocounts for Exploration in Reinforcement LearningSam Lobel, Akhil Bagaria, George KonidarisICML 2023 · 被引用 29 次
- Discovering Options That Minimize Average Planning TimeAlexander Ivanov, Akhil Bagaria, George KonidarisAAAI 2025
它引用的顶会 Paper4
- Maximum Entropy Gain Exploration for Long Horizon Multi-goal Reinforcement LearningSilviu Pitis, Harris Chan, Stephen Zhao, Bradly C. Stadie 等ICML 2020 · 被引用 145 次
- On Bonus Based Exploration Methods In The Arcade Learning EnvironmentAdrien Ali Taïga, William Fedus, Marlos C. Machado, Aaron C. Courville 等ICLR 2020 · 被引用 72 次
- Optimistic Exploration even with a Pessimistic InitialisationTabish Rashid, Bei Peng, Wendelin Boehmer, Shimon WhitesonICLR 2020 · 被引用 50 次
- Deep Radial-Basis Value Functions for Continuous ControlKavosh Asadi, Neev Parikh, Ronald E. Parr, George Dimitri Konidaris 等AAAI 2021 · 被引用 25 次
相关 Paper
- Principled Exploration via Optimistic Bootstrapping and Backward InductionChenjia Bai, Lingxiao Wang, Lei Han, Jianye Hao 等ICML 2021 · 被引用 46 次
- OVD-Explorer: Optimism Should Not Be the Sole Pursuit of Exploration in Noisy EnvironmentsJinyi Liu, Zhi Wang, Yan Zheng, Jianye Hao 等AAAI 2024 · 被引用 14 次
- Exploit Reward Shifting in Value-Based Deep-RL: Optimistic Curiosity-Based Exploration and Conservative Exploitation via Linear Reward ShapingHao Sun, Lei Han, Rui Yang, Xiaoteng Ma 等NeurIPS 2022 · 被引用 46 次
- Tactical Optimism and Pessimism for Deep Reinforcement LearningTed Moskovitz, Jack Parker-Holder, Aldo Pacchiano, Michael Arbel 等NeurIPS 2021 · 被引用 75 次
- Efficient Exploration via Epistemic-Risk-Seeking Policy OptimizationBrendan O'DonoghueICML 2023 · 被引用 11 次
