Continuous-time Model-based Reinforcement Learning
Çagatay Yildiz, Markus Heinonen, Harri Lähdesmäki
摘要
Model-based reinforcement learning (MBRL) approaches rely on discrete-time state transition models whereas physical systems and the vast majority of control tasks operate in continuous-time. To avoid time-discretization approximation of the underlying process, we propose a continuous-time MBRL framework based on a novel actor-critic method. Our approach also infers the unknown state evolution differentials with Bayesian neural ordinary differential equations (ODE) to account for epistemic uncertainty. We implement and test our method on a new ODE-RL suite that explicitly solves continuous-time control systems. Our experiments illustrate that the model is robust against irregular and noisy data, is sample-efficient, and can solve control problems which pose challenges to discrete-time MBRL methods.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper19
- Neural Differential Equations for Learning to Program Neural Nets Through Continuous Learning RulesKazuki Irie, Francesco Faccio, Jürgen SchmidhuberNeurIPS 2022 · 被引用 24 次
- Efficient Exploration in Continuous-time Model-based Reinforcement LearningLenart Treven, Jonas Hübotter, Bhavya Sukhija, Florian Dörfler 等NeurIPS 2023 · 被引用 24 次
- Physics-Informed Neural Network Policy Iteration: Algorithms, Convergence, and VerificationYiming Meng, Ruikun Zhou, Amartya Mukherjee, Maxwell Fitzsimmons 等ICML 2024 · 被引用 23 次
- ODE-based Recurrent Model-free Reinforcement Learning for POMDPsXuanle Zhao, Duzhen Zhang, Liyuan Han, Tielin Zhang 等NeurIPS 2023 · 被引用 18 次
- Robustifying State-space Models for Long Sequences via Approximate DiagonalizationAnnan Yu, Arnur Nigmetov, Dmitriy Morozov, Michael W. Mahoney 等ICLR 2024 · 被引用 18 次
它引用的顶会 Paper6
- Mastering Atari with Discrete World ModelsDanijar Hafner, Timothy P. Lillicrap, Mohammad Norouzi, Jimmy BaICLR 2021 · 被引用 1,170 次
- BatchEnsemble: an Alternative Approach to Efficient Ensemble and Lifelong LearningYeming Wen, Dustin Tran, Jimmy BaICLR 2020 · 被引用 569 次
- Symplectic ODE-Net: Learning Hamiltonian Dynamics with ControlYaofeng Desmond Zhong, Biswadip Dey, Amit ChakrabortyICLR 2020 · 被引用 319 次
- Adaptive Checkpoint Adjoint Method for Gradient Estimation in Neural ODEJuntang Zhuang, Nicha C. Dvornek, Xiaoxiao Li, Sekhar Tatikonda 等ICML 2020 · 被引用 125 次
- Trust the Model When It Is Confident: Masked Model-based Actor-CriticFeiyang Pan, Jia He, Dandan Tu, Qing HeNeurIPS 2020 · 被引用 65 次
相关 Paper
- Sample-efficient and Scalable Exploration in Continuous-Time RLKlemens Iten, Lenart Treven, Bhavya Sukhija, Florian Dörfler 等ICLR 2026 · 被引用 3 次
- Model-based Reinforcement Learning for Semi-Markov Decision Processes with Neural ODEsJianzhun Du, Joseph Futoma, Finale Doshi-VelezNeurIPS 2020 · 被引用 63 次
- Distributional Gradient Matching for Learning Uncertain Neural Dynamics ModelsLenart Treven, Philippe Wenk, Florian Dörfler, Andreas KrauseNeurIPS 2021 · 被引用 3 次
- Task-Agnostic Online Reinforcement Learning with an Infinite Mixture of Gaussian ProcessesMengdi Xu, Wenhao Ding, Jiacheng Zhu, Zuxin Liu 等NeurIPS 2020 · 被引用 39 次
- A Temporal Difference Method for Stochastic Continuous DynamicsHaruki Settai, Naoya Takeishi, Takehisa YairiNeurIPS 2025 · 被引用 3 次
