Continuous-time Model-based Reinforcement Learning
Çagatay Yildiz, Markus Heinonen, Harri Lähdesmäki
Abstract
Model-based reinforcement learning (MBRL) approaches rely on discrete-time state transition models whereas physical systems and the vast majority of control tasks operate in continuous-time. To avoid time-discretization approximation of the underlying process, we propose a continuous-time MBRL framework based on a novel actor-critic method. Our approach also infers the unknown state evolution differentials with Bayesian neural ordinary differential equations (ODE) to account for epistemic uncertainty. We implement and test our method on a new ODE-RL suite that explicitly solves continuous-time control systems. Our experiments illustrate that the model is robust against irregular and noisy data, is sample-efficient, and can solve control problems which pose challenges to discrete-time MBRL methods.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Cited by top-tier papers19
- Neural Differential Equations for Learning to Program Neural Nets Through Continuous Learning RulesKazuki Irie, Francesco Faccio, Jürgen SchmidhuberNeurIPS 2022 · 24 citations
- Efficient Exploration in Continuous-time Model-based Reinforcement LearningLenart Treven, Jonas Hübotter, Bhavya Sukhija, Florian Dörfler et al.NeurIPS 2023 · 24 citations
- Physics-Informed Neural Network Policy Iteration: Algorithms, Convergence, and VerificationYiming Meng, Ruikun Zhou, Amartya Mukherjee, Maxwell Fitzsimmons et al.ICML 2024 · 23 citations
- ODE-based Recurrent Model-free Reinforcement Learning for POMDPsXuanle Zhao, Duzhen Zhang, Liyuan Han, Tielin Zhang et al.NeurIPS 2023 · 18 citations
- Robustifying State-space Models for Long Sequences via Approximate DiagonalizationAnnan Yu, Arnur Nigmetov, Dmitriy Morozov, Michael W. Mahoney et al.ICLR 2024 · 18 citations
Builds on6
- Mastering Atari with Discrete World ModelsDanijar Hafner, Timothy P. Lillicrap, Mohammad Norouzi, Jimmy BaICLR 2021 · 1,170 citations
- BatchEnsemble: an Alternative Approach to Efficient Ensemble and Lifelong LearningYeming Wen, Dustin Tran, Jimmy BaICLR 2020 · 569 citations
- Symplectic ODE-Net: Learning Hamiltonian Dynamics with ControlYaofeng Desmond Zhong, Biswadip Dey, Amit ChakrabortyICLR 2020 · 319 citations
- Adaptive Checkpoint Adjoint Method for Gradient Estimation in Neural ODEJuntang Zhuang, Nicha C. Dvornek, Xiaoxiao Li, Sekhar Tatikonda et al.ICML 2020 · 125 citations
- Trust the Model When It Is Confident: Masked Model-based Actor-CriticFeiyang Pan, Jia He, Dandan Tu, Qing HeNeurIPS 2020 · 65 citations
Related papers
- Sample-efficient and Scalable Exploration in Continuous-Time RLKlemens Iten, Lenart Treven, Bhavya Sukhija, Florian Dörfler et al.ICLR 2026 · 3 citations
- Model-based Reinforcement Learning for Semi-Markov Decision Processes with Neural ODEsJianzhun Du, Joseph Futoma, Finale Doshi-VelezNeurIPS 2020 · 63 citations
- Distributional Gradient Matching for Learning Uncertain Neural Dynamics ModelsLenart Treven, Philippe Wenk, Florian Dörfler, Andreas KrauseNeurIPS 2021 · 3 citations
- Task-Agnostic Online Reinforcement Learning with an Infinite Mixture of Gaussian ProcessesMengdi Xu, Wenhao Ding, Jiacheng Zhu, Zuxin Liu et al.NeurIPS 2020 · 39 citations
- A Temporal Difference Method for Stochastic Continuous DynamicsHaruki Settai, Naoya Takeishi, Takehisa YairiNeurIPS 2025 · 3 citations
