Zero-Shot Context Generalization in Reinforcement Learning from Few Training Contexts
James Chapman, Kedar Karhadkar, Guido F. Montúfar
Abstract
Deep reinforcement learning (DRL) has achieved remarkable success across multiple domains, including competitive games, natural language processing, and robotics. Despite these advancements, policies trained via DRL often struggle to generalize to evaluation environments with different parameters. This challenge is typically addressed by training with multiple contexts and/or by leveraging additional structure in the problem. However, obtaining sufficient training data across diverse contexts can be impractical in real-world applications. In this work, we consider contextual Markov decision processes (CMDPs) with transition and reward functions that exhibit regularity in context parameters. We introduce the contextenhanced Bellman equation (CEBE) to improve generalization when training on a single context. We prove both analytically and empirically that the CEBE yields a first-order approximation to the Q-function trained across multiple contexts. We then derive context sample enhancement (CSE) as an efficient data augmentation method for approximating the CEBE in deterministic control environments. We numerically validate the performance of CSE in simulation environments, showcasing its potential to improve generalization in DRL. 1
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 10f7cc6c-329d-41bd-90ea-7137b742f39cBuilds on19
- Leveraging Procedural Generation to Benchmark Reinforcement LearningKarl Cobbe, Christopher Hesse, Jacob Hilton, John SchulmanICML 2020 · 685 citations
- One Policy to Control Them All: Shared Modular Policies for Agent-Agnostic ControlWenlong Huang, Igor Mordatch, Deepak PathakICML 2020 · 214 citations
- Why Generalization in RL is Difficult: Epistemic POMDPs and Implicit Partial ObservabilityDibya Ghosh, Jad Rahme, Aviral Kumar, Amy Zhang et al.NeurIPS 2021 · 176 citations
- Understanding Domain Randomization for Sim-to-real TransferXiaoyu Chen, Jiachen Hu, Chi Jin, Lihong Li et al.ICLR 2022 · 164 citations
- Replay-Guided Adversarial Environment DesignMinqi Jiang, Michael Dennis, Jack Parker-Holder, Jakob N. Foerster et al.NeurIPS 2021 · 148 citations
Related papers
- Reidentify: Context-Aware Identity Generation for Contextual Multi-Agent Reinforcement LearningZhiwei Xu, Kun Hu, Xin Xin, Weiliang Meng et al.ICML 2025
- MrCoM: A Meta-Regularized World-Model Generalizing Across Multi-ScenariosXuantang Xiong, Ni Mu, Runpeng Xie, Senhao Yang et al.AAAI 2026
- Robust Situational Reinforcement Learning in Face of Context DisturbancesJinpeng Zhang, Yufeng Zheng, Chuheng Zhang, Li Zhao et al.ICML 2023 · 5 citations
- Automatic Data Augmentation for Generalization in Reinforcement LearningRoberta Raileanu, Maxwell Goldstein, Denis Yarats, Ilya Kostrikov et al.NeurIPS 2021 · 143 citations
- Improving Generalization in Reinforcement Learning with Mixture RegularizationKaixin Wang, Bingyi Kang, Jie Shao, Jiashi FengNeurIPS 2020 · 143 citations
