Q-functionals for Value-Based Continuous Control
Samuel Lobel, Sreehari Rammohan, Bowen He, Shangqun Yu, George Konidaris
Abstract
We present Q-functionals, an alternative architecture for continuous control deep reinforcement learning. Instead of returning a single value for a state-action pair, our network transforms a state into a function that can be rapidly evaluated in parallel for many actions, allowing us to efficiently choose high-value actions through sampling. This contrasts with the typical architecture of off-policy continuous control, where a policy network is trained for the sole purpose of selecting actions from the Q-function. We represent our action-dependent Q-function as a weighted sum of basis functions (Fourier, Polynomial, etc) over the action space, where the weights are state-dependent and output by the Q-functional network. Fast sampling makes practical a variety of techniques that require Monte-Carlo integration over Q-functions, and enables action-selection strategies besides simple value-maximization. We characterize our framework, describe various implementations of Q-functionals, and demonstrate strong performance on a suite of continuous control tasks.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 98a7d2f5-0b5c-4407-8e6e-45a5f76df2d2Cited by top-tier papers2
- Efficient Multi-task Reinforcement Learning with Cross-Task Policy GuidanceJinmin He, Kai Li, Yifan Zang, Haobo Fu et al.NeurIPS 2024 · 11 citations
- Multi-Agent Reinforcement Learning with Hierarchical Coordination for Emergency Responder StationingAmutheezan Sivagnanam, Ava Pettet, Hunter Lee, Ayan Mukhopadhyay et al.ICML 2024 · 10 citations
Builds on1
Related papers
- Overcoming The Spectral Bias of Neural Value ApproximationGe Yang, Anurag Ajay, Pulkit AgrawalICLR 2022 · 30 citations
- Actor-Free Continuous Control via Structurally Maximizable Q-FunctionsYigit Korkmaz, Urvi Bhuwania, Ayush Jain, Erdem BiyikNeurIPS 2025
- Functional Regularization for Reinforcement Learning via Learned Fourier FeaturesAlexander C. Li, Deepak PathakNeurIPS 2021 · 27 citations
- Quality-Diversity Actor-Critic: Learning High-Performing and Diverse Behaviors via Value and Successor Features CriticsLuca Grillotti, Maxence Faldor, Borja G. León, Antoine CullyICML 2024 · 13 citations
- Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-NetworkJijia Liu, Feng Gao, Qingmin Liao, Chao Yu et al.ICML 2025
