Leveraging Factored Action Spaces for Efficient Offline Reinforcement Learning in Healthcare
Shengpu Tang, Maggie Makar, Michael W. Sjoding, Finale Doshi-Velez, Jenna Wiens
摘要
Many reinforcement learning (RL) applications have combinatorial action spaces, where each action is a composition of sub-actions. A standard RL approach ignores this inherent factorization structure, resulting in a potential failure to make meaningful inferences about rarely observed sub-action combinations; this is particularly problematic for offline settings, where data may be limited. In this work, we propose a form of linear Q-function decomposition induced by factored action spaces. We study the theoretical properties of our approach, identifying scenarios where it is guaranteed to lead to zero bias when used to approximate the Q-function. Outside the regimes with theoretical guarantees, we show that our approach can still be useful because it leads to better sample efficiency without necessarily sacrificing policy optimality, allowing us to achieve a better bias-variance trade-off. Across several offline RL problems using simulators and real-world datasets motivated by healthcare, we demonstrate that incorporating factored action spaces into value-based RL can result in better-performing policies. Our approach can help an agent make more accurate inferences within underexplored regions of the state-action space when applying RL to observational datasets.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper22
- Hierarchical Diffusion for Offline Decision MakingWenhao Li, Xiangfeng Wang, Bo Jin, Hongyuan ZhaICML 2023 · 被引用 80 次
- Factored Adaptation for Non-Stationary Reinforcement LearningFan Feng, Biwei Huang, Kun Zhang, Sara MagliacaneNeurIPS 2022 · 被引用 52 次
- Reliable Off-Policy Learning for Dosage CombinationsJonas Schweisthal, Dennis Frauen, Valentyn Melnychuk, Stefan FeuerriegelNeurIPS 2023 · 被引用 22 次
- Importance Weighted Actor-Critic for Optimal Conservative Offline Reinforcement LearningHanlin Zhu, Paria Rashidinejad, Jiantao JiaoNeurIPS 2023 · 被引用 21 次
- Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RLQin-Wen Luo, Ming-Kun Xie, Ye-Wen Wang, Sheng-Jun HuangNeurIPS 2024 · 被引用 15 次
它引用的顶会 Paper9
- QPLEX: Duplex Dueling Multi-Agent Q-LearningJianhao Wang, Zhizhou Ren, Terry Liu, Yang Yu 等ICLR 2021 · 被引用 595 次
- Batch Value-function Approximation with Only RealizabilityTengyang Xie, Nan JiangICML 2021 · 被引用 131 次
- Off-Policy Evaluation for Large Action Spaces via EmbeddingsYuta Saito, Thorsten JoachimsICML 2022 · 被引用 62 次
- Risk Bounds and Rademacher Complexity in Batch Reinforcement LearningYaqi Duan, Chi Jin, Zhiyuan LiICML 2021 · 被引用 53 次
- Medical Dead-ends and Learning to Identify High-Risk States and TreatmentsMehdi Fatemi, Taylor W. Killian, Jayakumar Subramanian, Marzyeh GhassemiNeurIPS 2021 · 被引用 51 次
相关 Paper
- BraVE: Offline Reinforcement Learning for Discrete Combinatorial Action SpacesMatthew Landers, Taylor W. Killian, Hugo Barnes, Tom Hartvigsen 等NeurIPS 2025 · 被引用 6 次
- In-Context Compositional Q-Learning for Offline Reinforcement LearningQiushui Xu, Yuhao Huang, Yushu Jiang, Wenliang Zheng 等ICLR 2026
- The Benefits of Model-Based Generalization in Reinforcement LearningKenny John Young, Aditya A. Ramesh, Louis Kirsch, Jürgen SchmidhuberICML 2023 · 被引用 18 次
- Reinforcement Learning with Action ChunkingQiyang Li, Zhiyuan Zhou, Sergey LevineNeurIPS 2025 · 被引用 114 次
- Partial Action Replacement: Tackling Distribution Shift in Offline MARLYue Jin, Giovanni MontanaAAAI 2026 · 被引用 1 次
