Gradient-Based Nonlinear Rehearsal Learning with Multivariate Alterations
Tian Qin, Tian-Zuo Wang, Zhi-Hua Zhou
Abstract
Machine learning (ML) has made significant advancements across various domains, with a shifting focus from purely predictive tasks to decision-making. The recent proposal by Zhou (2022) introduced a line of research known as rehearsal learning, which provides a novel perspective on modeling decision-making tasks. However, previous studies mainly focused on the linear Gaussian setting to constrain the modeling complexity. Furthermore, it has been demonstrated that finding exact optimal multivariate decisions within the sampling-based rehearsal framework is computationally infeasible in polynomial time, necessitating the development of approximate methods. In this work, we present Grad-Rh, the first gradient-based rehearsal learning method that can efficiently find multivariate decisions under non-linear and non-Gaussian settings. We address the uncertainty in decision-making tasks using flexible and expressive conditional normalizing flow models and derive four surrogate loss functions to enable efficient gradient-based optimization. Experimental results show that Grad-Rh performs comparably to exact baselines on linear data and significantly outperforms them on non-linear data in both decision quality and running time.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 9ddc087e-ae4d-4087-be22-933e2cc95b93Cited by top-tier papers4
- Structural Causal Bandits under Markov EquivalenceMin Woo Park, Andy Arditi, Elias Bareinboim, Sanghack LeeNeurIPS 2025 · 3 citations
- Counterfactual Structural Causal BanditsMin Woo Park, Sanghack LeeICLR 2026 · 1 citation
- Variance-Reduced Long-Term Rehearsal Learning with Quadratic Programming ReformulationWen-Bo Du, Tian Qin, Tian-Zuo Wang, Zhi-Hua ZhouNeurIPS 2025 · 1 citation
- On Measuring Influence in Avoiding Undesired FutureLue Tao, Tian-Zuo Wang, Yuan Jiang, Zhi-Hua ZhouICLR 2026
Builds on6
- Language Models are Few-Shot LearnersTom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah et al.NeurIPS 2020 · 64,255 citations
- Sound and Complete Causal Identification with Latent Variables Given Local Background KnowledgeTian-Zuo Wang, Tian Qin, Zhi-Hua ZhouNeurIPS 2022 · 22 citations
- Estimating Possible Causal Effects with Latent Variables via AdjustmentTian-Zuo Wang, Tian Qin, Zhi-Hua ZhouICML 2023 · 16 citations
- Rehearsal Learning for Avoiding Undesired FutureTian Qin, Tian-Zuo Wang, Zhi-Hua ZhouNeurIPS 2023 · 8 citations
- Avoiding Undesired Future with Minimal Cost in Non-Stationary EnvironmentsWen-Bo Du, Tian Qin, Tian-Zuo Wang, Zhi-Hua ZhouNeurIPS 2024 · 6 citations
Related papers
- Enabling Optimal Decisions in Rehearsal Learning under CARE ConditionWen-Bo Du, Hao-Yi Lei, Lue Tao, Tian-Zuo Wang et al.ICML 2025
- Policy Rehearsing: Training Generalizable Policies for Reinforcement LearningChengxing Jia, Chenxiao Gao, Hao Yin, Fuxiang Zhang et al.ICLR 2024 · 6 citations
- Locally Convex Global Loss Network for Decision-Focused LearningHaeun Jeon, Hyunglip Bae, Minsu Park, Chanyeong Kim et al.AAAI 2025 · 6 citations
- Reliable Off-Policy Learning for Dosage CombinationsJonas Schweisthal, Dennis Frauen, Valentyn Melnychuk, Stefan FeuerriegelNeurIPS 2023 · 22 citations
- Probabilistic Forecasting of Irregularly Sampled Time Series with Missing Values via Conditional Normalizing FlowsVijaya Krishna Yalavarthi, Randolf Scholz, Stefan Born, Lars Schmidt-ThiemeAAAI 2025 · 6 citations
