Offline Model-Based Optimization via Policy-Guided Gradient Search
Yassine Chemingui, Aryan Deshwal, Trong Nghia Hoang, Janardhan Rao Doppa
摘要
Offline optimization is an emerging problem in many experimental engineering domains including protein, drug or aircraft design, where online experimentation to collect evaluation data is too expensive or dangerous. To avoid that, one has to optimize an unknown function given only its offline evaluation at a fixed set of inputs. A naive solution to this problem is to learn a surrogate model of the unknown function and optimize this surrogate instead. However, such a naive optimizer is prone to erroneous overestimation of the surrogate (possibly due to over-fitting on a biased sample of function evaluation) on inputs outside the offline dataset. Prior approaches addressing this challenge have primarily focused on learning robust surrogate models. However, their search strategies are derived from the surrogate model rather than the actual offline data. To fill this important gap, we introduce a new learning-to-search perspective for offline optimization by reformulating it as an offline reinforcement learning problem. Our proposed policy-guided gradient search approach explicitly learns the best policy for a given surrogate model created from the offline data. Our empirical results on multiple benchmarks demonstrate that the learned optimization policy can be combined with existing offline surrogates to significantly improve the optimization performance.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper16
- Guided Trajectory Generation with Diffusion Models for Offline Model-based OptimizationTaeyoung Yun, Sujin Yun, Jaewoo Lee, Jinkyoo ParkNeurIPS 2024 · 被引用 23 次
- Learning Surrogates for Offline Black-Box Optimization via Gradient MatchingMinh Hoang, Azza Fadhel, Aryan Deshwal, Jana Doppa 等ICML 2024 · 被引用 18 次
- Offline Multi-Objective OptimizationKe Xue, Rong-Xi Tan, Xiaobin Huang, Chao QianICML 2024 · 被引用 14 次
- Preference-Guided Diffusion for Multi-Objective Offline OptimizationYashas Annadani, Syrine Belakaria, Stefano Ermon, Stefan Bauer 等NeurIPS 2025 · 被引用 12 次
- Boosting Offline Optimizers with Surrogate SensitivityManh Cuong Dao, Phi Le Nguyen, Truong Thao Nguyen, Trong Nghia HoangICML 2024 · 被引用 10 次
它引用的顶会 Paper17
- Conservative Q-Learning for Offline Reinforcement LearningAviral Kumar, Aurick Zhou, George Tucker, Sergey LevineNeurIPS 2020 · 被引用 2,881 次
- Offline Reinforcement Learning with Implicit Q-LearningIlya Kostrikov, Ashvin Nair, Sergey LevineICLR 2022 · 被引用 1,402 次
- A Minimalist Approach to Offline Reinforcement LearningScott Fujimoto, Shixiang Shane GuNeurIPS 2021 · 被引用 1,292 次
- MOPO: Model-based Offline Policy OptimizationTianhe Yu, Garrett Thomas, Lantao Yu, Stefano Ermon 等NeurIPS 2020 · 被引用 989 次
- MOReL: Model-Based Offline Reinforcement LearningRahul Kidambi, Aravind Rajeswaran, Praneeth Netrapalli, Thorsten JoachimsNeurIPS 2020 · 被引用 870 次
相关 Paper
- Incorporating Surrogate Gradient Norm to Improve Offline Optimization TechniquesCuong Dao, Phi Le Nguyen, Truong Thao Nguyen, Nghia HoangNeurIPS 2024 · 被引用 8 次
- Offline Model-Based Optimization by Learning to RankRong-Xi Tan, Ke Xue, Shen-Huan Lyu, Haopu Shang 等ICLR 2025
- Generative Adversarial Model-Based Optimization via Source Critic RegularizationMichael S. Yao, Yimeng Zeng, Hamsa Bastani, Jacob R. Gardner 等NeurIPS 2024 · 被引用 14 次
- Mind the Gap: Offline Policy Optimization for Imperfect RewardsJianxiong Li, Xiao Hu, Haoran Xu, Jingjing Liu 等ICLR 2023
- Representation Matters: Offline Pretraining for Sequential Decision MakingMengjiao Yang, Ofir NachumICML 2021 · 被引用 126 次
