Cross-Validated Off-Policy Evaluation
Matej Cief, Branislav Kveton, Michal Kompan
2025年份
2被引次数
2顶会引用
摘要
We study estimator selection and hyper-parameter tuning in off-policy evaluation. Although cross-validation is the most popular method for model selection in supervised learning, off-policy evaluation relies mostly on theory, which provides only limited guidance to practitioners. We show how to use cross-validation for off-policy evaluation. This challenges a popular belief that cross-validation in off-policy evaluation is not feasible. We evaluate our method empirically and show that it addresses a variety of use cases.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper2
- Cross-Domain Off-Policy Evaluation and Learning for Contextual BanditsYuta Natsubori, Masataka Ushiku, Yuta SaitoICLR 2025
- Off-Policy Evaluation and Learning for the Future under Non-StationarityTatsuhiro Shimizu, Kazuki Kawamura, Takanori Muroi, Yusuke Narita 等KDD 2025
它引用的顶会 Paper11
- Doubly robust off-policy evaluation with shrinkageYi Su, Maria Dimakopoulou, Akshay Krishnamurthy, Miroslav DudíkICML 2020 · 被引用 128 次
- Off-Policy Evaluation for Large Action Spaces via EmbeddingsYuta Saito, Thorsten JoachimsICML 2022 · 被引用 62 次
- Subgaussian and Differentiable Importance Sampling for Off-Policy Evaluation and LearningAlberto Maria Metelli, Alessio Russo, Marcello RestelliNeurIPS 2021 · 被引用 55 次
- Adaptive Estimator Selection for Off-Policy EvaluationYi Su, Pavithra Srinath, Akshay KrishnamurthyICML 2020 · 被引用 55 次
- Off-Policy Evaluation for Large Action Spaces via Conjunct Effect ModelingYuta Saito, Qingyang Ren, Thorsten JoachimsICML 2023 · 被引用 34 次
相关 Paper
- Policy-Adaptive Estimator Selection for Off-Policy EvaluationTakuma Udagawa, Haruka Kiyohara, Yusuke Narita, Yuta Saito 等AAAI 2023 · 被引用 29 次
- Model Selection for Off-policy Evaluation: New Algorithms and Experimental ProtocolPai Liu, Lingfeng Zhao, Shivangi Agarwal, Jinghan Liu 等NeurIPS 2025 · 被引用 6 次
- Optimal Off-Policy Evaluation from Multiple Logging PoliciesNathan Kallus, Yuta Saito, Masatoshi UeharaICML 2021 · 被引用 44 次
- Towards Hyperparameter-free Policy Selection for Offline Reinforcement LearningSiyuan Zhang, Nan JiangNeurIPS 2021 · 被引用 47 次
- Is Cross-validation the Gold Standard to Estimate Out-of-sample Model Performance?Garud Iyengar, Henry Lam, Tianyu WangNeurIPS 2024 · 被引用 6 次
