Detect, Distill and Update: Learned DB Systems Facing Out of Distribution Data
Meghdad Kurmanji, Peter Triantafillou
摘要
Machine Learning (ML) is changing DBs as many DB components are being replaced by ML models. One open problem in this setting is how to update such ML models in the presence of data updates. We start this investigation focusing on data insertions (dominating updates in analytical DBs). We study how to update neural network (NN) models when new data follows a different distribution (a.k.a. it is "out-of-distribution" -- OOD), rendering previously-trained NNs inaccurate. A requirement in our problem setting is that learned DB components should ensure high accuracy for tasks on old and new data (e.g., for approximate query processing (AQP), cardinality estimation (CE), synthetic data generation (DG), etc.). This paper proposes a novel updatability framework (DDUp). DDUp can provide updatability for different learned DB system components, even based on different NNs, without the high costs to retrain the NNs from scratch. DDUp entails two components: First, a novel, efficient, and principled statistical-testing approach to detect OOD data. Second, a novel model updating approach, grounded on the principles of transfer learning with knowledge distillation, to update learned models efficiently, while still ensuring high accuracy. We develop and showcase DDUp's applicability for three different learned DB components, AQP, CE, and DG, each employing a different type of NN. Detailed experimental evaluation using real and benchmark datasets for AQP, CE, and DG detail DDUp's performance advantages.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper12
- Eraser: Eliminating Performance Regression on Learned Query OptimizerLianggui Weng, Rong Zhu, Di Wu, Bolin Ding 等VLDB 2024 · 被引用 19 次
- E2ETune: End-to-End Knob Tuning via Fine-tuned Generative Language ModelXinmei Huang, Haoyang Li, Jing Zhang, Xinxin Zhao 等VLDB 2025 · 被引用 15 次
- Machine Unlearning in Learned Databases: An Experimental AnalysisMeghdad Kurmanji, Eleni Triantafillou, Peter TriantafillouSIGMOD 2024 · 被引用 12 次
- PACE: Poisoning Attacks on Learned Cardinality EstimationJintao Zhang, Chao Zhang, Guoliang Li, Chengliang ChaiSIGMOD 2024 · 被引用 9 次
- TRAP: Tailored Robustness Assessment for Index Advisors via Adversarial PerturbationWei Zhou, Chen Lin, Xuanhe Zhou, Guoliang Li 等ICDE 2024 · 被引用 3 次
它引用的顶会 Paper21
- Bayesian Deep Learning and a Probabilistic Perspective of GeneralizationAndrew Gordon Wilson, Pavel IzmailovNeurIPS 2020 · 被引用 845 次
- Remember What You Want to Forget: Algorithms for Machine UnlearningAyush Sekhari, Jayadev Acharya, Gautam Kamath, Ananda Theertha SureshNeurIPS 2021 · 被引用 516 次
- ALEX: An Updatable Adaptive Learned IndexJialin Ding, Umar Farooq Minhas, Jia Yu, Chi Wang 等SIGMOD 2020 · 被引用 274 次
- Bao: Making Learned Query Optimization PracticalRyan Marcus, Parimarjan Negi, Hongzi Mao, Nesime Tatbul 等SIGMOD 2021 · 被引用 242 次
- Likelihood Regret: An Out-of-Distribution Detection Score For Variational Auto-encoderZhisheng Xiao, Qing Yan, Yali AmitNeurIPS 2020 · 被引用 234 次
相关 Paper
- DeepDB: Learn from Data, not from Queries!Benjamin Hilprecht, Andreas Schmidt, Moritz Kulessa, Alejandro Molina 等VLDB 2020 · 被引用 154 次
- DistVec: Efficient Distributed Machine Learning in Parallel Database SystemsXinyi Zhang, Liangzu Liu, Xupeng Miao, Yinjun Wu 等ICDE 2026
- Theoretical Analysis of Learned Database Operations under Distribution Shift through Distribution LearnabilitySepanta Zeighami, Cyrus ShahabiICML 2024 · 被引用 5 次
- Lightweight and Accurate Cardinality Estimation by Neural Network Gaussian ProcessKangfei Zhao, Jeffrey Xu Yu, Zongyan He, Rui Li 等SIGMOD 2022 · 被引用 28 次
- NeurBench: A Benchmark Suite for Learned Database Components with Drift Modeling: [Experiments & Analysis]Zhanhao Zhao, Haotian Gao, Naili Xing, Lingze Zeng 等SIGMOD 2026
