LeaFi: Data Series Indexes on Steroids with Learned Filters
Qitong Wang, Ioana Ileana, Themis Palpanas
摘要
The ever-growing collections of data series create a pressing need for efficient similarity search, which serves as the backbone for various analytics pipelines. Recent studies have shown that tree-based series indexes excel in many scenarios. However, we observe a significant waste of effort during search, due to suboptimal pruning. To address this issue, we introduce LeaFi, a novel framework that uses machine learning models to boost pruning effectiveness of tree-based data series indexes. These models act as learned filters, which predict tight node-wise distance lower bounds that are used to make pruning decisions, thus, improving pruning effectiveness. We describe the LeaFi-enhanced index building algorithm, which selects leaf nodes and generates training data to insert and train machine learning models, as well as the LeaFi-enhanced search algorithm, which calibrates learned filters at query time to support the user-defined quality target of each query. Our experimental evaluation, using two different tree-based series indexes and five diverse datasets, demonstrates the advantages of the proposed approach. LeaFi-enhanced data-series indexes improve pruning ratio by up to 20x and search time by up to 32x, while maintaining a target recall of 99%.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper5
- Graph-Based Vector Search: An Experimental Evaluation of the State-of-the-ArtIlias Azizi, Karima Echihabi, Themis PalpanasSIGMOD 2025 · 被引用 36 次
- Subspace Collision: An Efficient and Accurate Framework for High-dimensional Approximate Nearest Neighbor SearchJiuqi Wei, Xiaodong Lee, Zhenyu Liao, Themis Palpanas 等SIGMOD 2025 · 被引用 14 次
- DARTH: Declarative Recall Through Early Termination for Approximate Nearest Neighbor SearchManos Chatzakis, Yannis Papakonstantinou, Themis PalpanasSIGMOD 2026 · 被引用 10 次
- HONEYBEE: Efficient Role-based Access Control for Vector Databases via Dynamic PartitioningHongbin Zhong, Matthew Lentz, Nina Narodytska, Adriana Szekeres 等SIGMOD 2026 · 被引用 5 次
- TaCo: Data-adaptive and Query-aware Subspace Collision for High-dimensional Approximate Nearest Neighbor SearchJiuqi Wei, Zhenyu Liao, Ruoyu Han, Quanqing Xu 等SIGMOD 2026
它引用的顶会 Paper20
- Delving into Deep Imbalanced RegressionYuzhe Yang, Kaiwen Zha, Ying-Cong Chen, Hao Wang 等ICML 2021 · 被引用 385 次
- Learning Multi-Dimensional IndexesVikram Nathan, Jialin Ding, Mohammad Alizadeh, Tim KraskaSIGMOD 2020 · 被引用 180 次
- Tsunami: A Learned Multi-dimensional Index for Correlated Data and Skewed WorkloadsJialin Ding, Vikram Nathan, Mohammad Alizadeh, Tim KraskaVLDB 2021 · 被引用 178 次
- TSB-UAD: An End-to-End Benchmark Suite for Univariate Time-Series Anomaly DetectionJohn Paparrizos, Yuhao Kang, Paul Boniol, Ruey S. Tsay 等VLDB 2022 · 被引用 138 次
- Return of the Lernaean Hydra: Experimental Evaluation of Data Series Approximate Similarity SearchKarima Echihabi, Kostas Zoumpatianos, Themis Palpanas, Houda BenbrahimVLDB 2020 · 被引用 99 次
相关 Paper
- LM-Tree: A Hybrid Learned Index for Similarity Search in Metric SpacesYaqi Wang, Bin Wang, Rui Zhu, Wenli Sun 等SIGMOD 2026
- Elpis: Graph-Based Similarity Search for Scalable Data ScienceIlias Azizi, Karima Echihabi, Themis PalpanasVLDB 2023 · 被引用 67 次
- DIDS: Double Indices and Double Summarizations for Fast Similarity SearchHan Hu, Jiye Qiu, Hongzhi Wang, Bin Liang 等VLDB 2024 · 被引用 2 次
- DILI: A Distribution-Driven Learned IndexPengfei Li, Hua Lu, Rong Zhu, Bolin Ding 等VLDB 2023 · 被引用 37 次
- Dumpy: A Compact and Adaptive Index for Large Data Series CollectionsZeyu Wang, Qitong Wang, Peng Wang, Themis Palpanas 等SIGMOD 2023 · 被引用 20 次
