DeepSketch: A New Machine Learning-Based Reference Search Technique for Post-Deduplication Delta Compression
Jisung Park, Jeonggyun Kim, Yeseong Kim, Sungjin Lee, Onur Mutlu
摘要
Data reduction in storage systems is becoming increasingly important as an effective solution to minimize the management cost of a data center. To maximize data-reduction efficiency, existing post-deduplication delta-compression techniques perform delta compression along with traditional data deduplication and lossless compression. Unfortunately, we observe that existing techniques achieve significantly lower data-reduction ratios than the optimal due to their limited accuracy in identifying similar data blocks. In this paper, we propose DeepSketch, a new reference search technique for post-deduplication delta compression that leverages the learning-to-hash method to achieve higher accuracy in reference search for delta compression, thereby improving data-reduction efficiency. DeepSketch uses a deep neural network to extract a data block's sketch, i.e., to create an approximate data signature of the block that can preserve similarity with other blocks. Our evaluation using eleven real-world workloads shows that DeepSketch improves the data-reduction ratio by up to 33% (21% on average) over a state-of-the-art post-deduplication delta-compression technique.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper5
- LoopDelta: Embedding Locality-aware Opportunistic Delta Compression in Inline Deduplication for Highly Efficient Data ReductionYucheng Zhang, Hong Jiang, Dan Feng, Nan Jiang 等USENIX ATC 2023 · 被引用 13 次
- SimEnc: A High-Performance Similarity-Preserving Encryption Approach for Deduplication of Encrypted Docker ImagesTong Sun, Bowen Jiang, Borui Li, Jiamei Lv 等USENIX ATC 2024 · 被引用 10 次
- Heimdall: Optimizing Storage I/O Admission with Extensive Machine Learning PipelineDaniar Heri Kurniawan, Rani Ayu Putri, Peiran Qin, Kahfi S. Zulkifli 等EuroSys 2025 · 被引用 3 次
- ShieldReduce: Fine-Grained Shielded Data ReductionJingyuan Yang, Jun Wu, Ruilin Wu, Jingwei Li 等USENIX ATC 2025 · 被引用 3 次
- MedFS: Pursuing Low Update Overhead via Metadata-Enabled Delta Compression for Log-structured File System on Mobile DeviceChao Wu, Cheng Ji, Li-Pin Chang, Zongwei Zhu 等FAST 2025
它引用的顶会 Paper4
- High-Fidelity Generative Image CompressionFabian Mentzer, George Toderici, Michael Tschannen, Eirikur AgustssonNeurIPS 2020 · 被引用 675 次
- Generative Adversarial Networks for Extreme Learned Image CompressionEirikur Agustsson, Michael Tschannen, Fabian Mentzer, Radu Timofte 等ICCV 2019 · 被引用 648 次
- Pythia: A Customizable Hardware Prefetching Framework Using Online Reinforcement LearningRahul Bera, Konstantinos Kanellopoulos, Anant Nori, Taha Shahroodi 等MICRO 2021 · 被引用 95 次
- Bio-Inspired Hashing for Unsupervised Similarity SearchChaitanya K. Ryali, John J. Hopfield, Leopold Grinberg, Dmitry KrotovICML 2020 · 被引用 32 次
相关 Paper
- Odess: Speeding up Resemblance Detection for Redundancy Elimination by Fast Content-Defined SamplingXiangyu Zou, Cai Deng, Wen Xia, Philip Shilane 等ICDE 2021 · 被引用 26 次
- SK-Gradient: Efficient Communication for Distributed Machine Learning with Data SketchJie Gui, Yuchen Song, Zezhou Wang, Chenhong He 等ICDE 2023 · 被引用 9 次
- Palantir: Hierarchical Similarity Detection for Post-Deduplication Delta CompressionHongming Huang, Peng Wang, Qiang Su, Hong Xu 等ASPLOS 2024 · 被引用 9 次
- imDedup: A Lossless Deduplication Scheme to Eliminate Fine-grained Redundancy among ImagesCai Deng, Qi Chen, Xiangyu Zou, Erci Xu 等ICDE 2022 · 被引用 16 次
- Once Rolling Hashing is Enough: Exploiting Rolling Hash Reuse in Delta CompressionHaoliang Tan, Wenhao Ou, Xiangyu Zou, Cai Deng 等EuroSys 2026 · 被引用 1 次
