Lightspeed Geometric Dataset Distance via Sliced Optimal Transport
Khai Nguyen, Hai Nguyen, Tuan Pham, Nhat Ho
摘要
We introduce sliced optimal transport dataset distance (s-OTDD), a model-agnostic, embeddingagnostic approach for dataset comparison that requires no training, is robust to variations in the number of classes, and can handle disjoint label sets. The core innovation is Moment Transform Projection (MTP), which maps a label, represented as a distribution over features, to a real number. Using MTP, we derive a data point projection that transforms datasets into onedimensional distributions. The s-OTDD is defined as the expected Wasserstein distance between the projected distributions, with respect to random projection parameters. Leveraging the closed form solution of one-dimensional optimal transport, s-OTDD achieves (near-)linear computational complexity in the number of data points and feature dimensions and is independent of the number of classes. With its geometrically meaningful projection, s-OTDD strongly correlates with the optimal transport dataset distance while being more efficient than existing dataset discrepancy measures. Moreover, it correlates well with the performance gap in transfer learning and classification accuracy in data augmentation.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了最后一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper5
- Optimizing Distributional Geometry Alignment with Optimal Transport for Generative Dataset DistillationXiao Cui, Yulei Qin, Wengang Zhou, Hongsheng Li 等NeurIPS 2025 · 被引用 5 次
- Slicing Wasserstein over Wasserstein via Functional Optimal TransportMoritz Piening, Robert BeinertICLR 2026 · 被引用 5 次
- A Novel Sliced Fused Gromov-Wasserstein DistanceMoritz Piening, Robert BeinertAAAI 2026 · 被引用 3 次
- Flowing Datasets with Wasserstein over Wasserstein Gradient FlowsClément Bonet, Christophe Vauthier, Anna KorbaICML 2025
- Geometry-Aware Dataset Condensation for Diffusion Model TrainingXiao Cui, Yulei Qin, Mo Zhu, Wengang Zhou 等ICML 2026
它引用的顶会 Paper17
- Task2Vec: Task Embedding for Meta-LearningAlessandro Achille, Michael Lam, Rahul Tewari, Avinash Ravichandran 等ICCV 2019 · 被引用 359 次
- Geometric Dataset Distances via Optimal TransportDavid Alvarez-Melis, Nicolò FusiNeurIPS 2020 · 被引用 267 次
- Transferability and Hardness of Supervised Classification TasksAnh Tuan Tran, Cuong V. Nguyen, Tal HassnerICCV 2019 · 被引用 201 次
- Continual Learning of a Mixed Sequence of Similar and Dissimilar TasksZixuan Ke, Bing Liu, Xingchang HuangNeurIPS 2020 · 被引用 173 次
- Statistical and Topological Properties of Sliced Probability DivergencesKimia Nadjahi, Alain Durmus, Lénaïc Chizat, Soheil Kolouri 等NeurIPS 2020 · 被引用 115 次
相关 Paper
- Run-Sort-ReRun: Escaping Batch Size Limitations in Sliced Wasserstein Generative ModelsJosé Lezama, Wei Chen, Qiang QiuICML 2021 · 被引用 9 次
- Distribution Regression with Sliced Wasserstein KernelsDimitri Meunier, Massimiliano Pontil, Carlo CilibertoICML 2022 · 被引用 24 次
- Point-set Distances for Learning Representations of 3D Point CloudsTrung Nguyen, Quang-Hieu Pham, Tam Le, Tung Pham 等ICCV 2021 · 被引用 89 次
- Dataset Distillation via the Wasserstein MetricHaoyang Liu, Yijiang Li, Tiancheng Xing, Peiran Wang 等ICCV 2025 · 被引用 39 次
- Fast Optimal Transport through Sliced Generalized Wasserstein GeodesicsGuillaume Mahey, Laetitia Chapel, Gilles Gasso, Clément Bonet 等NeurIPS 2023 · 被引用 18 次
