ScoreMix: Synthetic Data Generation by Score Composition in Diffusion Models Improves Recognition
Parsa Rahimi, Sébastien Marcel
Abstract
Synthetic data generation is increasingly used in machine learning for training and data augmentation. Yet, current strategies often rely on external foundation models or datasets, whose usage is restricted in many scenarios due to policy or legal constraints. We propose ScoreMix, a self-contained synthetic generation method to produce hard synthetic samples for recognition tasks by leveraging the score compositionality of diffusion models. The approach mixes class-conditioned scores along reverse diffusion trajectories, yielding domain-specific data augmentation without external resources. We systematically study class-selection strategies and find that mixing classes distant in the discriminator's embedding space yields larger gains, providing up to 3% additional average improvement, compared to selection based on proximity. Interestingly, we observe that condition and embedding spaces are largely uncorrelated under standard alignment metrics, and the generator's condition space has a negligible effect on downstream performance. Across 8 public face recognition benchmarks, ScoreMix improves accuracy by up to 7 percentage points, without hyperparameter search, highlighting both robustness and practicality. Our method provides a simple yet effective way to maximize discriminator performance using only the available dataset, without reliance on third-party resources. Paper website: https://parsa-ra.github.io/scoremix/ .
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext e860c3fc-8d04-43de-9729-cad743068b67Builds on12
- Denoising Diffusion Implicit ModelsJiaming Song, Chenlin Meng, Stefano ErmonICLR 2021 · 11,743 citations
- Elucidating the Design Space of Diffusion-Based Generative ModelsTero Karras, Miika Aittala, Timo Aila, Samuli LaineNeurIPS 2022 · 3,959 citations
- Scaling Rectified Flow Transformers for High-Resolution Image SynthesisPatrick Esser, Sumith Kulal, Andreas Blattmann, Rahim Entezari et al.ICML 2024 · 3,620 citations
- Guiding a Diffusion Model with a Bad Version of ItselfTero Karras, Miika Aittala, Tuomas Kynkäänniemi, Jaakko Lehtinen et al.NeurIPS 2024 · 338 citations
- Fake it till you make it: face analysis in the wild using synthetic data aloneErroll Wood, Tadas Baltrusaitis, Charlie Hewitt, Sebastian Dziadzio et al.ICCV 2021 · 331 citations
Related papers
- AugGen: Synthetic Augmentation using Diffusion Models Can Improve RecognitionParsa Rahimi, Damien Teney, Sébastien MarcelNeurIPS 2025 · 4 citations
- IDiff-Face: Synthetic-based Face Recognition through Fizzy Identity-Conditioned Diffusion ModelsFadi Boutros, Jonas Henry Grebe, Arjan Kuijper, Naser DamerICCV 2023 · 106 citations
- IDperturb: Enhancing Variation in Synthetic Face Generation via Angular PerturbationsFadi Boutros, Eduarda Caldeira, Tahar Chettaoui, Naser DamerCVPR 2026
- CemiFace: Center-based Semi-hard Synthetic Face Generation for Face RecognitionZhonglin Sun, Siyang Song, Ioannis Patras, Georgios TzimiropoulosNeurIPS 2024 · 17 citations
- DCFace: Synthetic Face Generation with Dual Condition Diffusion ModelMinchul Kim, Feng Liu, Anil K. Jain, Xiaoming LiuCVPR 2023
