Improving Compositional Generation with Diffusion Models Using Lift Scores
Chenning Yu, Sicun Gao
摘要
We introduce a novel resampling criterion using lift scores, for improving compositional generation in diffusion models. By leveraging the lift scores, we evaluate whether generated samples align with each single condition and then compose the results to determine whether the composed prompt is satisfied. Our key insight is that lift scores can be efficiently approximated using only the original diffusion model, requiring no additional training or external modules. We develop an optimized variant that achieves relatively lower computational overhead during inference while maintaining effectiveness.
Through extensive experiments, we demonstrate that lift scores significantly improved the condition alignment for compositional generation across 2D synthetic data, CLEVR position tasks, and text-to-image synthesis. Our code is available at rainorangelemon.github.io/complift.
Recent studies have revealed significant limitations in diffusion models (Dhariwal & Nichol, 2021) for handling compositional generation, particularly as missing objects, incorrect spatial relationships, and attribute inconsistencies (Huang
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper21
- Denoising Diffusion Probabilistic ModelsJonathan Ho, Ajay Jain, Pieter AbbeelNeurIPS 2020 · 被引用 35,902 次
- Diffusion Models Beat GANs on Image SynthesisPrafulla Dhariwal, Alexander Quinn NicholNeurIPS 2021 · 被引用 13,211 次
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser 等CVPR 2022 · 被引用 13,123 次
- Improved Denoising Diffusion Probabilistic ModelsAlexander Quinn Nichol, Prafulla DhariwalICML 2021 · 被引用 5,234 次
- SDXL: Improving Latent Diffusion Models for High-Resolution Image SynthesisDustin Podell, Zion English, Kyle Lacey, Andreas Blattmann 等ICLR 2024 · 被引用 4,569 次
相关 Paper
- DreamComposer: Controllable 3D Object Generation via Multi-View ConditionsYunhan Yang, Yukun Huang, Xiaoyang Wu, Yuan-Chen Guo 等CVPR 2024 · 被引用 3 次
- Divide, Evaluate, and Refine: Evaluating and Improving Text-to-Image Alignment with Iterative VQA FeedbackJaskirat Singh, Liang ZhengNeurIPS 2023 · 被引用 48 次
- VSC: Visual Search Compositional Text-to-Image Diffusion ModelDo Huu Dat, Nam Hyeon-Woo, Po Yuan Mao, Tae-Hyun OhICCV 2025 · 被引用 1 次
- Separate-and-Enhance: Compositional Finetuning for Text-to-Image Diffusion ModelsZhipeng Bao, Yijun Li, Krishna Kumar Singh, Yu-Xiong Wang 等SIGGRAPH 2024 · 被引用 6 次
- CAS: A Probability-Based Approach for Universal Condition Alignment ScoreChunsan Hong, Byunghee Cha, Tae-Hyun OhICLR 2024 · 被引用 3 次
