Enhancing Compositional Text-to-Image Generation with Reliable Random Seeds
Shuangqi Li, Hieu Le, Jingyi Xu, Mathieu Salzmann
2025年份
9顶会引用
摘要
Four unicorns " " Two dogs " " A dove on top of a basketball " " A penguin on the right of a bowl " Stable Diffusion Ours Figure 1: Example images generated by Stable Diffusion 2.1 and ours. Existing text-to-image diffusion models are prone to making mistakes at numeracy and spatial relations.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper9
- PosterCraft: Rethinking High-Quality Aesthetic Poster Generation in a Unified FrameworkSixiang Chen, Jianyu Lai, Jialin Gao, Tian Ye 等ICLR 2026 · 被引用 43 次
- Noise Matters: Optimizing Matching Noise for Diffusion ClassifiersYanghao Wang, Long ChenNeurIPS 2025 · 被引用 7 次
- Seeds of Structure: Patch PCA Reveals Universal Compositional Cues in Diffusion ModelsQingsong Wang, Zhengchao Wan, Misha Belkin, Yusu WangNeurIPS 2025 · 被引用 5 次
- When Memory Becomes a Vulnerability: Towards Multi-turn Jailbreak Attacks against Text-to-Image Generation SystemsShiqian Zhao, Jiayang Liu, Yiming Li, Runyi Hu 等USENIX Security 2026 · 被引用 4 次
- GenTune: Toward Traceable Prompts to Improve Controllability of Image Refinement in Environment DesignWen-Fan Wang, Ting-Ying Lee, Chien-Ting Lu, Che-Wei Hsu 等UIST 2025 · 被引用 4 次
它引用的顶会 Paper19
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh 等ICML 2021 · 被引用 47,906 次
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser 等CVPR 2022 · 被引用 13,123 次
- Photorealistic Text-to-Image Diffusion Models with Deep Language UnderstandingChitwan Saharia, William Chan, Saurabh Saxena, Lala Li 等NeurIPS 2022 · 被引用 8,965 次
- SDXL: Improving Latent Diffusion Models for High-Resolution Image SynthesisDustin Podell, Zion English, Kyle Lacey, Andreas Blattmann 等ICLR 2024 · 被引用 4,569 次
- CogVLM: Visual Expert for Pretrained Language ModelsWeihan Wang, Qingsong Lv, Wenmeng Yu, Wenyi Hong 等NeurIPS 2024 · 被引用 858 次
相关 Paper
- VerbDiff: Text-Only Diffusion Models with Enhanced Interaction AwarenessSeungJu Cha, Kwanyoung Lee, Ye-Chan Kim, Hyunwoo Oh 等CVPR 2025
- Attend-and-Excite: Attention-Based Semantic Guidance for Text-to-Image Diffusion ModelsHila Chefer, Yuval Alaluf, Yael Vinker, Lior Wolf 等SIGGRAPH 2023 · 被引用 438 次
- Diffusion Art or Digital Forgery? Investigating Data Replication in Diffusion ModelsGowthami Somepalli, Vasu Singla, Micah Goldblum, Jonas Geiping 等CVPR 2023
- A Tale of Two Features: Stable Diffusion Complements DINO for Zero-Shot Semantic CorrespondenceJunyi Zhang, Charles Herrmann, Junhwa Hur, Luisa Polania Cabrera 等NeurIPS 2023 · 被引用 371 次
- SketchFusion: Learning Universal Sketch Features through Fusing Foundation ModelsSubhadeep Koley, Tapas Kumar Dutta, Aneeshan Sain, Pinaki Nath Chowdhury 等CVPR 2025
