Zero-Painter: Training-Free Layout Control for Text-to-Image Synthesis
Marianna Ohanyan, Hayk Manukyan, Zhangyang Wang, Shant Navasardyan, Humphrey Shi
摘要
We present Zero-Painter, a novel training-free framework for layout-conditional text-to-image synthesis that facilitates the creation of detailed and controlled imagery from textual prompts. Our method utilizes object masks and individual descriptions, coupled with a global text prompt, to generate images with high fidelity. Zero-Painter employs a two-stage process involving our novel Prompt-Adjusted Cross-Attention (PACA) and Region-Grouped * Equal contribution. Cross-Attention (ReGCA) blocks, ensuring precise alignment of generated objects with textual prompts and mask shapes. Our extensive experiments demonstrate that Zero-Painter surpasses current state-of-the-art methods in preserving textual details and adhering to mask shapes.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper5
- Seg2Any: Open-set Segmentation-Mask-to-Image Generation with Precise Shape and Semantic ControlDanfeng Li, Hui Zhang, Sheng Wang, Jiacheng Li 等NeurIPS 2025 · 被引用 11 次
- InstanceAssemble: Layout-Aware Image Generation via Instance Assembling AttentionQiang Xiang, Shuang Sun, Binglei Li, Dejia Song 等NeurIPS 2025 · 被引用 10 次
- AnyCanvas: Potential Field Guidance for Training-Free Spatial Control in Text-to-Image DiffusionTianyi Xie, Zhiyuan Yu, kaihong huang, Beilun Wang 等ICML 2026
- ClimaOoD: Improving Anomaly Segmentation via Physically Realistic Synthetic DataYuxing Liu, Zheng Li, Huanhuan Liang, Ji Zhang 等CVPR 2026
- SKDream: Controllable Multi-view and 3D Generation with Arbitrary SkeletonsYuanyou Xu, Zongxin Yang, Yi YangCVPR 2025
它引用的顶会 Paper25
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh 等ICML 2021 · 被引用 47,906 次
- Denoising Diffusion Probabilistic ModelsJonathan Ho, Ajay Jain, Pieter AbbeelNeurIPS 2020 · 被引用 35,902 次
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser 等CVPR 2022 · 被引用 13,123 次
- Denoising Diffusion Implicit ModelsJiaming Song, Chenlin Meng, Stefano ErmonICLR 2021 · 被引用 11,743 次
- Photorealistic Text-to-Image Diffusion Models with Deep Language UnderstandingChitwan Saharia, William Chan, Saurabh Saxena, Lala Li 等NeurIPS 2022 · 被引用 8,965 次
相关 Paper
- LoCo: Training-Free Layout-to-Image Synthesis with Localized ConstraintsPeiang Zhao, Han Li, Ruiyang Jin, S. Kevin ZhouACM MM 2025 · 被引用 2 次
- Token Painter: Training-Free Text-Guided Image Inpainting via Mask Autoregressive ModelsLongtao Jiang, Jie Huang, Mingfei Han, Lei Chen 等AAAI 2026
- HD-Painter: High-Resolution and Prompt-Faithful Text-Guided Image Inpainting with Diffusion ModelsHayk Manukyan, Andranik Sargsyan, Barsegh Atanyan, Zhangyang Wang 等ICLR 2025 · 被引用 4 次
- MUSE: Multi-Subject Unified Synthesis Via Explicit Layout Semantic ExpansionFei Peng, Junqiang Wu, Yan Li, Tingting Gao 等ICCV 2025 · 被引用 1 次
- RAGD: Regional-Aware Diffusion Model for Text-to-Image GenerationZhennan Chen, Yajie Li, Haofan Wang, Zhibo Chen 等ICCV 2025 · 被引用 3 次
