I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models
Zhenxing Mi, Kuan-Chieh Wang, Guocheng Qian, Hanrong Ye, Runtao Liu, Sergey Tulyakov, Kfir Aberman, Dan Xu
摘要
Predict what the next image is: monkey + + cat + (a) Multimodal in-context reasoning generation (b) Multimodal composing "The girl holds a board showing 'Stop copy & paste. Let's Think DIFFERENT.'." + Ground truth reasoning answer: flying zebra + zebra + Figure 1. (a) Our ThinkDiff reasons over interleaved images (a flying monkey and a flying cat) and text prompts (monkey, cat, and zebra) to generate a logically correct and high-quality image (a flying zebra). The ground truth reasoning answer is provided as a reference for readers. (b) ThinkDiff composes images and texts into a coherent and reasonable image.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了最后一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper2
- ReasonEdit: Towards Reasoning-Enhanced Image Editing ModelsFukun Yin, Shiyu Liu, Yucheng Han, Zhibo Wang 等CVPR 2026 · 被引用 25 次
- Unified Thinker: A General Reasoning Core for Image GenerationSashuai Zhou, Qiang Zhou, Jijin Hu, Hanqing Yang 等ACL 2026
它引用的顶会 Paper23
- Language Models are Few-Shot LearnersTom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah 等NeurIPS 2020 · 被引用 64,255 次
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh 等ICML 2021 · 被引用 47,906 次
- Denoising Diffusion Probabilistic ModelsJonathan Ho, Ajay Jain, Pieter AbbeelNeurIPS 2020 · 被引用 35,902 次
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser 等CVPR 2022 · 被引用 13,123 次
- Visual Instruction TuningHaotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae LeeNeurIPS 2023 · 被引用 11,349 次
相关 Paper
- Event-Customized Image GenerationZhen Wang, Yilei Jiang, Dong Zheng, Jun Xiao 等ICML 2025
- Zebra-CoT: A Dataset for Interleaved Vision-Language ReasoningAng Li, Charles L. Wang, Deqing Fu, Kaiyu Yue 等ICLR 2026 · 被引用 85 次
- Canvas-to-Image: Compositional Image Generation with Multimodal ControlsYusuf Dalva, Guocheng Gordon Qian, Maya Goldenberg, Tsai-Shien Chen 等SIGGRAPH 2026
- ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought ReasoningJiawei Gu, Yunzhuo Hao, Huichen Will Wang, Linjie Li 等ICLR 2026 · 被引用 51 次
- Think-Then-Generate: Reasoning-Aware Text-to-Image Diffusion with LLM EncodersSiqi Kou, Jiachun Jin, Zetong Zhou, YE MA 等ICML 2026 · 被引用 13 次
