MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation
Zehuan Huang, Yuan-Chen Guo, Xingqiao An, Yunhan Yang, Yangguang Li, Zi-Xin Zou, Ding Liang, Xihui Liu, Yan-Pei Cao, Lu Sheng
摘要
Total3D InstPIFu SSR DiffCAD Gen3DSR REPARO Ours (a) Scene generation (b) Generalization Synthetic Data Real-world Image Stylized Image Figure 1. MIDI generates compositional 3D scenes from a single image by extending pre-trained image-to-3D object generation models to multi-instance diffusion models, incorporating a novel multi-instance attention mechanism that captures inter-object interactions. (a) shows our generated scenes compared with those reconstructed by existing methods. (b) presents our generated results on synthetic data, real-world images, and stylized images.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了最后一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper8
- CAST: Component-Aligned 3D Scene Reconstruction from an RGB ImageKaixin Yao, Longwen Zhang, Xinhao Yan, Yan Zeng 等SIGGRAPH 2025 · 被引用 30 次
- WorldGen: From Text to Traversable and Interactive 3D WorldsDilin Wang, Hyunyoung Jung, Tom Monnier, Kihyuk Sohn 等CVPR 2026 · 被引用 24 次
- ArtLLM: Generating Articulated Assets via 3D LLMPenghao Wang, Siyuan Xie, Hongyu Yan, Xianghui Yang 等CVPR 2026 · 被引用 7 次
- M3DLayout: A Multi-Source Dataset of 3D Indoor Layouts and Structured Descriptions for 3D GenerationYiheng Zhang, Zhuojiang Cai, Mingdao Wang, Meitong Guo 等CVPR 2026 · 被引用 5 次
- JRM: Joint Reconstruction Model for Multiple Objects without AlignmentQirui Wu, Mohd Yawar Nihal Siddiqui, Duncan Frost, Samir Aroudj 等CVPR 2026 · 被引用 2 次
它引用的顶会 Paper44
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh 等ICML 2021 · 被引用 47,906 次
- Denoising Diffusion Probabilistic ModelsJonathan Ho, Ajay Jain, Pieter AbbeelNeurIPS 2020 · 被引用 35,902 次
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser 等CVPR 2022 · 被引用 13,123 次
- Denoising Diffusion Implicit ModelsJiaming Song, Chenlin Meng, Stefano ErmonICLR 2021 · 被引用 11,743 次
- Photorealistic Text-to-Image Diffusion Models with Deep Language UnderstandingChitwan Saharia, William Chan, Saurabh Saxena, Lala Li 等NeurIPS 2022 · 被引用 8,965 次
相关 Paper
- REPARO: Compositional 3D Assets Generation with Differentiable 3D Layout AlignmentHaonan Han, Rui Yang, Huan Liao, Jiankai Xing 等ICCV 2025 · 被引用 4 次
- Muses: 3D-Controllable Image Generation via Multi-Modal Agent CollaborationYanbo Ding, Shaobin Zhuang, Kunchang Li, Zhengrong Yue 等AAAI 2025 · 被引用 8 次
- DepR: Depth Guided Single-View Scene Reconstruction with Instance-Level DiffusionQingcheng Zhao, Xiang Zhang, Haiyang Xu, Zeyuan Chen 等ICCV 2025 · 被引用 3 次
- Category-Aware 3D Object Composition with Disentangled Texture and Shape Multi-view DiffusionZeren Xiong, Zikun Chen, Zedong Zhang, Xiang Li 等ACM MM 2025 · 被引用 2 次
- PartCrafter: Structured 3D Mesh Generation via Compositional Latent Diffusion TransformersYuchen Lin, Chenguo Lin, Panwang Pan, Honglei Yan 等NeurIPS 2025 · 被引用 89 次
