Baking Gaussian Splatting Into Diffusion Denoiser for Fast and Scalable Single-Stage Image-to-3D Generation and Reconstruction
Yuanhao Cai, He Zhang, Kai Zhang, Yixun Liang, Mengwei Ren, Fujun Luan, Qing Liu, Soo Ye Kim, Jianming Zhang, Zhifei Zhang, Yuqian Zhou, Yulun Zhang
摘要
Existing feedforward image-to-3D methods mainly rely on 2D multi-view diffusion models that cannot guarantee 3D consistency. These methods easily collapse when changing the prompt view direction and mainly handle object-centric cases. In this paper, we propose a novel single-stage 3D diffusion model, DiffusionGS, for object generation and scene reconstruction from a single view. DiffusionGS directly outputs 3D Gaussian point clouds at each timestep to enforce view consistency and allow the model to generate robustly given prompt views of any directions, beyond object-centric inputs. Plus, to improve the capability and generality of DiffusionGS, we scale up 3D training data by developing a scene-object mixed training strategy. Experiments show that DiffusionGS yields improvements of 2.20 dB/23.25 and 1.34 dB/19.16 in PSNR/FID for objects and scenes than the state-of-the-art methods, without depth estimator. Plus, our method enjoys over faster speed ( on an A100 GPU). Project page: https://caiyuanhao1998.github.io/project/DiffusionGS/
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper5
- Walking the Schrödinger Bridge: A Direct Trajectory for Text-to-3D GenerationZiying Li, Xuequan Lu, Xinkui Zhao, Guanjie Cheng 等NeurIPS 2025 · 被引用 4 次
- S2D: Sparse to Dense Lifting for 3D Reconstruction with Minimal InputsYuzhou Ji, Qijian Tian, He Zhu, Xiaoqi Jiang 等CVPR 2026 · 被引用 1 次
- Learning Hierarchical Hyperbolic Mixture Model for Part-aware 3D GenerationQitong Yang, Mingtao Feng, Zijie Wu, Huixin Zhu 等CVPR 2026
- Captain Safari: A World Engine with Pose-Aligned 3D MemoryYu-Cheng Chou, Xingrui Wang, Yitong Li, Jiahao Wang 等CVPR 2026
- CoverPruneGS: Coverage-Preserving Structured Pruning for Hierarchical 3D Gaussian Splatting from Sparse-View Monocular VideosYang Xiao, Guoan Xu, Guxue Gao, Qiang Wu 等ICML 2026
它引用的顶会 Paper52
- Denoising Diffusion Probabilistic ModelsJonathan Ho, Ajay Jain, Pieter AbbeelNeurIPS 2020 · 被引用 35,902 次
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser 等CVPR 2022 · 被引用 13,123 次
- Denoising Diffusion Implicit ModelsJiaming Song, Chenlin Meng, Stefano ErmonICLR 2021 · 被引用 11,743 次
- 3D Gaussian Splatting for Real-Time Radiance Field RenderingBernhard Kerbl, Georgios Kopanas, Thomas Leimkühler, George DrettakisSIGGRAPH 2023 · 被引用 5,687 次
- Scalable Diffusion Models with TransformersWilliam Peebles, Saining XieICCV 2023 · 被引用 5,568 次
相关 Paper
- Vistadream: Sampling Multiview Consistent Images for Single-View Scene ReconstructionHaiping Wang, Yuan Liu, Ziwei Liu, Wenping Wang 等ICCV 2025 · 被引用 8 次
- RenderDiffusion: Image Diffusion for 3D Reconstruction, Inpainting and GenerationTitas Anciukevicius, Zexiang Xu, Matthew Fisher, Paul Henderson 等CVPR 2023
- Triplane Meets Gaussian Splatting: Fast and Generalizable Single-View 3D Reconstruction with TransformersZi-Xin Zou, Zhipeng Yu, Yuan-Chen Guo, Yangguang Li 等CVPR 2024 · 被引用 119 次
- Generative Gaussian Splatting: Generating 3D Scenes with Video Diffusion PriorsKatja Schwarz, Norman Müller, Peter KontschiederICCV 2025 · 被引用 3 次
- Wonderland: Navigating 3D Scenes from a Single ImageHanwen Liang, Junli Cao, Vidit Goel, Guocheng Qian 等CVPR 2025
