IRISformer: Dense Vision Transformers for Single-Image Inverse Rendering in Indoor Scenes
Rui Zhu, Zhengqin Li, Janarbek Matai, Fatih Porikli, Manmohan Chandraker
摘要
Indoor scenes exhibit significant appearance variations due to myriad interactions between arbitrarily diverse object shapes, spatially-changing materials, and complex lighting. Shadows, highlights, and inter-reflections caused by visible and invisible light sources require reasoning about long-range interactions for inverse rendering, which seeks to recover the components of image formation, namely, shape, material, and lighting. In this work, our intuition is that the long-range attention learned by transformer architectures is ideally suited to solve longstanding challenges in single-image inverse rendering. We demonstrate with a specific instantiation of a dense vision transformer, , that excels at both single-task and multi-task reasoning required for inverse rendering. Specifically, we propose a transformer architecture to simultaneously estimate depths, normals, spatially-varying albedo, roughness and lighting from a single image of an indoor scene. Our extensive evaluations on benchmark datasets demonstrate state-of-the-art results on each of the above tasks, enabling applications like object insertion and material editing in a single unconstrained real image, with greater photorealism than prior works. Code and data are publicly released at https://github.com/ViLab-UCSD/IRISformer
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了最后一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper30
- IntrinsicNeRF: Learning Intrinsic Neural Radiance Fields for Editable Novel View SynthesisWeicai Ye, Shuo Chen, Chong Bao, Hujun Bao 等ICCV 2023 · 被引用 60 次
- EverLight: Indoor-Outdoor Editable HDR Lighting EstimationMohammad Reza Karimi Dastjerdi, Jonathan Eisenmann, Yannick Hold-Geoffroy, Jean-François LalondeICCV 2023 · 被引用 41 次
- Factorized Inverse Path Tracing for Efficient and Accurate Material-Lighting EstimationLiwen Wu, Rui Zhu, Mustafa B. Yaldiz, Yinhao Zhu 等ICCV 2023 · 被引用 27 次
- MatSynth: A Modern PBR Materials DatasetGiuseppe Vecchio, Valentin DeschaintreCVPR 2024 · 被引用 24 次
- Intrinsic Image Fusion for Multi-View 3D Material ReconstructionPeter Kocsis, Lukas Höllein, Matthias NießnerCVPR 2026 · 被引用 8 次
它引用的顶会 Paper12
- Swin Transformer: Hierarchical Vision Transformer using Shifted WindowsZe Liu, Yutong Lin, Yue Cao, Han Hu 等ICCV 2021 · 被引用 31,683 次
- An Image is Worth 16x16 Words: Transformers for Image Recognition at ScaleAlexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn 等ICLR 2021 · 被引用 21,477 次
- Pyramid Vision Transformer: A Versatile Backbone for Dense Prediction without ConvolutionsWenhai Wang, Enze Xie, Xiang Li, Deng-Ping Fan 等ICCV 2021 · 被引用 4,909 次
- Vision Transformers for Dense PredictionRené Ranftl, Alexey Bochkovskiy, Vladlen KoltunICCV 2021 · 被引用 2,647 次
- Tokens-to-Token ViT: Training Vision Transformers from Scratch on ImageNetLi Yuan, Yunpeng Chen, Tao Wang, Weihao Yu 等ICCV 2021 · 被引用 2,462 次
相关 Paper
- Neural Inverse Rendering of an Indoor Scene From a Single ImageSoumyadip Sengupta, Jinwei Gu, Kihwan Kim, Guilin Liu 等ICCV 2019 · 被引用 172 次
- Learning Indoor Inverse Rendering with 3D Spatially-Varying LightingZian Wang, Jonah Philion, Sanja Fidler, Jan KautzICCV 2021 · 被引用 109 次
- IRIS: Inverse Rendering of Indoor Scenes from Low Dynamic Range ImagesChih-Hao Lin, Jia-Bin Huang, Zhengqin Li, Zhao Dong 等CVPR 2025
- Inverse Rendering for Complex Indoor Scenes: Shape, Spatially-Varying Lighting and SVBRDF From a Single ImageZhengqin Li, Mohammad Shafiei, Ravi Ramamoorthi, Kalyan Sunkavalli 等CVPR 2020
- MAIR: Multi-View Attention Inverse Rendering with 3D Spatially-Varying Lighting EstimationJunyong Choi, SeokYeong Lee, Haesol Park, Seung-Won Jung 等CVPR 2023
