Mask3D: Pretraining 2D Vision Transformers by Learning Masked 3D Priors
Ji Hou, Xiaoliang Dai, Zijian He, Angela Dai, Matthias Nießner
2023年份
7顶会引用
摘要
Figure 1. We present Mask3D, which learns to embed 3D priors to 2D representations for image understanding tasks, based on a selfsupervised pre-training formulation from single RGB-D views, without requiring any camera pose or multi-view correspondence information. Our pre-training takes masked RGB and depth patches as input to reconstruct the dense depth map, and the pre-trained color backbone is used to fine-tune various downstream image understanding tasks. This results in effective ViT pre-training for a variety of downstream tasks and datasets.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper7
- UnScene3D: Unsupervised 3D Instance Segmentation for Indoor ScenesDávid Rozenberszki, Or Litany, Angela DaiCVPR 2024 · 被引用 25 次
- Multi-View Representation is What You Need for Point-Cloud Pre-TrainingSiming Yan, Chen Song, Youkang Kong, Qixing HuangICLR 2024 · 被引用 6 次
- Unsupervised Semantic Segmentation Through Depth-Guided Feature Correlation and SamplingLeon Sick, Dominik Engel, Pedro Hermosilla, Timo RopinskiCVPR 2024 · 被引用 6 次
- A Mixed Diet Makes DINO An Omnivorous Vision EncoderRishabh Kabra, Maks Ovsjanikov, Drew A. Hudson, Ye Xia 等CVPR 2026 · 被引用 3 次
- CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular FusionShoubin Yu, Jaehong Yoon, Mohit BansalICLR 2025
它引用的顶会 Paper20
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh 等ICML 2021 · 被引用 47,906 次
- Swin Transformer: Hierarchical Vision Transformer using Shifted WindowsZe Liu, Yutong Lin, Yue Cao, Han Hu 等ICCV 2021 · 被引用 31,683 次
- An Image is Worth 16x16 Words: Transformers for Image Recognition at ScaleAlexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn 等ICLR 2021 · 被引用 21,477 次
- Emerging Properties in Self-Supervised Vision TransformersMathilde Caron, Hugo Touvron, Ishan Misra, Hervé Jégou 等ICCV 2021 · 被引用 8,921 次
- KPConv: Flexible and Deformable Convolution for Point CloudsHugues Thomas, Charles R. Qi, Jean-Emmanuel Deschaud, Beatriz Marcotegui 等ICCV 2019 · 被引用 3,193 次
相关 Paper
- CroCo: Self-Supervised Pre-training for 3D Vision Tasks by Cross-View CompletionPhilippe Weinzaepfel, Vincent Leroy, Thomas Lucas, Romain Brégier 等NeurIPS 2022 · 被引用 189 次
- Cross-View and Cross-Pose Completion for 3D Human UnderstandingMatthieu Armando, Salma Galaaoui, Fabien Baradel, Thomas Lucas 等CVPR 2024
- E-RayZer: Self-supervised 3D Reconstruction as Spatial Visual Pre-trainingQitao Zhao, Hao Tan, Qianqian Wang, Sai Bi 等CVPR 2026 · 被引用 24 次
- GLID: Pre-training a Generalist Encoder-Decoder Vision ModelJihao Liu, Jinliang Zheng, Yu Liu, Hongsheng LiCVPR 2024 · 被引用 5 次
- Semantically-Guided Representation Learning for Self-Supervised Monocular DepthVitor Guizilini, Rui Hou, Jie Li, Rares Ambrus 等ICLR 2020 · 被引用 264 次
