Merge3D: Efficient 3D Multimodal LLMs via Joint 2D-3D Token Merging
Tianbo Pan, Xingyi Yang, Xinchao Wang
2026年份
摘要
marks such as Scan2Cap, CV-Bench, and BLINK. Our code and checkpoints can be found at the project website https://tianbo-pan.github.io/merge3d/.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper53
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh 等ICML 2021 · 被引用 47,906 次
- Sigmoid Loss for Language Image Pre-TrainingXiaohua Zhai, Basil Mustafa, Alexander Kolesnikov, Lucas BeyerICCV 2023 · 被引用 2,932 次
- Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMsPeter Tong, Ellis Brown, Penghao Wu, Sanghyun Woo 等NeurIPS 2024 · 被引用 1,004 次
- 3D-LLM: Injecting the 3D World into Large Language ModelsYining Hong, Haoyu Zhen, Peihao Chen, Shuhong Zheng 等NeurIPS 2023 · 被引用 662 次
- An Embodied Generalist Agent in 3D WorldJiangyong Huang, Silong Yong, Xiaojian Ma, Xiongkun Linghu 等ICML 2024 · 被引用 361 次
相关 Paper
- Semantic Scene Completion via Integrating Instances and Scene In-the-LoopYingjie Cai, Xuesong Chen, Chao Zhang, Kwan-Yee Lin 等CVPR 2021
- Scene4U: Hierarchical Layered 3D Scene Reconstruction from Single Panoramic Image for Your Immerse ExplorationZilong Huang, Jun He, Junyan Ye, Lihan Jiang 等CVPR 2025
- Free360: Layered Gaussian Splatting for Unbounded 360-Degree View Synthesis from Extremely Sparse and Unposed ViewsChong Bao, Xiyu Zhang, Zehao Yu, Jiale Shi 等CVPR 2025
- GaVS: 3D-Grounded Video Stabilization via Temporally-Consistent Local Reconstruction and RenderingZinuo You, Stamatios Georgoulis, Anpei Chen, Siyu Tang 等SIGGRAPH 2025 · 被引用 3 次
- PanSplat: 4K Panorama Synthesis with Feed-Forward Gaussian SplattingCheng Zhang, Haofei Xu, Qianyi Wu, Camilo Cruz Gambardella 等CVPR 2025
