Learning Visual Generative Priors without Text
Shuailei Ma, Kecheng Zheng, Ying Wei, Wei Wu, Fan Lu, Yifei Zhang, Chen-Wei Xie, Biao Gong, Jiapeng Zhu, Yujun Shen
2025年份
3顶会引用
摘要
4 Alibaba Group 5 HKUST https://ant-research.github.io/lumos (a) Text-to-Image Generation (b) Novel View Synthesis (c) Image-to-Video Generation Figure 1. Diverse downstream tasks of Lumos including (a) text-to-image generation, (b) novel view synthesis (left: input view, middle: random novel views, right: reconstruction Gaussian) and (c) image-to-video generation.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper3
- Reconstruction Alignment Improves Unified Multimodal ModelsJi Xie, Trevor Darrell, Luke Zettlemoyer, XuDong WangICLR 2026 · 被引用 52 次
- Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-trainingPeng Sun, Jun XIE, Tao LinCVPR 2026 · 被引用 1 次
- Aligned Better, Listen Better for Audio-Visual Large Language ModelsYuxin Guo, Shuailei Ma, Shijie Ma, Xiaoyi Bao 等ICLR 2025
它引用的顶会 Paper23
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh 等ICML 2021 · 被引用 47,906 次
- A Simple Framework for Contrastive Learning of Visual RepresentationsTing Chen, Simon Kornblith, Mohammad Norouzi, Geoffrey E. HintonICML 2020 · 被引用 24,064 次
- Segment AnythingAlexander Kirillov, Eric Mintun, Nikhila Ravi, Hanzi Mao 等ICCV 2023 · 被引用 13,211 次
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser 等CVPR 2022 · 被引用 13,123 次
- Photorealistic Text-to-Image Diffusion Models with Deep Language UnderstandingChitwan Saharia, William Chan, Saurabh Saxena, Lala Li 等NeurIPS 2022 · 被引用 8,965 次
相关 Paper
- Lumos-1: On Autoregressive Video Generation with Discrete Diffusion from a Unified Model PerspectiveHangjie Yuan, Weihua Chen, Jun Cen, Hu Yu 等ICLR 2026 · 被引用 21 次
- MOVIS: Enhancing Multi-Object Novel View Synthesis for Indoor ScenesRuijie Lu, Yixin Chen, Junfeng Ni, Baoxiong Jia 等CVPR 2025
- UniLumos: Fast and Unified Image and Video Relighting with Physics-Plausible FeedbackPengwei Liu, Hangjie Yuan, Bo Dong, Jiazheng Xing 等NeurIPS 2025 · 被引用 10 次
- GEN3C: 3D-Informed World-Consistent Video Generation with Precise Camera ControlXuanchi Ren, Tianchang Shen, Jiahui Huang, Huan Ling 等CVPR 2025
- LumiX: Structured and Coherent Text-to-Intrinsic GenerationXu Han, Biao Zhang, Xiangjun Tang, Xianzhi Li 等CVPR 2026
