UniMLVG: Unified Framework for Multi-View Long Video Generation with Comprehensive Control Capabilities for Autonomous Driving
Rui Chen, Zehuan Wu, Yichen Liu, Yuxin Guo, Jingcheng Ni, Haifeng Xia, Siyu Xia
Abstract
The creation of diverse and realistic driving scenarios has become essential to enhance perception and planning capabilities of the autonomous driving system. However, generating long-duration, surround-view consistent driving videos remains a significant challenge. To address this, we present UniMLVG, a unified framework designed to generate extended street multi-perspective videos under precise control. By integrating single- and multi-view driving videos into the training data, our approach updates a DiT-based diffusion model equipped with cross-frame and cross-view modules across three stages with multi training objectives, substantially boosting the diversity and quality of generated visual content. Importantly, we propose an innovative explicit viewpoint modeling approach for multi-view video generation to effectively improve motion transition consistency. Capable of handling various input reference formats (e.g., text, images, or video), our UniMLVG generates high-quality multi-view videos according to the corresponding condition constraints such as 3D bounding boxes or frame-level text descriptions. Compared to the best models with similar capabilities, our framework achieves improvements of 48.2% in FID and 35.2% in FVD.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 5bb4d380-c9f8-4276-8b5b-5f52d7f3fdb4Cited by top-tier papers8
- X-Scene: Large-Scale Driving Scene Generation with High Fidelity and Flexible ControllabilityYu Yang, Alan Liang, Jianbiao Mei, Yukai Ma et al.NeurIPS 2025 · 22 citations
- WorldSplat: Gaussian-Centric Feed-Forward 4D Scene Generation for Autonomous DrivingZiyue Zhu, Zhanqian Wu, Zhenxin Zhu, Lijun Zhou et al.ICLR 2026 · 11 citations
- Spatial Retrieval Augmented Autonomous DrivingXiaosong Jia, Chenhe Zhang, Yule Jiang, Songbur Wong et al.CVPR 2026 · 6 citations
- SMD: Multi-view Safety-Critical Driving Video Generation in the Real-world DomainJiawei Zhou, Linye Lyu, Zhuotao Tian, Cheng Zhuo et al.ICML 2026 · 5 citations
- RAYNOVA: Scale-Temporal Autoregressive World Modeling in Ray SpaceYichen Xie, Chensheng Peng, Mazen Abdelfattah, Yihan Hu et al.CVPR 2026 · 5 citations
Builds on31
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh et al.ICML 2021 · 47,906 citations
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser et al.CVPR 2022 · 13,123 citations
- Adding Conditional Control to Text-to-Image Diffusion ModelsLvmin Zhang, Anyi Rao, Maneesh AgrawalaICCV 2023 · 6,759 citations
- Scaling Rectified Flow Transformers for High-Resolution Image SynthesisPatrick Esser, Sumith Kulal, Andreas Blattmann, Rahim Entezari et al.ICML 2024 · 3,620 citations
- Video Diffusion ModelsJonathan Ho, Tim Salimans, Alexey A. Gritsenko, William Chan et al.NeurIPS 2022 · 2,948 citations
Related papers
- DriveScape: High-Resolution Driving Video Generation by Multi-View Feature FusionWei Wu, Xi Guo, Weixuan Tang, Tingxuan Huang et al.CVPR 2025
- UniVideo: Unified Understanding, Generation, and Editing for VideosCong Wei, Quande Liu, Zixuan Ye, Qiulin Wang et al.ICLR 2026 · 90 citations
- DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video GenerationGuosheng Zhao, Xiaofeng Wang, Zheng Zhu, Xinze Chen et al.AAAI 2025 · 31 citations
- Reangle-A-Video: 4D Video Generation as Video-to-Video TranslationHyeonho Jeong, Suhyeon Lee, Jong Chul YeICCV 2025 · 3 citations
- UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion PriorsHouyuan Chen, Hong Li, Xianghao Kong, Tianrui Zhu et al.SIGGRAPH 2026
