InstaDrive: Instance-Aware Driving World Models for Realistic and Consistent Video Generation
Zhuoran Yang, Xi Guo, Chenjing Ding, Chiyu Wang, Wei Wu, Yanyong Zhang
Abstract
Autonomous driving relies on robust models trained on high-quality, large-scale multi-view driving videos. While world models offer a cost-effective solution for generating realistic driving videos, they struggle to maintain instance-level temporal consistency and spatial geometric fidelity. To address these challenges, we propose InstaDrive, a novel framework that enhances driving video realism through two key advancements: (1) Instance Flow Guider, which extracts and propagates instance features across frames to enforce temporal consistency, preserving instance identity over time. (2) Spatial Geometric Aligner, which improves spatial reasoning, ensures precise instance positioning, and explicitly models occlusion hierarchies. By incorporating these instance-aware mechanisms, InstaDrive achieves state-of-the-art video generation quality and enhances downstream autonomous driving tasks on the nuScenes dataset. Additionally, we utilize CARLA's autopilot to procedurally and stochastically simulate rare but safety-critical driving scenarios across diverse maps and regions, enabling rigorous safety evaluation for autonomous systems. Our project page11https://metadrivescape.github.io/papers_project/InstaDrive/page.html.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Cited by top-tier papers3
- MAD: Motion Appearance Decoupling for efficient Driving World ModelsAhmad Rahimi, Valentin Gerard, Eloi Zablocki, Matthieu Cord et al.CVPR 2026 · 7 citations
- MRI Contrast Enhancement Kinetics World ModelJindi Kong, Yuting He, Cong Xia, Rongjun Ge et al.CVPR 2026 · 3 citations
- ConsisDrive: Identity-Preserving Driving World Models for Video Generation by Instance MaskZhuoran Yang, Yanyong ZhangICLR 2026 · 2 citations
Builds on21
- Adding Conditional Control to Text-to-Image Diffusion ModelsLvmin Zhang, Anyi Rao, Maneesh AgrawalaICCV 2023 · 6,759 citations
- Video Diffusion ModelsJonathan Ho, Tim Salimans, Alexey A. Gritsenko, William Chan et al.NeurIPS 2022 · 2,948 citations
- AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific TuningYuwei Guo, Ceyuan Yang, Anyi Rao, Zhengyang Liang et al.ICLR 2024 · 1,493 citations
- VAD: Vectorized Scene Representation for Efficient Autonomous DrivingBo Jiang, Shaoyu Chen, Qing Xu, Bencheng Liao et al.ICCV 2023 · 602 citations
- Exploring Object-Centric Temporal Modeling for Efficient Multi-View 3D Object DetectionShihao Wang, Yingfei Liu, Tiancai Wang, Ying Li et al.ICCV 2023 · 399 citations
Related papers
- Glad: A Streaming Scene Generator for Autonomous DrivingBin Xie, Yingfei Liu, Tiancai Wang, Jiale Cao et al.ICLR 2025
- SMD: Multi-view Safety-Critical Driving Video Generation in the Real-world DomainJiawei Zhou, Linye Lyu, Zhuotao Tian, Cheng Zhuo et al.ICML 2026 · 5 citations
- Autoscape: Geometry-Consistent Long-Horizon Scene GenerationJiacheng Chen, Ziyu Jiang, Mingfu Liang, Bingbing Zhuang et al.ICCV 2025
- Rethinking Driving World Model as Synthetic Data Generator for Perception TasksKai Zeng, Zhanqian Wu, Kaixin Xiong, Xiaobao Wei et al.ICLR 2026 · 14 citations
- DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video GenerationGuosheng Zhao, Xiaofeng Wang, Zheng Zhu, Xinze Chen et al.AAAI 2025 · 31 citations
