SubjectDrive: Scaling Generative Data in Autonomous Driving via Subject Control
Binyuan Huang, Yuqing Wen, Yucheng Zhao, Yaosi Hu, Yingfei Liu, Fan Jia, Weixin Mao, Tiancai Wang, Chi Zhang, Chang Wen Chen, Zhenzhong Chen, Xiangyu Zhang
摘要
Autonomous driving progress relies on large-scale annotated datasets. In this work, we explore the potential of generative models to produce vast quantities of freely-labeled data for autonomous driving applications and present SubjectDrive, the first model proven to scale generative data production in a way that could continuously improve autonomous driving applications. We investigate the impact of scaling up the quantity of generative data on the performance of downstream perception models and find that enhancing data diversity plays a crucial role in effectively scaling generative data production. Therefore, we have developed a novel model equipped with a subject control mechanism, which allows the generative model to leverage diverse external data sources for producing varied and useful data. Extensive evaluations confirm SubjectDrive's efficacy in generating scalable autonomous driving training data, marking a significant step toward revolutionizing data production methods in this field.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了最后一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper9
- WorldLens: Full-Spectrum Evaluations of Driving World Models in Real WorldAo Liang, Lingdong Kong, Tianyi Yan, Hongsi Liu 等CVPR 2026 · 被引用 28 次
- X-Scene: Large-Scale Driving Scene Generation with High Fidelity and Flexible ControllabilityYu Yang, Alan Liang, Jianbiao Mei, Yukai Ma 等NeurIPS 2025 · 被引用 22 次
- DiST-4D: Disentangled Spatiotemporal Diffusion with Metric Depth for 4D Driving Scene GenerationJiazhe Guo, Yikang Ding, Xiwu Chen, Shuo Chen 等ICCV 2025 · 被引用 5 次
- Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video GenerationBinyuan Huang, Yuning Lu, Weinan Jia, Hualiang Wang 等CVPR 2026 · 被引用 3 次
- LinkQA: Synthesizing Diverse QA from Multiple Seeds Strongly Linked by Knowledge PointsXuemiao Zhang, Can Ren, Chengying Tu, Rongxiang Weng 等ACL 2026 · 被引用 3 次
它引用的顶会 Paper23
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh 等ICML 2021 · 被引用 47,906 次
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser 等CVPR 2022 · 被引用 13,123 次
- Denoising Diffusion Implicit ModelsJiaming Song, Chenlin Meng, Stefano ErmonICLR 2021 · 被引用 11,743 次
- Adding Conditional Control to Text-to-Image Diffusion ModelsLvmin Zhang, Anyi Rao, Maneesh AgrawalaICCV 2023 · 被引用 6,759 次
- An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual InversionRinon Gal, Yuval Alaluf, Yuval Atzmon, Or Patashnik 等ICLR 2023 · 被引用 464 次
相关 Paper
- PerLDiff: Controllable Street View Synthesis Using Perspective-Layout Diffusion ModelJinhua Zhang, Hualian Sheng, Sijia Cai, Bing Deng 等ICCV 2025 · 被引用 2 次
- Panacea: Panoramic and Controllable Video Generation for Autonomous DrivingYuqing Wen, Yucheng Zhao, Yingfei Liu, Fan Jia 等CVPR 2024 · 被引用 26 次
- SimGen: Simulator-conditioned Driving Scene GenerationYunsong Zhou, Michael Simon, Zhenghao Mark Peng, Sicheng Mo 等NeurIPS 2024 · 被引用 44 次
- Rethinking Driving World Model as Synthetic Data Generator for Perception TasksKai Zeng, Zhanqian Wu, Kaixin Xiong, Xiaobao Wei 等ICLR 2026 · 被引用 14 次
- Generalized Predictive Model for Autonomous DrivingJiazhi Yang, Shenyuan Gao, Yihang Qiu, Li Chen 等CVPR 2024 · 被引用 32 次
