RAVE: Randomized Noise Shuffling for Fast and Consistent Video Editing with Diffusion Models
Ozgur Kara, Bariscan Kurtkaya, Hidir Yesiltepe, James M. Rehg, Pinar Yanardag
2024Year
46Top-tier citations
Abstract
Input Input "a white cat" "an ancient Egyptian pharaoh is typing" "a bear" "a zombie" "a dinosaur" "a man wearing a glitter jacket is typing" Figure 1 . RAVE is a lightweight and fast video editing method that enhances temporal consistency in video edits, utilizing pre-trained text-to-image diffusion models. It is capable of modifying local attributes, like changing a person's jacket (bottom right), and can also handle complex shape transformations, such as turning a wolf into a dinosaur (bottom left).
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Cited by top-tier papers46
- ReVideo: Remake a Video with Motion and Content ControlChong Mou, Mingdeng Cao, Xintao Wang, Zhaoyang Zhang et al.NeurIPS 2024 · 87 citations
- COVE: Unleashing the Diffusion Feature Correspondence for Consistent Video EditingJiangshan Wang, Yue Ma, Jiayi Guo, Yicheng Xiao et al.NeurIPS 2024 · 76 citations
- Ctrl-X: Controlling Structure and Appearance for Text-To-Image Generation Without GuidanceKuan Heng Lin, Sicheng Mo, Ben Klingher, Fangzhou Mu et al.NeurIPS 2024 · 51 citations
- IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing AssessmentYinan Chen, Jiangning Zhang, Teng Hu, Yuxiang Zeng et al.ICLR 2026 · 29 citations
- FlowDirector: Training-Free Flow Steering for Precise Text-to-Video EditingGuangzhao Li, Yanming Yang, Chenxi Song, Xiaohong Liu et al.CVPR 2026 · 27 citations
Builds on28
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh et al.ICML 2021 · 47,906 citations
- Denoising Diffusion Probabilistic ModelsJonathan Ho, Ajay Jain, Pieter AbbeelNeurIPS 2020 · 35,902 citations
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser et al.CVPR 2022 · 13,123 citations
- Denoising Diffusion Implicit ModelsJiaming Song, Chenlin Meng, Stefano ErmonICLR 2021 · 11,743 citations
- Photorealistic Text-to-Image Diffusion Models with Deep Language UnderstandingChitwan Saharia, William Chan, Saurabh Saxena, Lala Li et al.NeurIPS 2022 · 8,965 citations
Related papers
- RFDM: Residual Flow Diffusion Models for Video EditingMohammadreza Salehi, Mehdi Noroozi, Luca Morreale, Ruchika Chavhan et al.CVPR 2026
- CCEdit: Creative and Controllable Video Editing via Diffusion ModelsRuoyu Feng, Wenming Weng, Yanhui Wang, Yuhui Yuan et al.CVPR 2024
- Perturb-and-Revise: Flexible 3D Editing with Generative TrajectoriesSusung Hong, Johanna Suvi Karras, Ricardo Martin-Brualla, Ira Kemelmacher-ShlizermanCVPR 2025
- Shape-Aware Text-Driven Layered Video EditingYao-Chih Lee, Ji-Ze Genevieve Jang, Yi-Ting Chen, Elizabeth Qiu et al.CVPR 2023
- FADE: Frequency-Aware Diffusion Model Factorization for Video EditingYixuan Zhu, Haolin Wang, Shilin Ma, Wenliang Zhao et al.CVPR 2025
