Looking Backward: Streaming Video-to-Video Translation with Feature Banks
Feng Liang, Akio Kodaira, Chenfeng Xu, Masayoshi Tomizuka, Kurt Keutzer, Diana Marculescu
2025Year
10Top-tier citations
Abstract
We present StreamV2V to support real-time video-to-video translation for streaming input. For webcam input, our StreamV2V supports face swap (e.g., to Elon Musk) and video stylization (e.g., to doodle art). Additionally, StreamV2V provides drawing rendering capabilities, enabling iterative creation. We encourage readers to check our video results in the supplementary materials.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 84f12095-c9d2-4409-8a25-2335c95ce915Cited by top-tier papers10
- Self Forcing: Bridging the Train-Test Gap in Autoregressive Video DiffusionXun Huang, Zhengqi Li, Guande He, Mingyuan Zhou et al.NeurIPS 2025 · 628 citations
- GaussFusion: Improving 3D Reconstruction in the Wild with A Geometry-Informed Video GeneratorLiyuan Zhu, Manjunath Narayana, Michal Stary, Will Hutchcroft et al.CVPR 2026 · 7 citations
- Streaming Drag-Oriented Interactive Video Manipulation: Drag Anything, Anytime!Junbao Zhou, Yuan Zhou, Kesen Zhao, Qingshan Xu et al.ICLR 2026 · 7 citations
- EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video EditingRunjia Li, Moayed Haji-Ali, Ashkan Mirzaei, Chaoyang Wang et al.CVPR 2026 · 7 citations
- Importance-Based Token Merging for Efficient Image and Video GenerationHaoyu Wu, Jingyi Xu, Hieu Le, Dimitris SamarasICCV 2025 · 3 citations
Builds on31
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh et al.ICML 2021 · 47,906 citations
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser et al.CVPR 2022 · 13,123 citations
- Denoising Diffusion Implicit ModelsJiaming Song, Chenlin Meng, Stefano ErmonICLR 2021 · 11,743 citations
- Photorealistic Text-to-Image Diffusion Models with Deep Language UnderstandingChitwan Saharia, William Chan, Saurabh Saxena, Lala Li et al.NeurIPS 2022 · 8,965 citations
- Video Diffusion ModelsJonathan Ho, Tim Salimans, Alexey A. Gritsenko, William Chan et al.NeurIPS 2022 · 2,948 citations
Related papers
- StreamDiT: Real-Time Streaming Text-to-Video GenerationAkio Kodaira, Tingbo Hou, Ji Hou, Markos Georgopoulos et al.CVPR 2026 · 45 citations
- FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video SynthesisFeng Liang, Bichen Wu, Jialiang Wang, Licheng Yu et al.CVPR 2024
- Interactive video stylization using few-shot patch-based trainingOndrej Texler, David Futschik, Michal Kucera, Ondrej Jamriska et al.SIGGRAPH 2020 · 70 citations
- SketchVideo: Sketch-based Video Generation and EditingFeng-Lin Liu, Hongbo Fu, Xintao Wang, Weicai Ye et al.CVPR 2025
- Snapstream: Snapshot-based Interaction in Live Streaming for Visual ArtSaelyne Yang, Changyoon Lee, Hijung Valentina Shin, Juho KimCHI 2020 · 41 citations
