Dual-Granularity Memory for Efficient Video Generation
Hongjun Wang, Lin Liu, Jianguo Li, Tao Lin
Abstract
Recurrent architectures offer significant efficiency advantages over attention-based transformers for video generation, particularly for long sequences. However, chunked processing in these models creates temporal discontinuities that degrade long-range consistency. We introduce two complementary memory mechanisms that address this problem at different granularities. Context Memory maintains persistent global context within processing chunks through learnable sink columns and boundary buffers, adding only 150K parameters (less than 0.1% overhead). Latent Context-as-Memory (LCaM) extends memory across video segments by storing and retrieving historical latent embeddings, enabling cross-segment consistency without camera annotations or frame reconstruction. Applied to Generalized Spatial-Temporal Propagation Networks (GSTPN) distilled from WanVideo-1.3B, our dualmemory approach achieves 1.54× faster inference than attention-based transformers while maintaining competitive visual quality. LCaM is particularly suited to knowledge distillation settings where only pre-extracted latent embeddings are available. Extensive experiments and ablations validate the effectiveness of memory-augmented recurrent architectures for practical long-context video generation.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Builds on35
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh et al.ICML 2021 · 47,906 citations
- Flamingo: a Visual Language Model for Few-Shot LearningJean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, Antoine Miech et al.NeurIPS 2022 · 6,707 citations
- BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and GenerationJunnan Li, Dongxu Li, Caiming Xiong, Steven C. H. HoiICML 2022 · 6,549 citations
- Scalable Diffusion Models with TransformersWilliam Peebles, Saining XieICCV 2023 · 5,568 citations
- FlashAttention: Fast and Memory-Efficient Exact Attention with IO-AwarenessTri Dao, Daniel Y. Fu, Stefano Ermon, Atri Rudra et al.NeurIPS 2022 · 5,493 citations
Related papers
- ReHyAt: Recurrent Hybrid Attention for Video Diffusion TransformersMohsen Ghafoorian, Amirhossein HabibianCVPR 2026 · 5 citations
- Temporally Distributed Networks for Fast Video Semantic SegmentationPing Hu, Fabian Caba, Oliver Wang, Zhe Lin et al.CVPR 2020
- Linear-Time and Constant-Memory Text Embeddings Based on Recurrent Language ModelsTobias Grantner, Emanuel Sallinger, Martin FlechlACL 2026
- Artificial Hippocampus Networks for Efficient Long-Context ModelingYunhao Fang, Weihao Yu, Shu Zhong, Qinghao Ye et al.ICML 2026 · 9 citations
- Recurrent Memory TransformerAydar Bulatov, Yuri Kuratov, Mikhail BurtsevNeurIPS 2022 · 252 citations
