M2T: Masking Transformers Twice for Faster Decoding
Fabian Mentzer, Eirikur Agustsson, Michael Tschannen
摘要
We show how bidirectional transformers trained for masked token prediction can be applied to neural image compression to achieve state-of-the-art results. Such models were previously used for image generation by progressivly sampling groups of masked tokens according to uncertainty-adaptive schedules. Unlike these works, we demonstrate that predefined, deterministic schedules perform as well or better for image compression. This insight allows us to use masked attention during training in addition to masked inputs, and activation caching during inference, to significantly speed up our models (≈4× higher inference speed) at a small increase in bitrate.1
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper6
- Causal Context Adjustment Loss for Learned Image CompressionMinghao Han, Shiyin Jiang, Shengxi Li, Xin Deng 等NeurIPS 2024 · 被引用 31 次
- Learned Image Compression with Hierarchical Progressive Context ModelingYuqi Li, Haotian Zhang, Li Li, Dong LiuICCV 2025 · 被引用 8 次
- Differentiable Vector Quantization for Rate-Distortion Optimization of Generative Image CompressionShiyin Jiang, Wei Long, Minghao Han, Zhenghao Chen 等CVPR 2026 · 被引用 3 次
- Context Guided Transformer Entropy Modeling for Video CompressionJunlong Tong, Wei Zhang, Yaohui Jin, Xiaoyu ShenICCV 2025
- Learned Image Compression with Dictionary-based Entropy ModelJingbo Lu, Leheng Zhang, Xingyu Zhou, Mu Li 等CVPR 2025
它引用的顶会 Paper14
- An Image is Worth 16x16 Words: Transformers for Image Recognition at ScaleAlexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn 等ICLR 2021 · 被引用 21,477 次
- On Layer Normalization in the Transformer ArchitectureRuibin Xiong, Yunchang Yang, Di He, Kai Zheng 等ICML 2020 · 被引用 1,388 次
- High-Fidelity Generative Image CompressionFabian Mentzer, George Toderici, Michael Tschannen, Eirikur AgustssonNeurIPS 2020 · 被引用 675 次
- Generative Adversarial Networks for Extreme Learned Image CompressionEirikur Agustsson, Michael Tschannen, Fabian Mentzer, Radu Timofte 等ICCV 2019 · 被引用 648 次
- ELIC: Efficient Learned Image Compression with Unevenly Grouped Space-Channel Contextual Adaptive CodingDailan He, Ziming Yang, Weikun Peng, Rui Ma 等CVPR 2022 · 被引用 363 次
相关 Paper
- Flow to the Mode: Mode-Seeking Diffusion Autoencoders for State-of-the-Art Image TokenizationKyle Sargent, Kyle Hsu, Justin Johnson, Li Fei-Fei 等ICCV 2025 · 被引用 1 次
- Spectral Image TokenizerCarlos Esteves, Mohammed Suhail, Ameesh MakadiaICCV 2025 · 被引用 1 次
- MaskGIT: Masked Generative Image TransformerHuiwen Chang, Han Zhang, Lu Jiang, Ce Liu 等CVPR 2022 · 被引用 346 次
- Autoregressive Image Generation with Masked Bit ModelingQihang Yu, Qihao Liu, Ju He, Xinyang Zhang 等ICML 2026 · 被引用 5 次
- HybridFlow: Infusing Continuity into Masked Codebook for Extreme Low-Bitrate Image CompressionLei Lu, Yanyue Xie, Wei Jiang, Wei Wang 等ACM MM 2024 · 被引用 9 次
