Cascaded Local Implicit Transformer for Arbitrary-Scale Super-Resolution
Hao-Wei Chen, Yu-Syuan Xu, Min-Fong Hong, Yi-Min Tsai, Hsien-Kai Kuo, Chun-Yi Lee
Abstract
Implicit neural representation has recently shown a promising ability in representing images with arbitrary resolutions. In this paper, we present a Local Implicit Transformer (LIT), which integrates the attention mechanism and frequency encoding technique into a local implicit image function. We design a cross-scale local attention block to effectively aggregate local features and a local frequency encoding block to combine positional encoding with Fourier domain information for constructing high-resolution images. To further improve representative power, we propose a Cascaded LIT (CLIT) that exploits multi-scale features, along with a cumulative training strategy that gradually increases the upsampling scales during training. We have conducted extensive experiments to validate the effectiveness of these components and analyze various training strategies. The qualitative and quantitative results demonstrate that LIT and CLIT achieve favorable results and outperform the prior works in arbitrary super-resolution tasks.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 564ba540-69ff-4257-a2b8-4f5bc214f940Cited by top-tier papers19
- Pixel to Gaussian: Ultra-Fast Continuous Super-Resolution with 2D Gaussian ModelingLong Peng, Anran Wu, Wenbo Li, Peizhe Xia et al.ICLR 2026 · 57 citations
- Fourier-enhanced Implicit Neural Fusion Network for Multispectral and Hyperspectral Image FusionYu-Jie Liang, Zihan Cao, Shangqi Deng, Hong-Xia Dou et al.NeurIPS 2024 · 40 citations
- Boosting Flow-based Generative Super-Resolution Models via Learned PriorLi-Yuan Tsao, Yi-Chen Lo, Chia-Che Chang, Hao-Wei Chen et al.CVPR 2024 · 10 citations
- SSL: A Self-similarity Loss for Improving Generative Image Super-resolutionDu Chen, Zhengqiang Zhang, Jie Liang, Lei ZhangACM MM 2024 · 7 citations
- Generalized and Efficient 2D Gaussian Splatting for Arbitrary-Scale Super-ResolutionDu Chen, Liyi Chen, Zhengqiang Zhang, Lei ZhangICCV 2025 · 6 citations
Builds on18
- Swin Transformer: Hierarchical Vision Transformer using Shifted WindowsZe Liu, Yutong Lin, Yue Cao, Han Hu et al.ICCV 2021 · 31,683 citations
- Fourier Features Let Networks Learn High Frequency Functions in Low Dimensional DomainsMatthew Tancik, Pratul P. Srinivasan, Ben Mildenhall, Sara Fridovich-Keil et al.NeurIPS 2020 · 4,036 citations
- Implicit Neural Representations with Periodic Activation FunctionsVincent Sitzmann, Julien N. P. Martel, Alexander W. Bergman, David B. Lindell et al.NeurIPS 2020 · 4,008 citations
- Mip-NeRF: A Multiscale Representation for Anti-Aliasing Neural Radiance FieldsJonathan T. Barron, Ben Mildenhall, Matthew Tancik, Peter Hedman et al.ICCV 2021 · 2,700 citations
- Neural Sparse Voxel FieldsLingjie Liu, Jiatao Gu, Kyaw Zaw Lin, Tat-Seng Chua et al.NeurIPS 2020 · 1,535 citations
Related papers
- HIIF: Hierarchical Encoding based Implicit Image Function for Continuous Super-resolutionYuxuan Jiang, Ho Man Kwan, Tianhao Peng, Ge Gao et al.CVPR 2025
- Locality-Aware Generalizable Implicit Neural RepresentationDoyup Lee, Chiheon Kim, Minsu Cho, Wook-Shin HanNeurIPS 2023 · 25 citations
- Local Texture Estimator for Implicit Representation FunctionJaewon Lee, Kyong Hwan JinCVPR 2022 · 193 citations
- Rethinking Multi-Contrast MRI Super-Resolution: Rectangle-Window Cross-Attention Transformer and Arbitrary-Scale UpsamplingGuangyuan Li, Lei Zhao, Jiakai Sun, Zehua Lan et al.ICCV 2023 · 37 citations
- CiaoSR: Continuous Implicit Attention-in-Attention Network for Arbitrary-Scale Image Super-ResolutionJiezhang Cao, Qin Wang, Yongqin Xian, Yawei Li et al.CVPR 2023
