The Power of Context: How Multimodality Improves Image Super-Resolution
Kangfu Mei, Hossein Talebi, Mojtaba Ardakani, Vishal M. Patel, Peyman Milanfar, Mauricio Delbracio
摘要
Inputs Outputs Reference A close-up of a male lion with a dark mane, light tan face, and pink tongue sticking out . . . LR LR (Zoomed) Caption PASD SeeSR MMSR (Ours) HR Depth Segmentation Edge PASD (Zoomed) SeeSR (Zoomed) MMSR (Zoomed) HR (Zoomed) Figure 1. Our Multimodal Super-Resolution (MMSR) method leverages the rich context of multimodal guidance, including image captions, depth maps, semantic segmentation maps, and edges inferred from LR. MMSR surpasses state-of-the-art methods by producing more realistic results and suppressing artifacts that, while plausible, are inconsistent with the information present in the LR input.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper8
- 4KAgent: Agentic Any Image to 4K Super-ResolutionYushen Zuo, Qi Zheng, Mingyang Wu, Xinrui Jiang 等NeurIPS 2025 · 被引用 51 次
- Exploiting Diffusion Prior for Task-Driven Image RestorationJaeha Kim, Junghun Oh, Kyoung Mu LeeICCV 2025 · 被引用 6 次
- Kernel Density Steering: Inference-Time Scaling via Mode Seeking for Image RestorationYuyang Hu, Kangfu Mei, Mojtaba Sahraee-Ardakan, Ulugbek Kamilov 等NeurIPS 2025 · 被引用 6 次
- From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer DecompositionJingxi Chen, Yixiao Zhang, Xiaoye Qian, Zongxia Li 等CVPR 2026 · 被引用 5 次
- Fine-Structure Preserved Real-World Image Super-Resolution Via Transfer Vae TrainingQiaosi Yi, Shuai Liu, Rongyuan Wu, Lingchen Sun 等ICCV 2025 · 被引用 4 次
它引用的顶会 Paper40
- Denoising Diffusion Probabilistic ModelsJonathan Ho, Ajay Jain, Pieter AbbeelNeurIPS 2020 · 被引用 35,902 次
- Diffusion Models Beat GANs on Image SynthesisPrafulla Dhariwal, Alexander Quinn NicholNeurIPS 2021 · 被引用 13,211 次
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser 等CVPR 2022 · 被引用 13,123 次
- Visual Instruction TuningHaotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae LeeNeurIPS 2023 · 被引用 11,349 次
- Photorealistic Text-to-Image Diffusion Models with Deep Language UnderstandingChitwan Saharia, William Chan, Saurabh Saxena, Lala Li 等NeurIPS 2022 · 被引用 8,965 次
相关 Paper
- Rethinking Super-Resolution as Text-Guided Details GenerationChenxi Ma, Bo Yan, Qing Lin, Weimin Tan 等ACM MM 2022 · 被引用 6 次
- GLEAN: Generative Latent Bank for Large-Factor Image Super-ResolutionKelvin C. K. Chan, Xintao Wang, Xiangyu Xu, Jinwei Gu 等CVPR 2021
- Perceive, Understand and Restore: Real-World Image Super-Resolution with Autoregressive Multimodal Generative ModelsHongyang Wei, Shuaizheng Liu, Chun Yuan, Lei ZhangICCV 2025 · 被引用 4 次
- SeD: Semantic-Aware Discriminator for Image Super-ResolutionBingchen Li, Xin Li, Hanxin Zhu, Yeying Jin 等CVPR 2024
- Restore Text First, Enhance Image Later: Two-Stage Scene Text Image Super-Resolution with Glyph Structure GuidanceMinxing Luo, Linlong Fan, Qiushi Wang, Ge Wu 等CVPR 2026 · 被引用 2 次
