Q-Instruct: Improving Low-Level Visual Abilities for Multi-Modality Foundation Models
Haoning Wu, Zicheng Zhang, Erli Zhang, Chaofeng Chen, Liang Liao, Annan Wang, Kaixin Xu, Chunyi Li, Jingwen Hou, Guangtao Zhai, Geng Xue, Wenxiu Sun
2024Year
55Top-tier citations
Abstract
Sensetime Research, 4 A*STAR 64.60% 59.22% 55.76% 47.98% 67.30% 58.90% 73.76% 60.07% 78.64% 63.99% 63.78% 65.25% 68.97% 67.80% 79.46%
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Cited by top-tier papers55
- Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMsPeter Tong, Ellis Brown, Penghao Wu, Sanghyun Woo et al.NeurIPS 2024 · 1,004 citations
- Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined LevelsHaoning Wu, Zicheng Zhang, Weixia Zhang, Chaofeng Chen et al.ICML 2024 · 499 citations
- Q-Insight: Understanding Image Quality via Visual Reinforcement LearningWeiqi Li, Xuanyu Zhang, Shijie Zhao, Yabin Zhang et al.NeurIPS 2025 · 117 citations
- Adaptive Image Quality Assessment via Teaching Large Multimodal Model to CompareHanwei Zhu, Haoning Wu, Yixuan Li, Zicheng Zhang et al.NeurIPS 2024 · 108 citations
- VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to RankTianhe Wu, Jian Zou, Jie Liang, Lei Zhang et al.NeurIPS 2025 · 92 citations
Builds on18
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh et al.ICML 2021 · 47,906 citations
- Chain-of-Thought Prompting Elicits Reasoning in Large Language ModelsJason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma et al.NeurIPS 2022 · 22,562 citations
- Visual Instruction TuningHaotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae LeeNeurIPS 2023 · 11,349 citations
- Large Language Models are Zero-Shot ReasonersTakeshi Kojima, Shixiang Shane Gu, Machel Reid, Yutaka Matsuo et al.NeurIPS 2022 · 8,168 citations
- InstructBLIP: Towards General-purpose Vision-Language Models with Instruction TuningWenliang Dai, Junnan Li, Dongxu Li, Anthony Meng Huat Tiong et al.NeurIPS 2023 · 4,013 citations
Related papers
- Subversion-resilient Key-exchange in the Post-quantum WorldKévin Duverger, Pierre-Alain Fouque, Charlie Jacomme, Guilhem Niot et al.CCS 2025
- Benchmark Platform for Ultra-Fine-Grained Visual Categorization Beyond Human PerformanceXiaohan Yu, Yang Zhao, Yongsheng Gao, Xiaohui Yuan et al.ICCV 2021 · 37 citations
- Cross Copy Network for Dialogue GenerationChangzhen Ji, Xin Zhou, Yating Zhang, Xiaozhong Liu et al.EMNLP 2020 · 11 citations
- AutoLUT: LUT-Based Image Super-Resolution with Automatic Sampling and Adaptive Residual LearningYuheng Xu, Shijie Yang, Xin Liu, Jie Liu et al.CVPR 2025
- Depth Estimation from Indoor Panoramas with Neural Scene RepresentationWenjie Chang, Yueyi Zhang, Zhiwei XiongCVPR 2023
