VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models
Huawei Ji, Yuanhao Sun, Yuan Jin, Cheng Deng, Jiaxin Ding, Luoyi Fu, Xinbing Wang
Abstract
Visual token pruning methods effectively mitigate the quadratic computational growth caused by processing high-resolution images or long video frames in vision-language models (VLMs). However, existing approaches rely on predefined pruning configurations without determining whether they achieve computationperformance optimality. In this work, we introduce VisPCO, a novel framework that formulates visual token pruning as a Pareto configuration optimization problem to automatically identify optimal configurations. Our approach employs continuous relaxation and straightthrough estimators to enable gradient-based search, solved via the Augmented Lagrangian method. Extensive experiments across 8 visual benchmarks demonstrate that VisPCO effectively approximates the empirical Pareto frontier obtained through grid search and generalizes well across various pruning methods and VLM architectures. Furthermore, through learnable kernel functions, we investigate layerwise pruning patterns and reveal that multi-step progressive pruning captures VLMs' hierarchical compression structure, achieving superior computation-performance trade-offs compared to single-layer approaches.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 35d1942a-b7e9-4e4d-b6a6-ab8f31dfde15Builds on11
- Visual Instruction TuningHaotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae LeeNeurIPS 2023 · 11,349 citations
- Video-LLaVA: Learning United Visual Representation by Alignment Before ProjectionBin Lin, Yang Ye, Bin Zhu, Jiaxi Cui et al.EMNLP 2024 · 231 citations
- Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid InferenceZhihang Lin, Mingbao Lin, Luxi Lin, Rongrong JiAAAI 2025 · 121 citations
- StreamingVLM: Real-Time Understanding for Infinite Video StreamsRuyi Xu, Guangxuan Xiao, Yukang Chen, Liuning He et al.ICLR 2026 · 95 citations
- HIMap: HybrId Representation Learning for End-to-end Vectorized HD Map ConstructionYi Zhou, Hui Zhang, Jiaqian Yu, Yifan Yang et al.CVPR 2024 · 19 citations
Related papers
- TOP-RL: Task-Optimized Progressive Token Pruning with Reinforcement Learning for Vision Language ModelsHengyi Wang, Weiying Xie, Hui Jiang, Yaotao Wei et al.AAAI 2026
- ViTCoP: Accelerating Large Vision-Language Models via Visual and Textual Semantic Collaborative PruningWen Luo, Peng Chen, Xiaotao Huang, LiQun HuangAAAI 2026
- Keyframe-Oriented Vision Token Pruning: Enhancing Efficiency of Large Vision Language Models on Long-form Video ProcessingYudong Liu, Jingwei Sun, Yueqian Lin, Jianyi Zhang et al.ICCV 2025 · 22 citations
- Balanced Token Pruning: Accelerating Vision Language Models Beyond Local OptimizationKaiyuan Li, Xiaoyue Chen, Chen Gao, Yong Li et al.NeurIPS 2025 · 26 citations
- SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model InferenceYuan Zhang, Chun-Kai Fan, Junpeng Ma, Wenzhao Zheng et al.ICML 2025
