Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning
Alex Jinpeng Wang, Linjie Li, Yiqi Lin, Min Li, Lijuan Wang, Mike Zheng Shou
Abstract
Training models with longer in-context lengths is a significant challenge for multimodal model due to substantial GPU memory and computational costs. This exploratory study does not present state-of-the-art models; rather, it introduces an innovative method designed to increase in-context text length in multi-modality large language models (MLLMs) efficiently. We present Visualized In-Context Text Processing (VisInContext), which processes long in-context text using visual tokens. This technique significantly reduces GPU memory usage and floating point operations (FLOPs) for both training and inferenceing stage. For instance, our method expands the pre-training in-context text length from 256 to 2048 tokens with nearly same FLOPs for a 56 billion parameter MOE model. Experimental results demonstrate that model trained with VisInContext delivers superior performance on common downstream benchmarks for in-context few-shot evaluation. Additionally, VisInContext is complementary to existing methods for increasing in-context text length and enhances document understanding capabilities, showing great potential in document QA tasks and sequential document retrieval.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 9fd3a989-abb9-4f02-afe3-d8351a9f9e19Cited by top-tier papers4
- Vision-centric Token Compression in Large Language ModelLing Xing, Alex Jinpeng Wang, Rui Yan, Xiangbo Shu et al.NeurIPS 2025 · 32 citations
- VisualCloze: A Universal Image Generation Framework via Visual in-Context LearningZhong-Yu Li, Ruoyi Du, Juncheng Yan, Le Zhuo et al.ICCV 2025 · 2 citations
- Exploring Visual Pretraining for Learning Language IntelligenceZhonghan Zhao, Yiming Zhang, Wenwei Zhang, Haiteng Zhao et al.CVPR 2026
- Entropy-Aware Dynamic KV Cache Sparsification for Autoregressive Image Generation and EditingTong Tong, LING XING, Linjie Li, Rui Yan et al.ICML 2026
Builds on20
- Language Models are Few-Shot LearnersTom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah et al.NeurIPS 2020 · 64,255 citations
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh et al.ICML 2021 · 47,906 citations
- An Image is Worth 16x16 Words: Transformers for Image Recognition at ScaleAlexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn et al.ICLR 2021 · 21,477 citations
- Visual Instruction TuningHaotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae LeeNeurIPS 2023 · 11,349 citations
- BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language ModelsJunnan Li, Dongxu Li, Silvio Savarese, Steven C. H. HoiICML 2023 · 7,873 citations
Related papers
- Multimodal Task Vectors Enable Many-Shot Multimodal In-Context LearningBrandon Huang, Chancharik Mitra, Leonid Karlinsky, Assaf Arbelle et al.NeurIPS 2024 · 60 citations
- Filter, Correlate, Compress: Training-Free Token Reduction for MLLM AccelerationYuhang Han, Xuyang Liu, Zihan Zhang, Pengxiang Ding et al.AAAI 2026 · 23 citations
- Glyph: Scaling Context Windows via Visual-Text CompressionJiale Cheng, Yusen Liu, Xinyu Zhang, Yulin Fei et al.ACL 2026
- DeepStack: Deeply Stacking Visual Tokens is Surprisingly Simple and Effective for LMMsLingchen Meng, Jianwei Yang, Rui Tian, Xiyang Dai et al.NeurIPS 2024 · 89 citations
- Accelerating Pre-training of Multimodal LLMs via Chain-of-SightZiyuan Huang, Kaixiang Ji, Biao Gong, Zhiwu Qing et al.NeurIPS 2024 · 9 citations
