NVILA: Efficient Frontier Visual Language Models
Zhijian Liu, Ligeng Zhu, Baifeng Shi, Zhuoyang Zhang, Yuming Lou, Shang Yang, Haocheng Xi, Shiyi Cao, Yuxian Gu, Dacheng Li, Xiuyu Li, Haotian Tang
摘要
Decoding Speed (token/s) (1.9-5.1X Faster) (Pre-fill: 1.6-2.2X Faster / Decode: 1.2-2.8X Faster) 5.1X Faster 2.2X Faster 2.8X Faster AI2D C h a rt Q A D oc VQ A In fo VQ A M a th V is ta MMMU R e a lW o rl d Q A S EE D (im ag e) Te xt VQ A V Q A v 2 (c) Accuracy on image and video benchmarks (On-par or superior accuracy on all benchmarks)
Efficient Frontier VLMs. (a) NVILA trains image and video models 5.1→ and 1.9→ faster, respectively, than LLaVA-OneVision (OV), which is the only baseline model with publicly disclosed training costs. (b) Against Qwen2-VL, NVILA achieves a 1.6-2.2→ measured speedup in the pre-filling stage and a 1.2-2.8→ speedup during the decoding stage. (c) NVILA's efficiency is achieved without compromising accuracy; in fact, it delivers comparable or even superior accuracy across image and video benchmarks. All models in this table have 8B parameters. Training time in (a) is measured using NVIDIA H100 GPUs, while inference speed in (b) is measured using a single NVIDIA GeForce RTX 4090 GPU. Accuracy numbers in (c) are normalized relative to the highest score for each benchmark.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper72
- MMSI-Bench: A Benchmark for Multi-Image Spatial IntelligenceSihan Yang, Runsen Xu, Yiman Xie, Sizhe Yang 等ICLR 2026 · 被引用 195 次
- ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent PlanningChi-Pin Huang, Yueh-Hua Wu, Min-Hung Chen, Yu-Chiang Frank Wang 等NeurIPS 2025 · 被引用 179 次
- Scaling RL to Long VideosYukang Chen, Wei Huang, Baifeng Shi, Qinghao Hu 等NeurIPS 2025 · 被引用 91 次
- LaViDa: A Large Diffusion Language Model for Multimodal UnderstandingShufan Li, Konstantinos Kallidromitis, Hritik Bansal, Akash Gokul 等NeurIPS 2025 · 被引用 89 次
- StreamForest: Efficient Online Video Understanding with Persistent Event MemoryXiangyu Zeng, Kefan Qiu, Qingyu Zhang, Xinhao Li 等NeurIPS 2025 · 被引用 79 次
它引用的顶会 Paper36
- LoRA: Low-Rank Adaptation of Large Language ModelsEdward J. Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu 等ICLR 2022 · 被引用 18,833 次
- Visual Instruction TuningHaotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae LeeNeurIPS 2023 · 被引用 11,349 次
- QLoRA: Efficient Finetuning of Quantized LLMsTim Dettmers, Artidoro Pagnoni, Ari Holtzman, Luke ZettlemoyerNeurIPS 2023 · 被引用 5,863 次
- Sigmoid Loss for Language Image Pre-TrainingXiaohua Zhai, Basil Mustafa, Alexander Kolesnikov, Lucas BeyerICCV 2023 · 被引用 2,932 次
- FlashAttention-2: Faster Attention with Better Parallelism and Work PartitioningTri DaoICLR 2024 · 被引用 2,600 次
相关 Paper
- SparseVILA: Decoupling Visual Sparsity for Efficient VLM InferenceSamir Khaki, Junxian Guo, Jiaming Tang, Shang Yang 等ICCV 2025 · 被引用 3 次
- BOLT: Fewer Tokens but More Performance Retention for Efficient Vision-Language Models InferenceJiahua Bao, Siyao Cheng, Jiaxing Du, Changjiang He 等ACM MM 2025
- MAGVIT: Masked Generative Video TransformerLijun Yu, Yong Cheng, Kihyuk Sohn, José Lezama 等CVPR 2023
- SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token PruningYicheng Ji, Jun Zhang, Heming Xia, Jinpeng Chen 等EMNLP 2025 · 被引用 1 次
- MMInference: Accelerating Pre-filling for Long-Context Visual Language Models via Modality-Aware Permutation Sparse AttentionYucheng Li, Huiqiang Jiang, Chengruidong Zhang, Qianhui Wu 等ICML 2025
