Dismantling the Illusion of Vision-Language-Action Models Competence via Explicit Distributional Shifts
Xueyang Zhou, Yangming Xu, Guiyao Tie, Chaoran Hu, Bo Tao, xingwei zhao, Xiang Xiang, Pan Zhou, Lichao Sun, Yongchao Chen
Abstract
Given that simulation can never exhaustively enumerate reality, generalization is the determining factor for whether Vision-Language-Action (VLA) models can translate benchmark success into real-world functionality. However, current evaluation protocols often incentivize mechanical memorization rather than robust policy learning, leading to a paradoxical duality of failure: high-scoring models exhibit spurious invariance to semantic changes while simultaneously displaying extreme brittleness to trivial environmental perturbations. To address this, we introduce LIBERO-Gen , a diagnostic benchmark systematically designed to shift evaluation from intuition-driven heuristics to explicit distributional assumptions. Through a hierarchical protocol spanning In-distribution , Compositional , and Domain Generalization , LIBERO-Gen reveals performance stratifications previously masked by standard metrics. Our analysis identifies Pi0.5 as the top performer (64.0% in Spatial-CG; 21.2% in Task-CG). By identifying perceptual instability and action binding collapse as primary failure modes while validating the efficacy of structured ``Stair” sampling, LIBERO-Gen establishes a rigorous baseline for deployment reliability.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 20afd3a4-8e23-4038-a246-ad697779c644Builds on9
- Towards a Theoretical Framework of Out-of-Distribution GeneralizationHaotian Ye, Chuanlong Xie, Tianle Cai, Ruichen Li et al.NeurIPS 2021 · 159 citations
- Compositional Generalization from First PrinciplesThaddäus Wiedemer, Prasanna Mayilvahanan, Matthias Bethge, Wieland BrendelNeurIPS 2023 · 78 citations
- BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled OptimizationXueyang Zhou, Guiyao Tie, Guowen Zhang, Hechang Wang et al.NeurIPS 2025 · 50 citations
- Exploring the Limits of Vision-Language-Action Manipulation in Cross-task GeneralizationJiaming Zhou, Ke Ye, Jiayi Liu, Teli Ma et al.NeurIPS 2025 · 43 citations
- A Theory of Independent Mechanisms for Extrapolation in Generative ModelsMichel Besserve, Rémy Sun, Dominik Janzing, Bernhard SchölkopfAAAI 2021 · 27 citations
Related papers
- LIBERO-Plus: A Progressive Robustness Benchmark for Visual-Language-Action ModelsSenyu Fei, Siyin Wang, Junhao Shi, Zihao Dai et al.CVPR 2026
- VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action ModelsBorong Zhang, Jiahao Li, Jiachen Shen, Yuhao Zhang et al.ICML 2026 · 25 citations
- When Does Language Matter? Multilingual Instructions Reveal Step-wise Language Sensitivity in Vision-Language-Action ModelsXuan Dong, Zhe Han, Tianhao Niu, Qingfu Zhu et al.ACL 2026
- On Robustness of Vision-Language-Action Model against Multi-Modal PerturbationsJianing Guo, Zhenhong Wu, Chang Tu, Yiyao Ma et al.ICLR 2026 · 7 citations
- VLANeXt: Recipes for Building Strong VLA ModelsXiao-Ming Wu, Bin Fan, Kang Liao, Jian-Jian Jiang et al.ICML 2026 · 10 citations
