When Does Language Matter? Multilingual Instructions Reveal Step-wise Language Sensitivity in Vision-Language-Action Models
Xuan Dong, Zhe Han, Tianhao Niu, Qingfu Zhu, Wanxiang Che
Abstract
Vision-Language-Action (VLA) models have shown strong performance in language-conditioned robotic manipulation, yet their robustness to linguistic variation remains poorly understood. In this work, we present the first systematic multilingual evaluation of VLA models by translating the LIBERO benchmark into ten languages, revealing severe performance degradation under non-English instructions, with success rates dropping by 30-50%. Through fine-grained analysis of task executions, we find that language influence is highly non-uniform across steps: certain steps exhibit strong language dependence and dominate overall task failure, while others are largely language-agnostic. Based on this insight, we propose a step-wise inference-time intervention that aligns representations according to step language sensitivity, substantially improving performance under linguistic variation. Our results indicate that language robustness in VLA models is fundamentally a step-wise control problem, highlighting the importance of temporally structured analysis for reliable embodied agents.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext af7d30dd-9365-44bb-88a7-02801de97880Builds on4
- Cross-lingual Prompting: Improving Zero-shot Chain-of-Thought Reasoning across LanguagesLibo Qin, Qiguang Chen, Fuxuan Wei, Shijue Huang et al.EMNLP 2023 · 26 citations
- CLAIM: Mitigating Multilingual Object Hallucination in Large Vision-Language Models with Cross-Lingual Attention InterventionZekai Ye, Qiming Li, Xiaocheng Feng, Libo Qin et al.ACL 2025 · 14 citations
- On Robustness of Vision-Language-Action Model against Multi-Modal PerturbationsJianing Guo, Zhenhong Wu, Chang Tu, Yiyao Ma et al.ICLR 2026 · 7 citations
- Unlocking Multilingual Reasoning Capability of LLMs and LVLMs through Representation EngineeringQiming Li, Xiaocheng Feng, Yixuan Ma, Ruihan Chen et al.ACL 2026 · 4 citations
Related papers
- LIBERO-Plus: A Progressive Robustness Benchmark for Visual-Language-Action ModelsSenyu Fei, Siyin Wang, Junhao Shi, Zihao Dai et al.CVPR 2026
- Dismantling the Illusion of Vision-Language-Action Models Competence via Explicit Distributional ShiftsXueyang Zhou, Yangming Xu, Guiyao Tie, Chaoran Hu et al.ICML 2026
- Beyond Success: Refining Elegant Robot Manipulation from Mixed-Quality Data via Just-in-Time InterventionYanbo Mao, Jianlong Fu, Ruoxuan Zhang, Hongxia Xie et al.CVPR 2026 · 2 citations
- Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action PoliciesZhixuan Liang, Yizhuo Li, Tianshuo Yang, CHENGYUE WU et al.ICML 2026 · 86 citations
- QVLA: Not All Channels Are Equal in Vision-Language-Action Model's QuantizationYuhao Xu, Yantai Yang, Zhenyang Fan, Yufan Liu et al.ICLR 2026 · 21 citations
