Fast-Slow Test-Time Adaptation for Online Vision-and-Language Navigation
Junyu Gao, Xuan Yao, Changsheng Xu
摘要
The ability to accurately comprehend natural language instructions and navigate to the target location is essential for an embodied agent. Such agents are typically required to execute user instructions in an online manner, leading us to explore the use of unlabeled test samples for effective online model adaptation. However, for online Vision-and-Language Navigation (VLN), due to the intrinsic nature of inter-sample online instruction execution and intra-sample multi-step action decision, frequent updates can result in drastic changes in model parameters, while occasional updates can make the model ill-equipped to handle dynamically changing environments. Therefore, we propose a Fast-Slow Test-Time Adaptation (FSTTA) approach for online VLN by performing joint decomposition-accumulation analysis for both gradients and parameters in a unified framework. Extensive experiments show that our method obtains impressive performance gains on four popular benchmarks. Code is available at https://github.com/Feliciaxyao/ ICML2024-FSTTA .
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper22
- C-NAV: Towards Self-Evolving Continual Object Navigation in Open WorldMingming Yu, Fei Zhu, Wenzhuo Liu, Yirong Yang 等NeurIPS 2025 · 被引用 10 次
- Active Test-time Vision-Language NavigationHeeju Ko, Sung June Kim, Gyeongrok Oh, Jeongyoon Yoon 等NeurIPS 2025 · 被引用 10 次
- NavMorph: A Self-Evolving World Model for Vision-and-Language Navigation in Continuous EnvironmentsXuan Yao, Junyu Gao, Changsheng XuICCV 2025 · 被引用 7 次
- Partition-Then-Adapt: Combating Prediction Bias for Reliable Multi-Modal Test-Time AdaptationGuowei Wang, Fan Lyu, Changxing DingNeurIPS 2025 · 被引用 6 次
- All-day Multi-scenes Lifelong Vision-and-Language Navigation with Tucker AdaptationXudong Wang, Gan Li, Zhiyu Liu, Yao Wang 等ICLR 2026 · 被引用 4 次
它引用的顶会 Paper54
- An Image is Worth 16x16 Words: Transformers for Image Recognition at ScaleAlexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn 等ICLR 2021 · 被引用 21,477 次
- Gradient Surgery for Multi-Task LearningTianhe Yu, Saurabh Kumar, Abhishek Gupta, Sergey Levine 等NeurIPS 2020 · 被引用 2,261 次
- Tent: Fully Test-Time Adaptation by Entropy MinimizationDequan Wang, Evan Shelhamer, Shaoteng Liu, Bruno A. Olshausen 等ICLR 2021 · 被引用 1,731 次
- Test-Time Training with Self-Supervision for Generalization under Distribution ShiftsYu Sun, Xiaolong Wang, Zhuang Liu, John Miller 等ICML 2020 · 被引用 1,220 次
- Efficient Test-Time Model Adaptation without ForgettingShuaicheng Niu, Jiaxiang Wu, Yifan Zhang, Yaofo Chen 等ICML 2022 · 被引用 579 次
相关 Paper
- Test-Time Adaptation for Online Vision-Language Navigation with Feedback-based Reinforcement LearningSungjune Kim, Gyeongrok Oh, Heeju Ko, Daehyun Ji 等ICML 2025
- Towards Open Environments and Instructions: General Vision-Language Navigation via Fast-Slow Interactive ReasoningYang Li, Aming Wu, Zihao Zhang, Yahong HanCVPR 2026
- VELMA: Verbalization Embodiment of LLM Agents for Vision and Language Navigation in Street ViewRaphael Schumann, Wanrong Zhu, Weixi Feng, Tsu-Jui Fu 等AAAI 2024 · 被引用 122 次
- Counterfactual Vision-and-Language Navigation: Unravelling the UnseenAmin Parvaneh, Ehsan Abbasnejad, Damien Teney, Qinfeng Shi 等NeurIPS 2020 · 被引用 54 次
- Turning Adaptation into Assets: Cross-Domain Bridging for Online Vision-Language NavigationZixuan Hu, Xuantuo Huang, Yancheng Li, Yichun Hu 等ICML 2026
