Simulating Human Audiovisual Search Behavior
Hyunsung Cho, Xuejing Luo, Byungjoo Lee, David Lindlbauer, Antti Oulasvirta
摘要
Locating a target based on auditory and visual cues—such as finding a car in a crowded parking lot or identifying a speaker in a virtual meeting—requires balancing effort, time, and accuracy under uncertainty. Existing models of audiovisual search often treat perception and action in isolation, overlooking how people adaptively coordinate movement and sensory strategies. We present Sensonaut, a computational model of embodied audiovisual search. The core assumption is that people deploy their body and sensory systems in ways they believe will most efficiently improve their chances of locating a target, trading off time and effort under perceptual constraints. Our model formulates this as a resource-rational decision-making problem under partial observability. We validate the model against newly collected human data, showing that it reproduces both adaptive scaling of search time and effort under task complexity, occlusion, and distraction, and characteristic human errors. Our simulation of human-like resource-rational search informs the design of audiovisual interfaces that minimize search cost and cognitive load.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper15
- AUIT - the Adaptive User Interfaces Toolkit for Designing XR ApplicationsJoão Marcelo Evangelista Belo, Mathias N. Lystbæk, Anna Maria Feit, Ken Pfeuffer 等UIST 2022 · 被引用 114 次
- An Adaptive Model of Gaze-based SelectionXiuli Chen, Aditya Acharya, Antti Oulasvirta, Andrew HowesCHI 2021 · 被引用 38 次
- CRTypist: Simulating Touchscreen Typing Behavior via Computational RationalityDanqing Shi, Yujun Zhu, Jussi P. P. Jokinen, Aditya Acharya 等CHI 2024 · 被引用 26 次
- Modeling Human Exploration Through Resource-Rational Reinforcement LearningMarcel Binz, Eric SchulzNeurIPS 2022 · 被引用 23 次
- Sensorimotor Simulation of Redirected Reaching using Stochastic Optimal Feedback ControlEric J. Gonzalez, Sean FollmerCHI 2023 · 被引用 21 次
相关 Paper
- CAVEN: An Embodied Conversational Agent for Efficient Audio-Visual Navigation in Noisy EnvironmentsXiulong Liu, Sudipta Paul, Moitreya Chatterjee, Anoop CherianAAAI 2024 · 被引用 16 次
- SeekUI: Predicting Visual Search Behavior on Graphical User Interfaces with a Reward-Augmented Vision Language ModelZixin Guo, Yue Jiang, Luis A. Leiva, Antti OulasvirtaCHI 2026 · 被引用 1 次
- Embodied Amodal Recognition: Learning to Move to Perceive ObjectsJianwei Yang, Zhile Ren, Mingze Xu, Xinlei Chen 等ICCV 2019 · 被引用 70 次
- NaVLA: A Vision-Language-Audio-Action Model for Multimodal Instruction NavigationJugang Fan, Peihao Chen, Changhao Li, Qing Du 等AAAI 2026
- AVLEN: Audio-Visual-Language Embodied Navigation in 3D EnvironmentsSudipta Paul, Amit Roy-Chowdhury, Anoop CherianNeurIPS 2022 · 被引用 43 次
