ACL2026

PolyAudio: Advancing Multi-Audio Reasoning in Large Audio Language Models with Interleaved Multi-Audio Contexts

Sonal Kumar, Sreyan Ghosh, Yueqian Lin, S. Sakshi, Ashish Seth, Yiran Chen, Ramani Duraiswami, Dinesh Manocha

摘要

Large Audio Language Models have demonstrated impressive performance on single-clip audio understanding tasks, including automatic speech recognition, captioning, sound event recognition, etc. However, their ability to reason over interleaved audio-language contexts-where answering a query requires relating information across multiple audio clipsremains limited. We present PolyAudio, an LALM built on Audio Flamingo 3 that targets multi-audio understanding via post-training instruction tuning. To train PolyAudio, we also propose PolyAudio-Instruct, a high-quality instruction-tuning dataset consisting of 1.3M+ QA pairs, spanning over 14 diverse tasks to learn multi-audio understanding and reasoning. PolyAudio uses an explicit interleaved representation with clip indexing to encourage faithful grounding and reduce ambiguity in multi-clip references. We evaluate PolyAudio on a diverse suite of multi-audio benchmarks alongside standard single-audio tasks. PolyAudio achieves strong performance on multi-audio reasoning, outperforming competitive baselines that are also often limited to reasoning over up to 2 audio clips, while preserving robust single-clip performance. Overall, our results suggest that precise, academicscale multi-audio instruction tuning can unlock advanced multi-and cross-clip audio reasoning capabilities, enabling more capable audiocentric assistants. Project