Lune

ICLR2025

MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding

Fei Wang, Xingyu Fu, James Y. Huang, Zekun Li, Qin Liu, Xiaogeng Liu, Mingyu Derek Ma, Nan Xu, Wenxuan Zhou, Kai Zhang, Tianyi Lorena Yan, Wenjie Jacky Mo, Hsiang-Hui Liu, Pan Lu, Chunyuan Li, Chaowei Xiao, Kai-Wei Chang, Dan Roth, Sheng Zhang, Hoifung Poon, Muhao Chen

2025Year

Abstract

Figure 1: The MUIRBENCH Benchmark. MUIRBENCH contains 11,264 images and 2,600 multiplechoice questions, providing robust evaluation on 12 multi-image understanding tasks. Each example comes from one task in MUIRBENCH, presenting diverse multi-image relations.