MPJudge: Towards Perceptual Assessment of Music-Induced Paintings
Shiqi Jiang, Tianyi Liang, Huayuan Ye, Changbo Wang, Chenhui Li
摘要
Music-induced painting is a unique artistic practice, where visual artworks are created under the influence of music. Evaluating whether a painting faithfully reflects the music that inspired it poses a challenging perceptual assessment task. Existing methods primarily rely on emotion recognition models to assess the similarity between music and painting, but such models introduce considerable noise and overlook broader perceptual cues beyond emotion. To address these limitations, we propose a novel framework for music-induced painting assessment that directly models perceptual coherence between music and visual art. We introduce MPD, the first large-scale dataset of music–painting pairs annotated by domain experts based on perceptual coherence. To better handle ambiguous cases, we further collect pairwise preference annotations. Building on this dataset, we present MPJudge, a model that integrates music features into a visual encoder via a modulation-based fusion mechanism. To effectively learn from ambiguous cases, we adopt Direct Preference Optimization for training. Extensive experiments demonstrate that our method outperforms existing approaches. Qualitative results further show that our model more accurately identifies music-relevant regions in paintings.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper5
- Emotion-Based End-to-End Matching Between Image and Music in Valence-Arousal SpaceSicheng Zhao, Yaxian Li, Xingxu Yao, Weizhi Nie 等ACM MM 2020 · 被引用 30 次
- AACP: Aesthetics Assessment of Children's Paintings Based on Self-Supervised LearningShiqi Jiang, Ning Li, Chen Shi, Liping Guo 等AAAI 2024 · 被引用 2 次
- PPJudge: Towards Human-Aligned Assessment of Artistic Painting ProcessShiqi Jiang, Xinpeng Li, Xi Mao, Changbo Wang 等ACM MM 2025
- Towards Artistic Image Aesthetics Assessment: a Large-scale Dataset and a New MethodRan Yi, Haoyuan Tian, Zhihao Gu, Yu-Kun Lai 等CVPR 2023
- TextCenGen: Attention-Guided Text-Centric Background Adaptation for Text-to-Image GenerationTianyi Liang, Jiangqi Liu, Yifei Huang, Shiqi Jiang 等ICML 2025
相关 Paper
- Music2Palette: Emotion-aligned Color Palette Generation via Cross-Modal Representation LearningJiayun Hu, Yueyi He, Tianyi Liang, Changbo Wang 等ACM MM 2025 · 被引用 2 次
- ArtiMuse: Fine-Grained Image Aesthetics Assessment with Joint Scoring and Expert-Level UnderstandingShuo Cao, Nan Ma, Jiayang Li, Xiaohui Li 等CVPR 2026 · 被引用 38 次
- Crossing You in Style: Cross-modal Style Transfer from Music to Visual ArtsCheng-Che Lee, Wan-Yi Lin, Yen-Ting Shih, Pei-Yi (Patricia) Kuo 等ACM MM 2020 · 被引用 16 次
- Can Machines Understand Composition? Dataset and Benchmark for Photographic Image Composition Embedding and UnderstandingZhaoran Zhao, Peng Lu, Anran Zhang, Peipei Li 等CVPR 2025
- MELFuSION: Synthesizing Music from Image and Language Cues Using Diffusion ModelsSanjoy Chowdhury, Sayan Nag, K. J. Joseph, Balaji Vasan Srinivasan 等CVPR 2024
