UniFusion: A Unified Image Fusion Framework with Robust Representation and Source-Aware Preservation
Xingyuan Li, Songcheng Du, Yang Zou, Haoyuan Xu, Zhiying Jiang, Jinyuan Liu
Abstract
Image fusion aims to integrate complementary information from multiple source images to produce a more informative and visually consistent representation, benefiting both human perception and downstream vision tasks. Despite recent progress, most existing fusion methods are designed for specific tasks (i.e., multi-modal, multi-exposure, or multi-focus fusion) and struggle to effectively preserve source information during the fusion process. This limitation primarily arises from task-specific architectures and the degradation of source information caused by deep-layer propagation. To overcome these issues, we propose UniFusion, a unified image fusion framework designed to achieve cross-task generalization. First, leveraging DINOv3 for modality-consistent feature extraction, UniFusion establishes a shared semantic space for diverse inputs. Second, to preserve the understanding of each source image, we introduce a reconstruction-alignment loss to maintain consistency between fused outputs and inputs. Finally, we employ a bilevel optimization strategy to decouple and jointly optimize reconstruction and fusion objectives, effectively balancing their coupling relationship and ensuring smooth convergence. Extensive experiments across multiple fusion tasks demonstrate UniFusion's superior visual quality, generalization ability, and adaptability to real-world scenarios. Code is available at https://github.com/dusongcheng/UniFusion.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Cited by top-tier papers2
- From 2D Grids to 1D Tokens: Reforming Shared Representations for Multimodal Image FusionYuchen Xian, Yunqiu Xu, Yang He, Yi YangICML 2026 · 2 citations
- DRFusion: Drift-Resilient Temporally Consistent Infrared–Visible Video FusionXingyuan Li, HaoYuan Xu, Shulin Li, Xiang Chen et al.ICML 2026
Builds on27
- Target-aware Dual Adversarial Learning and a Multi-scenario Multi-Modality Benchmark to Fuse Infrared and Visible for Object DetectionJinyuan Liu, Xin Fan, Zhanbo Huang, Guanyao Wu et al.CVPR 2022 · 929 citations
- FusionDN: A Unified Densely Connected Network for Image FusionHan Xu, Jiayi Ma, Zhuliang Le, Junjun Jiang et al.AAAI 2020 · 559 citations
- DDFM: Denoising Diffusion Model for Multi-Modality Image FusionZixiang Zhao, Haowen Bai, Yuanzhi Zhu, Jiangshe Zhang et al.ICCV 2023 · 350 citations
- Multi-interactive Feature Learning and a Full-time Multi-modality Benchmark for Image Fusion and SegmentationJinyuan Liu, Zhu Liu, Guanyao Wu, Long Ma et al.ICCV 2023 · 287 citations
- Equivariant Multi-Modality Image FusionZixiang Zhao, Haowen Bai, Jiangshe Zhang, Yulun Zhang et al.CVPR 2024 · 155 citations
Related papers
- Task-driven Image Fusion with Learnable Fusion LossHaowen Bai, Jiangshe Zhang, Zixiang Zhao, Yichen Wu et al.CVPR 2025
- Balancing Task-Invariant Interaction and Task-Specific Adaptation for Unified Image FusionXingyu Hu, Junjun Jiang, Chenyang Wang, Kui Jiang et al.ICCV 2025 · 3 citations
- More Than Meets the Eye: A Unified Image Fusion Framework via Semantic-Pixel Entropy Trade-off for Zero-Shot GeneralizationXiaowen Liu, Jing Li, Hongtao Huo, Haozhe Cao et al.CVPR 2026
- Deno-IF: Unsupervised Noisy Visible and Infrared Image Fusion MethodHan Xu, Yuyang Li, Yunfei Deng, Jiayi Ma et al.NeurIPS 2025 · 8 citations
- A Unified Solution to Video Fusion: From Multi-Frame Learning to BenchmarkingZixiang Zhao, Haowen Bai, Bingxin Ke, Yukun Cui et al.NeurIPS 2025 · 21 citations
