发表机构
North China Electric Power University; Beijing University of Posts and Telecommunications(华北电力大学; 北京邮电大学)
机构由 AI 辅助整理,请以论文原文为准。AI 中文总结
研究可控红外与可见光图像融合,提出ConFusion框架,通过高斯条件空间感知调制学习连续融合空间,采用双分支架构及相关模块实现实例级细粒度可控融合,实验证明其在融合质量和下游任务上达先进水平。
AI 中文摘要
可控红外-可见光图像融合旨在通过灵活的区域感知调制整合互补的热信息和结构信息,生成适应不同用户需求和下游任务的融合图像。然而,现有方法通常依赖预定义的离散控制条件,导致空间稀疏,无法支持细粒度调制需求。为此,我们提出ConFusion,一种通过高斯条件空间感知调制学习连续融合空间的新颖框架,实现实例级细粒度可控红外与可见光图像融合。ConFusion采用双分支架构,在联合重建和文本引导语义对齐下分离模态不变和模态特定表示。高斯条件实例调制变量与基于Grounded SAM的实例掩码相结合,通过掩码引导特定特征调制器指导实例级细粒度调制,而文本驱动不变特征增强器提高语义一致性并增强融合。在推理过程中,多模态大语言模型将用户意图解析为实例级调制变量以指导图像融合。大量实验表明,ConFusion在融合质量和下游任务的多个指标上均实现了领先性能,同时支持细粒度可控图像融合。我们的代码可在该https网址获取。
英文摘要
Controllable infrared-visible image fusion aims to integrate complementary thermal and structural information with flexible region-aware modulation, producing fused images that adapt to diverse user requirements and downstream tasks. However, existing methods typically rely on predefined discrete control conditions, leading to a sparse space that fails to support fine-grained modulation demands. To address this, we propose ConFusion, a novel framework that learns the continuous fusion space via Gaussian-conditioned spatial-aware modulation, enabling instance-level fine-grained controllable infrared and visible image fusion. ConFusion employs a dual-branch architecture to disentangle modality-invariant and modality-specific representations under joint reconstruction and text-guided semantic alignment. Gaussian-conditioned instance modulation variables coupled with Grounded SAM-based instance masks guide instance-level fine-grained modulation through the Mask-Guided Specific Feature Modulator, while the Text-Driven Invariant Feature Enhancer improves semantic consistency and enhances fusion. During inference, the multimodal large language model parses user intents into instance-level modulation variables to guide image fusion. Extensive experiments show that ConFusion achieves state-of-the-art performance across multiple metrics in both fusion quality and downstream tasks, while supporting fine-grained controllable image fusion. Our code is available at https://github.com/HeyufeiAnto/Confusion
Comments10 pages, 5 figures