IJCV 2026 · 江南大学
摘要:本文提出了一种新颖的颜色信息驱动双任务并行网络 CRTFS,用于同时实现可见光-热红外图像融合 (IVIF) 与显著性目标检测 (SOD)。针对现有融合方法常导致颜色失真、削弱目标显著性的问题,CRTFS 通过端到端协同训练框架,结合从粗到细的色彩损失函数、跨任务特征交互机制(C2T 与 SGF 模块)以及创新的 Token Mixer 注意力,显著提升了融合图像的色彩保真度与 SOD 的检测精度。在多个基准数据集上的实验表明,该方法在 IVIF 和 SOD 任务上均达到先进水平,并验证了其在自动驾驶等下游任务中的实用价值。
颜色信息驱动的双任务并行网络用于可见光与热红外图像融合及显著性目标检测
A Color Information Driven Collaborative Training of Dual Task Parallel Network for Visible and Thermal Infrared Image Fusion and Saliency Object Detection
论文基本信息
📑 英文题目
A Color Information Driven Collaborative Training of Dual Task Parallel Network for Visible and Thermal Infrared Image Fusion and Saliency Object Detection
📑 中文题目
颜色信息驱动的双任务并行网络协同训练用于可见光与热红外图像融合及显著性目标检测
👥 作者
Zeyang Zhang¹, Hui Li¹, Tianyang Xu¹, Xiaojun Wu¹*, Muhammad Awais², Josef Kittler²
🏛️ 作者单位
¹ 江南大学人工智能与计算机学院,无锡,江苏,中国
² 萨里大学视觉、语音与信号处理中心 (CVSSP),英国
📅 发表信息
International Journal of Computer Vision (IJCV) 2026
💻 代码链接
https://github.com/Yukarizz/CRTFS
Part {贰} 摘要 & 创新点
研究背景与动机
颜色是人类视觉系统中至关重要的感知线索,机器视觉系统亦是如此。然而,现有图像融合算法通常直接继承可见光源图像的颜色通道,这往往导致融合图像出现严重的颜色失真,并削弱被感知目标的显著性。
💡 为克服这一限制,作者提出了一种新颖的颜色信息驱动双任务并行网络CRTFS,可同时实现可见光-热红外图像融合 (IVIF) 与显著性目标检测 (SOD)。
📌 【图 1 - 双任务任务差距与本文并行交互框架对比图】
主要创新点
- 01 端到端双任务并行网络
提出 CRTFS 网络,可同时学习 IVIF 和 SOD 任务,定量与定性实验均表明其在两项任务上都达到先进水平。
- 02 从粗到细的色彩损失函数
借鉴色彩感知科学,首次以两种形式注入颜色损失,构建从粗到细的色彩评估范式,显著提升融合图像的色彩保真度。
- 03 特征交互与协同训练机制
提出图像融合与显著性目标检测网络间的特征交换机制,通过创新的任务交互机制,实现两个任务相互增强、协同优化。
- 04 引入色度敏感评估指标
实验表明,本文方法在色度敏感指标 (色彩角相似度 C∠) 上取得了更优的色彩保真度。
Part {叁} 论文方法
3.1 协同优化建模
作者提出了一种新颖的优化框架,通过协同训练实现 SOD 和 IVIF 网络的相互增强。该框架在整个优化流程中引入色度信息,并支持两个网络之间的跨任务特征交互。从梯度动力学角度看,交互模块 (SGF 和 C2T) 作为可微分桥梁,使得两个网络的参数能够相互引导,避免陷入单任务的局部最优。
📌 【图 2 - 双任务协同优化损失曲面示意图】
3.2 CRTFS 整体框架
CRTFS 将三种模态作为输入:热红外图像、可见光图像 Y 通道、可见光图像 CbCr 通道。三个模态分别提取特征,并通过注意力机制进行融合。其中:
▸T2T 路径:负责显著性目标检测 (SOD),使用 ImageNet-1k 预训练的 T2T Encoder 作为分词器
▸CNN 路径:负责图像融合 (IVIF),保留丰富的细节信息
▸C2T 模块:将 CNN 特征转换为 Token 用于引导 SOD 任务
▸SGF 模块:利用 SOD 特征反向引导融合图像重建
📌 【图 3 - CRTFS 整体框架图(论文核心架构图)】
3.3 Tokens-to-Token (T2T) 处理
为解决 SOD 任务,CRTFS 采用 T2T 编码器对输入进行分词处理:T2T 通过软分割 (Soft Split) 操作合并相邻 Token 形成新 Token,实现降采样;RT2T 则通过将一个 Token 扩展为多个子 Token 实现升采样,最终输出高分辨率显著性图。
📌 【图 4 - T2T 与 RT2T 过程示意图】
3.4 跨模态像素特征融合 (CMPF)
CMPF 将彩色 IVIF 任务分解为两个阶段:先生成融合的像素强度特征,再进行色彩涂绘 (Color Painting)。模块包含强度特征强化、并行通道-空间注意力融合两个核心步骤,利用可见光与红外图像的互补性,采用 (1-ω) 互补权重机制实现高效融合。
📌 【图 5 - CMPF 模块详细结构图】
3.5 Token Mixer 注意力机制
Token Mixer 设计了同源增强和互补增强两条路径。同源增强用色彩特征作为 Query 增强模态内信息;考虑到红外与可见光模态的反相关特性,作者创新性地采用反向 Softmax (Re-Softmax) 算子用于互补特征增强,这是本文区别于标准交叉注意力的关键设计。
📌 【图 6 - Token Mixer 详细结构图】
3.6 互相增强机制 (C2T & SGF)
CRTFS 设置两个桥接模块连接 SOD 和 IVIF 路径:
📤 C2T 模块
将融合图像特征展平后与 Token 在通道维度拼接,通过线性投影和 LayerNorm 融合,为 SOD 任务提供丰富的外观线索。
📥 SGF 模块
将 RT2T 上采样过程的显著性信息注入融合特征,基于 Retinex 理论分别重建反射系数 R 和光照系数 L,最终融合结果 I_fuse = R ⊗ L。
📌 【图 7 - C2T 模块详细结构图】
3.7 从粗到细的色彩损失函数
本文损失函数体系包括 SOD 损失、融合损失和辅助梯度损失。其中色彩保留损失采用从粗到细的设计粗粒度上下文损失 L_CX:基于 VGG19 特征,稀疏、非对齐地评估局部特征与周围语义区域的相似性细粒度色彩角损失 L_cola:在 XYZ 色彩空间中按 CIE1931 定义,逐像素计算色彩向量夹角,提供细粒度的局部色彩偏差校正
Part {肆} 实验分析
4.1 数据集与实施细节
训练:VT5000 数据集 (5000 对严格对齐的可见光-热红外图像),2500 对用于训练,2500 对用于测试。
融合评估:LLVIP 数据集 (50 对低光照场景) + MSRS 数据集 (361 对自然场景)。
SOD 评估:VT1000、VT821 和 VT5000 三个基准数据集。
训练平台:Intel 12th i7 CPU + RTX 3090 GPU,优化器 AdamW,初始学习率 1e-4,共 30 个 epoch。
4.2 SOD 性能分析
CRTFS 在三个基准数据集上均达到 SOTA 性能。与 IRFS、CSRNet、LSNet、MIDD、IFENet、CPNet 等先进方法对比:
🏆 关键性能提升
▸VT821:F-measure 提升 +7.85%(噪声场景)
▸VT1000:F-measure 提升 +1.93%
▸VT5000:F-measure 提升 +4.44%
值得注意的是,在含有 57 对强噪声样本的 VT821 数据集上,CRTFS 表现出最显著的提升。在高斯噪声、合成雨、合成雾、散焦模糊等扰动下,CRTFS 平均性能下降仅3.5%📌 【此处放置:图 8 - SOD 二值分割可视化对比结果】
📌 【表 1 - 三个数据集上 SOD 性能对比表】
📌 【图 9 - F-measure、E-measure 及 PR 曲线对比】
4.3 自动驾驶下游任务收益
作者使用 Omni3D (3D 目标检测)、DepthAnythingV2 (深度估计) 和 UniDepth (点云重建) 在原始可见光图像和 CRTFS 融合图像上分别进行测试。BEV 视角图显示,融合图像在目标检测率和检测距离方面均显著优于原始可见光输入📌 【图 12 - 自动驾驶下游任务定性验证结果】
4.4 图像融合性能分析
在蓝色车牌、红色三轮车、红色横幅、绿色垃圾桶等典型彩色场景中,CRTFS 展现出强大的色彩保真能力:U2Fusion 出现整体灰雾失真;PSFusion 和 IRFS 在低光场景下三轮车颜色暗淡;DIVFusion 虽亮度高但色彩失真严重;DeFusion 在暗环境中近乎完全丢失色彩。
✨ 在 LLVIP 上拿下 6 项第一,在 MSRS 上拿下 5 项第一 + 1 项第二,Q_abf、SCD、FMI、MS_SSIM、Q_cv、C∠ 全面领先。
📌 【图 13 - 图像融合定性对比结果】
📌 【表 3 (LLVIP) 与 表 4 (MSRS) 定量评估结果】
4.5 色彩角度量 C∠ 的合理性
作者首次在 IVIF 任务中引入色彩角相似度 C∠,在 XYZ 色彩空间按 CIE1931 标准定义。通过对比局部放大图与 C∠ 数值发现:C∠ 值越小,融合图像与可见光图像间的色彩偏差越小,与人类色彩感知高度一致📌 【图 14 - XYZ 色彩空间向量 + 图 15 - 局部 C∠ 对比可视化】
4.6 消融实验
作者对 SOD 和 IVIF 两个分支的关键组件分别进行了消融:
🔬 SOD 分支消融发现
▸ 移除色彩先验导致性能显著下降 → 证明色彩先验对显著目标识别至关重要
▸ 移除协同训练 → 证明融合特征有助于提升显著目标的判别力
▸ Token Mixer 是性能保障的关键模块
🔬 IVIF 分支消融发现
▸ SOD 引导显著影响 Q_abf、Q_cv 视觉质量指标
▸ 色彩处理设计主要影响 C∠ 指标
▸ Retinex 理论分解光照与反射有效提升色彩保真度
📌 【图 11 - Token Mixer 注意力可视化热图】
📌 【图 16 - 消融实验融合结果对比 + 图 17 - SOD 引导前后特征热图】
Part {伍} 总结与展望
📌工作总结
本文提出了一个 SOD 与 IVIF 双任务模型 CRTFS,充分利用高层与底层视觉任务之间的交互关系。基于"色彩信息是人类判断目标显著性的重要依据"这一直觉,作者构建了色彩信息驱动的 SOD 模型与 IVIF 模型,并提出了一种新颖的交互机制,实现了两个模型的同时训练和特征交换。
实验结果表明,得益于相互增强的训练策略,SOD 和 IVIF 两个系统的性能均达到 SOTA。此外,针对现有 IVIF 方法忽视融合后图像强度成分会引发色彩失真这一问题,作者构思了色彩保真的图像融合生成与评估策略,在色彩处理方面取得显著改进。
🎯核心贡献
① 首次实现 IVIF 与 SOD 的双任务并行协同训练框架
② 提出色彩信息驱动机制和从粗到细的色彩损失
③ 设计 C2T 与 SGF 跨任务特征交互模块
④ 引入 C∠ 色彩角度量,提升色度敏感场景的评估准确性
🔭局限与未来工作
所提方法仍存在一些局限,如对可见光模态干扰较为敏感。未来作者计划:
▸ 针对模态干扰进行自适应调整
▸ 探索更鲁棒的多任务协作框架
▸ 推动图像融合更好地服务于高层视觉任务,提升机器感知的鲁棒性