arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2025-12-12 至 2025-12-12 共收录 3 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 2 篇

2411.10036 2025-12-12 cs.CV cs.AI 89%

Rethinking Normalization Strategies and Convolutional Kernels for Multimodal Image Fusion

重新思考归一化策略和卷积核在多模态图像融合中的作用

Dan He, Guofen Wang, Weisheng Li, Yucheng Shu, Wenbo Li, Lijian Yang, Yuping Huang, Feiyan Li

机构 * Chongqing University of Posts and Telecommunications(重庆邮电大学) Chongqing Normal University(重庆师范大学)

专题命中 通用Image Fusion :image fusion(title,abstract);multimodal image fusion(title,abstract);information fusion(abstract);分类 cs.CV

AI总结 本文提出了一种改进的UNet架构,通过混合实例和组归一化以及多路径自适应融合模块,提升多模态图像融合的性能和细节保留能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04519 2025-12-12 cs.CV 88%

l0-Regularized Sparse Coding-based Interpretable Network for Multi-Modal Image Fusion

基于l0正则化稀疏编码的可解释网络用于多模态图像融合

Gargi Panda, Soumitra Kundu, Saumik Bhattacharya, Aurobinda Routray

机构 * Department of EE, IIT Kharagpur, India(印度IIT Kharagpur电子工程系) Rekhi Centre of Excellence for the Science of Happiness, IIT Kharagpur, India(印度IIT Kharagpur幸福科学卓越中心) Department of E&ECE, IIT Kharagpur, India(印度IIT Kharagpur电子工程与电子学系)

专题命中 通用Image Fusion :image fusion(title,abstract);multi-modal image fusion(title,abstract);分类 cs.CV

AI总结 本文提出基于l0正则化稀疏编码的可解释网络FNet,用于多模态图像融合,通过分离独特和共同特征提升融合质量并增强下游任务性能。

Comments Accetped by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音视频/视觉语言融合 1 篇

2512.10376 2025-12-12 cs.CV 57%

RaLiFlow: Scene Flow Estimation with 4D Radar and LiDAR Point Clouds

RaLiFlow: 基于4D雷达和激光雷达点云的场景流估计

Jingyun Fu, Zhiyu Xiang, Na Zhao

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 RaLiFlow是首个联合4D雷达和激光雷达的场景流学习框架,通过动态感知双向跨模态融合模块和精心设计的损失函数实现高效的雷达-激光雷达融合。

Comments Accepted by AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏