arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-01-12 至 2026-01-12 共收录 5 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2601.05538 2026-01-12 cs.CV 88%

DIFF-MF: A Difference-Driven Channel-Spatial State Space Model for Multi-Modal Image Fusion

DIFF-MF: 一种基于差分驱动的通道-空间状态空间模型用于多模态图像融合

Yiming Sun, Zifan Ye, Qinghua Hu, Pengfei Zhu

机构 * School of Automation, Southeast University(东南大学自动化学院) Low-Altitude Intelligence Lab, Xiong’an National Innovation Center Technology Co., Ltd.(雄安国家创新中心技术有限公司低空智能实验室) Xiong’an Guochuang Lantian Technology Co., Ltd.(雄安国创蓝天科技有限公司) School of Artificial Intelligence, Tianjin University(天津大学人工智能学院)

专题命中 通用Image Fusion :image fusion(title,abstract);multi-modal image fusion(title,abstract);分类 cs.CV

AI总结 DIFF-MF通过差分驱动的通道-空间状态空间模型,有效整合多模态图像信息,提升融合图像的质量和显著性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红外-可见光融合 1 篇

2411.12586 2026-01-12 cs.CV 70%

Infrared-Assisted Single-Stage Framework for Joint Restoration and Fusion of Visible and Infrared Images under Hazy Conditions

红外辅助单阶段框架用于雾中可见与红外图像的联合恢复与融合

Huafeng Li, Jiaqi Fang, Yafei Zhang, Yu Liu

机构 * Faculty of Information Engineering and Automation(信息工程与自动化学院) Key Laboratory of Artificial Intelligence in Yunnan Province(云南省人工智能重点实验室) School of Instrument Science and Opto-Electronic Engineering(仪器科学与光电工程学院)

专题命中 红外-可见光融合 :image fusion(abstract);infrared and visible(abstract);分类 cs.CV

AI总结 本文提出一种红外辅助单阶段框架,用于在雾条件下联合恢复和融合可见与红外图像,通过提示生成机制和多阶段融合模块实现高效去雾与融合。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人多传感器融合 1 篇

2510.22947 2026-01-12 eess.SP 88%

Intelligent Multimodal Multi-Sensor Fusion-Based UAV Identification, Localization, and Countermeasures for Safeguarding Low-Altitude Economy

智能多模多传感器融合-based无人机识别、定位与防护系统用于保障低空经济安全

Yi Tao, Zhen Gao, Fangquan Ye, Jingbo Xu, Tao Song, Weidong Li, Yu Su, Lu Peng, Xiaomei Wu, Tong Qin, Zhongxiang Li, Dezhi Zheng

专题命中 机器人多传感器融合 :sensor fusion(title,abstract);multi-sensor fusion(title,abstract);分类 eess.SP

AI总结 本文提出基于深度学习的多模多传感器融合系统,用于实现无人机的识别、定位与防护,提升低空经济安全防护效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 音视频/视觉语言融合 1 篇

2512.23243 2026-01-12 cs.CV 57%

Multimodal Interpretation of Remote Sensing Images: Dynamic Resolution Input Strategy and Multi-scale Vision-Language Alignment Mechanism

遥感图像的多模态解释:动态分辨率输入策略与多尺度视觉-语言对齐机制

Siyu Zhang, Lianlei Shan, Runhe Qiu

机构 * Tsinghua University(清华大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出动态分辨率输入策略与多尺度视觉-语言对齐机制,提升遥感图像多模态解释的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 融合架构与评测 1 篇

2505.14329 2026-01-12 cs.MM 57%

TF-Mamba: Text-enhanced Fusion Mamba with Missing Modalities for Robust Multimodal Sentiment Analysis

具有缺失模态的文本增强融合Mamba用于鲁棒多模态情感分析

Xiang Li, Xianfu Cheng, Dezhuang Miao, Xiaoming Zhang, Zhoujun Li

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.MM

AI总结 TF-Mamba通过文本增强融合框架,有效处理多模态情感分析中缺失模态的问题,提升模型鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏