arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-02-11 至 2026-02-11 共收录 3 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2507.04397 2026-02-11 cs.CV 70%

Multi-Expert Learning Framework with the State Space Model for Optical and SAR Image Registration

多专家学习框架与状态空间模型用于光学和SAR图像配准

Wei Wang, Dou Quan, Ning Huyan, Chonghua Lv, Shuang Wang, Yunan Li, Licheng Jiao

机构 * Key Laboratory of Intelligent Perception and Image Understanding of Ministry of Education of China(教育部智能感知与图像理解重点实验室) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州学院) School of Computer Science, Xidian University(西安电子科技大学计算机学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 通用Image Fusion :image fusion(abstract);multi-modal image fusion(abstract);分类 cs.CV

AI总结 本文提出ME-SSM框架,通过多专家学习和状态空间模型提升光学与SAR图像配准的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音视频/视觉语言融合 1 篇

2602.09294 2026-02-11 cs.CE 50%

BrainTAP: Brain Disorder Prediction with Adaptive Distill and Selective Prior Integration

BrainTAP: 基于自适应蒸馏和选择性先验整合的脑部疾病预测

Zhenyu Lei, Aiying Zhang, Song Wang, Han Fan, Jundong Li

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 BrainTAP通过自适应蒸馏和选择性先验整合,提升脑部疾病预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 融合架构与评测 1 篇

2602.10023 2026-02-11 cs.CL 50%

MEVER: Multi-Modal and Explainable Claim Verification with Graph-based Evidence Retrieval

MEVER:基于图的证据检索的多模态和可解释性声明验证

Delvin Ce Zhang, Suhan Cui, Zhelin Chu, Xianren Zhang, Dongwon Lee

机构 * University of Sheffield(谢菲尔德大学) University of Science and Technology Beijing(北京科技大学) University of California San Diego(加州大学圣地亚哥分校) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 融合架构与评测 :multi-modal fusion(abstract)

AI总结 MEVER通过多模态图检索和解释生成,实现了准确且可解释的声明验证,同时创建了AI领域的科学数据集AIChartClaim。

Comments Accepted to EACL-26

详情

展开后加载摘要…

URL PDF HTML 收藏