arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-02-03 至 2026-02-03 共收录 17 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 遥感融合与全色锐化 3 篇

2602.01681 2026-02-03 eess.IV cs.CV cs.MM 82%

Hyperspectral Image Fusion with Spectral-Band and Fusion-Scale Agnosticism

多光谱图像融合与光谱波段及融合尺度无关性

Yu-Jie Liang, Zihan Cao, Liang-Jian Deng, Yang Yang, Malu Zhang

机构 * University of Electronic Science and Technology of China, School of Mathematical Sciences, Chengdu, China(电子科技大学数学学院) University of Electronic Science and Technology of China, Multi-Hazard Early Warning Key Laboratory of Sichuan Province, Chengdu, China(电子科技大学四川省多灾种早期预警重点实验室) University of Electronic Science and Technology of China, School of Computer Science and Engineering (School of Cyber Security), Chengdu, China(电子科技大学计算机科学与工程学院(网络安全学院))

专题命中 遥感融合与全色锐化 :image fusion(title,abstract);分类 cs.CV、eess.IV、cs.MM

AI总结 本文提出SSA框架,通过Matryoshka核和隐式神经表示实现光谱波段和融合尺度无关性,使单个模型能适应不同传感器和空间尺度,实现超光谱图像融合的高效泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00490 2026-02-03 cs.CV 74%

HSSDCT: Factorized Spatial-Spectral Correlation for Hyperspectral Image Fusion

HSSDCT:用于超分辨率图像融合的分解空间-光谱相关性

Chia-Ming Lee, Yu-Hao Ho, Yu-Fan Lin, Jen-Wei Lee, Li-Wei Kang, Chih-Chung Hsu

机构 * Institute of Data Science, National Cheng Kung University(国立云林大学资料科学研究所) Institute of Intelligent Systems, National Yang Ming Chiao Tung University(阳明交通大学智能系统研究所) Department of Electrical Engineering, National Taiwan Normal University(台湾师范大学电子工程系)

专题命中 遥感融合与全色锐化 :image fusion(title);分类 cs.CV

AI总结 HSSDCT通过分解空间和光谱依赖性,提出了一种高效的超光谱图像融合方法,实现了高重建质量与低计算成本。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01954 2026-02-03 cs.CV 57%

Beyond Open Vocabulary: Multimodal Prompting for Object Detection in Remote Sensing Images

超越开放词汇:面向遥感图像的目标检测多模态提示

Shuai Yang, Ziyue Huang, Jiaxin Chen, Qingjie Liu, Yunhong Wang

机构 * School of Computer Science and Engineering, Beihang University, Beijing, China(计算机科学与工程学院,北京航空航天大学,中国)

专题命中 遥感融合与全色锐化 :multimodal fusion(abstract);分类 cs.CV

AI总结 RS-MPOD提出了一种多模态开放词汇检测框架,通过整合视觉和文本提示提升遥感图像中目标检测的稳定性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 医学影像融合 1 篇

2602.00347 2026-02-03 cs.CV cs.AI 79%

AdaFuse: Adaptive Multimodal Fusion for Lung Cancer Risk Prediction via Reinforcement Learning

AdaFuse:基于强化学习的自适应多模态融合用于肺癌风险预测

Chongyu Qu, Zhengyi Lu, Yuxiang Lai, Thomas Z. Li, Junchao Zhu, Junlin Guo, Juming Xiong, Yanfan Zhu, Yuechen Yang, Allen J. Luna, Kim L. Sandler, Bennett A. Landman, Yuankai Huo

机构 * Vanderbilt University(范德比尔特大学) Vanderbilt University Medical Center(范德比尔特大学医学中心) Emory University(埃默里大学)

专题命中 医学影像融合 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 AdaFuse利用强化学习实现自适应多模态融合,通过动态选择和融合模态提升肺癌风险预测的AUC性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人多传感器融合 3 篇

2602.00152 2026-02-03 cs.CV cs.AI eess.SP 76%

Real-Time Human Activity Recognition on Edge Microcontrollers: Dynamic Hierarchical Inference with Multi-Spectral Sensor Fusion

边缘微控制器上的实时人类活动识别:基于多光谱传感器融合的动态分层推理

Boyu Li, Kuangji Zuo, Lincong Li, Yonghui Wu

专题命中 机器人多传感器融合 :sensor fusion(title);分类 cs.CV、eess.SP

AI总结 HPPI-Net通过多光谱传感器融合和分层推理实现边缘微控制器上的实时人类活动识别,提升准确率并降低资源消耗。

Comments 24 pages, 6 figures. The manusrcipt is under review at Measurement

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04356 2026-02-03 cs.RO cs.AI cs.CV 62%

UNIC: Learning Unified Multimodal Extrinsic Contact Estimation

UNIC: 学习统一的多模态外在接触估计

Zhengtong Xu, Yuki Shirai

机构 * Edwardson School of Industrial Engineering, Purdue University(帕克大学工业工程学院) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.CV、cs.RO

AI总结 UNIC通过统一多模态框架实现无需先验知识的外在接触估计,提升手部操作的鲁棒性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01832 2026-02-03 cs.AI 50%

Synesthesia of Vehicles: Tactile Data Synthesis from Visual Inputs

车辆的联觉:从视觉输入合成触觉数据

Rui Wang, Yaoguang Cao, Yuyi Chen, Jianyi Xu, Zhuoyang Li, Jiachen Shang, Shichun Yang

机构 * Dept. of Transportation Science, Beihang Univ.(北京航空航天大学交通运输科学系) State Key Lab of Intelligent Transportation System, Beihang Univ.(北京航空航天大学智能交通系统国家重点实验室) Hangzhou International Innovation Institute, Beihang Univ.(杭州国际创新研究院) China Software Testing Center(Ministry of Industry and Information Technology Software and Integrated Circuit Promotion Center)(中国软件测试中心(工业和信息化部软件与集成电路促进中心))

专题命中 机器人多传感器融合 :multi-modal fusion(abstract)

AI总结 本文提出基于视觉输入的触觉数据合成方法,通过跨模态时空对齐和潜在扩散模型提升自动驾驶车辆的触觉感知能力,从而增强安全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 音视频/视觉语言融合 3 篇

2602.00701 2026-02-03 cs.MM cs.CV cs.LG cs.SD 73%

Cross-Modal Binary Attention: An Energy-Efficient Fusion Framework for Audio-Visual Learning

跨模态二进制注意力:面向音频视觉学习的高效融合框架

Mohamed Saleh, Zahra Ahmadi

机构 * Peter L. Reichertz Institute for Medical Informatics of TU Braunschweig and Hannover Medical School(图林根工业大学和汉诺威医学院医学信息学研究所) Lower Saxony Center for AI and Causal Methods in Medicine (CAIMed)(下萨克森人工智能与因果医学方法中心)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);audio-visual fusion(abstract);分类 cs.CV、cs.MM

AI总结 提出CMQKA和SNNergy,通过高效二进制操作实现线性复杂度的跨模态融合,显著提升音频视觉任务的能耗效率和性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00570 2026-02-03 cs.CV 57%

GLAD: Generative Language-Assisted Visual Tracking for Low-Semantic Templates

GLAD: 生成式语言辅助低语义模板视觉跟踪

Xingyu Luo, Yidong Cai, Jie Liu, Jie Tang, Gangshan Wu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室)

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 GLAD通过生成式多模态融合提升低语义模板视觉跟踪性能,实现更高效的多模态特征融合与语义增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00914 2026-02-03 cs.CL cs.AI cs.CY cs.SD eess.AS 50%

A Baseline Multimodal Approach to Emotion Recognition in Conversations

一种用于对话中情感识别的基线多模态方法

Víctor Yeste, Rodrigo Rivas-Arévalo

机构 * School of Science, Engineering and Design, Universidad Europea de Valencia(科学、工程与设计学院,欧洲大学 Valencia)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本文提出了一种基于Transformer文本分类器和自监督语音模型的多模态基线方法,用于对话中情感识别,并通过实验展示了多模态融合的优势。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 融合架构与评测 7 篇

2602.01060 2026-02-03 cs.SD cs.AI eess.AS 71%

TLDiffGAN: A Latent Diffusion-GAN Framework with Temporal Information Fusion for Anomalous Sound Detection

TLDiffGAN:一种结合时间信息融合的扩散-生成对抗网络框架用于异常声音检测

Chengyuan Ma, Peng Jia, Hongyue Guo, Wenming Yang

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) Collaborative Innovation Center for Transport Studies, Dalian Maritime University, China(大连海事大学交通运输协同创新中心)

专题命中 融合架构与评测 :information fusion(title)

AI总结 TLDiffGAN通过结合潜在扩散模型与预训练音频编码器,提升异常声音检测的准确性和时间频率定位能力。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01974 2026-02-03 eess.SP 70%

Obstacle Detection at Level Crossings under Adverse Weather Conditions -- A Survey

恶劣天气条件下铁路道口障碍物检测——综述

Chenyang Yan, Mats Bengtsson

专题命中 融合架构与评测 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 eess.SP

AI总结 本文综述了恶劣天气下铁路道口障碍物检测的传感器技术和融合策略,分析了各传感器的优缺点及应对措施,提出未来研究方向以提升检测系统的可靠性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01447 2026-02-03 cs.CL cs.AI 67%

SentiFuse: Deep Multi-model Fusion Framework for Robust Sentiment Extraction

SentiFuse:一种用于鲁棒情感提取的深度多模型融合框架

Hieu Minh Duong, Rupa Ghosh, Cong Hoan Nguyen, Eugene Levin, Todd Gary, Long Nguyen

机构 * University of Louisville(路易斯维尔大学) Meharry Medical College(梅哈里医学院)

专题命中 融合架构与评测 :feature-level fusion(abstract);decision-level fusion(abstract)

AI总结 SentiFuse通过多模型融合框架提升情感提取的鲁棒性和准确性,特征级融合在F1分数上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00107 2026-02-03 cs.CV cs.RO eess.IV 67%

Efficient UAV trajectory prediction: A multi-modal deep diffusion framework

高效无人机轨迹预测:一种多模态深度扩散框架

Yuan Gao, Xinyu Guo, Wenjing Xie, Zifan Wang, Hongwen Yu, Gongyang Li, Shugong Xu

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV、eess.IV、cs.RO

AI总结 本文提出一种多模态深度融合框架,通过融合激光雷达和毫米波雷达数据提升无人机轨迹预测精度,实验显示其比基线模型提升40%。

Comments in Chinese language

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00696 2026-02-03 eess.SP 57%

CMANet: Channel-Masked Attention Network for Cooperative Multi-Base-Station 3D Positioning

CMANet:基于合作多基站3D定位的通道掩码注意力网络

Tong An, Huan Lu, Jiayang Shi, Kai Yu, Rongrong Zhu, Bin Zheng, Jiwei Zhao, Haibo Zhou

专题命中 融合架构与评测 :feature-level fusion(abstract);分类 eess.SP

AI总结 CMANet通过通道掩码注意力机制和轻量级LSTM解码器实现多基站协作的高精度3D定位,实验显示其在城市环境中具有优于现有方法的定位精度。

Comments 6pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00102 2026-02-03 eess.IV cs.AI cs.LG 57%

Radiomics in Medical Imaging: Methods, Applications, and Challenges

医学影像中的放射组学:方法、应用与挑战

Fnu Neha, Deepak kumar Shukla

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.IV

AI总结 本文系统分析了放射组学的全流程,探讨了特征稳定性、模型可靠性及临床转化有效性,并提出了标准化、领域转移和临床部署等未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00561 2026-02-03 cs.AI 50%

Uncovering Latent Communication Patterns in Brain Networks via Adaptive Flow Routing

通过自适应流路由揭示脑网络中的潜在通信模式

Tianhao Huang, Guanghui Min, Zhenyu Lei, Aiying Zhang, Chen Chen

机构 * University of Virginia(弗吉尼亚大学)

专题命中 融合架构与评测 :multi-modal fusion(abstract)

AI总结 本文提出AFR-Net,通过神经通信动态视角融合SC和FC,揭示潜在神经通路,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏