arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-01-15 至 2026-01-15 共收录 1 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 1 篇

2601.08868 2026-01-15 cs.CV cs.AI cs.RO 62%

Residual Cross-Modal Fusion Networks for Audio-Visual Navigation

残差跨模态融合网络用于音频视觉导航

Yi Wang, Yinfeng Yu, Bin Ren

机构 * School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院) Joint International Research Laboratory of Silk Road Multilingual Cognitive(丝绸之路多语认知联合国际实验室) School of Mechatronic Engineering and Automation Shanghai University, Shanghai, China(上海大学机电工程与自动化学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、cs.RO

AI总结 本文提出残差跨模态融合网络,通过双向残差交互实现音频视觉信息互补建模,提升跨域导航性能。

Comments Main paper (10 pages). Accepted for publication by the 14th international conference on Computational Visual Media (CVM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏