Residual Cross-Modal Fusion Networks for Audio-Visual Navigation
残差跨模态融合网络用于音频视觉导航
机构 * School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院) ; Joint International Research Laboratory of Silk Road Multilingual Cognitive(丝绸之路多语认知联合国际实验室) ; School of Mechatronic Engineering and Automation Shanghai University, Shanghai, China(上海大学机电工程与自动化学院)
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出残差跨模态融合网络,通过双向残差交互实现音频视觉信息互补建模,提升跨域导航性能。
Comments Main paper (10 pages). Accepted for publication by the 14th international conference on Computational Visual Media (CVM 2026)