arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-03-03 至 2026-03-03 共收录 3 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 3 篇

2603.01536 2026-03-03 cs.IR cs.MM 57%

CLEAR: Null-Space Projection for Cross-Modal De-Redundancy in Multimodal Recommendation

CLEAR: 多模态去冗余中的跨模态空域投影

Hao Zhan, Yihui Wang, Yonghui Yang, Danyang Yue, Yu Wang, Pengyang Shao, Fei Shen, Fei Liu, Le Wu

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM

AI总结 CLEAR通过显式减少跨模态冗余提升多模态推荐性能,采用子空间投影方法增强表示学习动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01382 2026-03-03 cs.SD cs.CL 50%

End-to-End Simultaneous Dysarthric Speech Reconstruction with Frame-Level Adaptor and Multiple Wait-k Knowledge Distillation

端到端的同时口吃语音重建与帧级适配模块及多视图知识蒸馏

Minghui Wu, Haitao Tang, Jiahuan Fan, Ruizhi Liao, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) iFlytek Co., Ltd.(科大讯飞股份有限公司)

专题命中 音视频/视觉语言融合 :information fusion(abstract)

AI总结 本文提出端到端的同时口吃语音重建系统,通过帧级适配模块和多视图知识蒸馏模块,提升重建语音的鲁棒性和可懂度。

Comments Submitted to 2025 Asia Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC)

Journal ref 2025 Asia Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC), Singapore, 2025, pp. 1092-1097

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22961 2026-03-03 eess.AS 50%

Adapting Speech Foundation Models for Unified Multimodal Speech Recognition with Large Language Models

为统一多模态语音识别适应语音基础模型与大语言模型

Jing-Xuan Zhang, Genshun Wan, Jin Li, Jianqing Gao, Duo Zhao, Zhen-Hua Ling

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本文提出UASR-LLM框架,通过大语言模型与语音基础模型结合,实现多模态语音识别的统一优化与性能提升。

Comments 10 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏