arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2025-09-25 至 2025-09-25 共收录 1 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 1 篇

2509.19719 2025-09-25 cs.CV 74%

Frequency-domain Multi-modal Fusion for Language-guided Medical Image Segmentation

Bo Yu, Jianhua Yang, Zetao Du, Yan Huang, Chenglong Li, Liang Wang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院)

专题命中 音视频/视觉语言融合 :multi-modal fusion(title);分类 cs.CV

Comments Accepted by MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏