arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2025-12-24 至 2025-12-24 共收录 2 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 多聚焦/多曝光融合 1 篇

2512.20556 2025-12-24 cs.CV 92%

Multi-Grained Text-Guided Image Fusion for Multi-Exposure and Multi-Focus Scenarios

多粒度文本引导图像融合用于多曝光和多聚焦场景

Mingwei Tang, Jiahao Nie, Guang Yang, Ziqing Cui, Jie Li

机构 * Xidian University(西安电子科技大学) Nanyang Technological University(新加坡国立大学) Xi’an University of Technology(西安理工大学)

专题命中 多聚焦/多曝光融合 :image fusion(title,abstract);multi-focus(title,abstract);multi-exposure(title,abstract);分类 cs.CV

AI总结 本文提出MTIF方法,通过多粒度文本描述和跨模态调节模块提升多曝光和多聚焦图像融合性能。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 融合架构与评测 1 篇

2512.20501 2025-12-24 cs.CV 57%

Bridging Modalities and Transferring Knowledge: Enhanced Multimodal Understanding and Recognition

弥合模态与知识转移:增强多模态理解和识别

Gorjan Radevski

机构 * University of Bristol(布里斯托大学) University of Würzburg(乌尔姆大学) Processing Speech and Images (PSI)(语音与图像处理组)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出多模态对齐、翻译、融合和转移方法,提升复杂输入的理解与识别能力,涵盖空间语言、医学文本、知识图谱和动作识别等多个领域。

Comments Ph.D. manuscript; Supervisors/Mentors: Marie-Francine Moens and Tinne Tuytelaars

详情

展开后加载摘要…

URL PDF HTML 收藏