arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-08-25 至 2026-08-25 共收录 2 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 2 篇

2608.02092 2026-08-25 cs.CV cs.MM 版本更新 84%

Deep Multimodal Fusion Detection through Spatial Mask and Channel Competition

基于空间掩码与通道融合的深度多模态融合检测

Guandi Wang, Ming Li, Yunsen Xing, Junle Liu

机构 * KTH Royal Institute of Technology(KTH皇家理工学院) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 融合架构与评测 :multimodal fusion(title,abstract);feature-level fusion(abstract);分类 cs.CV、cs.MM

AI总结 本文针对现有多模态融合检测的过拟合问题,提出Attention-Driven Complementarity Resampling框架,通过语义掩码交换与可学习通道竞争实现跨模态目标检测的性能提升,在多数据集上取得了有竞争力的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21797 2026-08-25 cs.LG cs.AI cs.SD eess.AS 版本更新 78%

Mitigating Sample-Level Imbalance via Probabilistic Separation for Adaptive Multimodal Fusion

量化多模态不平衡:一种基于GMM的自适应损失用于音频-视觉学习

Zhiwen Yu, Zhaocheng Liu, Xiaoqing Liu, Huanqiang Zeng, C. L. Philip Chen

机构 * South China University of Technology(南方科技大学)

专题命中 融合架构与评测 :multimodal fusion(title,abstract)

AI总结 本文提出基于GMM的自适应损失,用于量化和缓解多模态学习中的样本级不平衡问题,通过双阶段框架提升音频-视觉学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏