arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-01-14 至 2026-01-14 共收录 3 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 3 篇

2601.07856 2026-01-14 quant-ph cs.AI cs.LG 85%

Feature Entanglement-based Quantum Multimodal Fusion Neural Network

基于特征纠缠的量子多模态融合神经网络

Yu Wu, Qianli Zhou, Jie Geng, Xinyang Deng, Wen Jiang

专题命中 融合架构与评测 :multimodal fusion(title,abstract);feature-level fusion(abstract);decision-level fusion(abstract)

AI总结 本文提出基于特征纠缠的量子多模态融合神经网络,通过量子计算框架解决多模态学习中的精度、可解释性和复杂性矛盾,实现高效且可解释的多模态融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08240 2026-01-14 eess.IV cs.CV 62%

Temporal-Enhanced Interpretable Multi-Modal Prognosis and Risk Stratification Framework for Diabetic Retinopathy (TIMM-ProRS)

时间增强的可解释多模态预后和风险分层框架用于糖尿病视网膜病变(TIMM-ProRS)

Susmita Kar, A S M Ahsanul Sarkar Akib, Abdul Hasib, Samin Yaser, Anas Bin Azim

机构 * Department of Robotics, Robo Tech Valley, Dhaka, Bangladesh(机器人系,罗布科技谷,达卡,孟加拉国)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV、eess.IV

AI总结 TIMM-ProRS通过融合视网膜图像和时间生物标志物,实现糖尿病视网膜病变的多模态和时间动态分析,达到97.8%的准确率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08764 2026-01-14 cs.IR cs.SD eess.AS 50%

FusID: Modality-Fused Semantic IDs for Generative Music Recommendation

FusID: 多模态融合的语义ID用于生成音乐推荐

Haven Kim, Yupeng Hou, Julian McAuley

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 FusID通过多模态融合、表示学习和产品量化技术,解决生成音乐推荐中跨模态交互和ID冲突问题,提升推荐准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏