arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-03-02 至 2026-03-02 共收录 9 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2409.01728 2026-03-02 cs.CV 88%

Shuffle Mamba: State Space Models with Random Shuffle for Multi-Modal Image Fusion

Shuffle Mamba:基于随机洗牌的态空间模型用于多模态图像融合

Ke Cao, Xuanhua He, Tao Hu, Chengjun Xie, Man Zhou, Jie Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Intelligent Machines(智能机器研究所) Hefei Institutes of Physical Science, Chinese Academy of Sciences(中国科学院合肥物质科学研究院) Intelligent Agriculture Engineering Laboratory of Anhui Province, Institute of Intelligent Machines(安徽省智能农业工程实验室,智能机器研究所)

专题命中 通用Image Fusion :image fusion(title,abstract);multi-modal image fusion(title,abstract);分类 cs.CV

AI总结 Shuffle Mamba通过引入随机洗牌策略和逆洗牌,解决多模态图像融合中固定扫描策略带来的偏见问题,提升融合质量。

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人多传感器融合 1 篇

2602.24011 2026-03-02 cs.RO 57%

Autonomous Inspection of Power Line Insulators with UAV on an Unmapped Transmission Tower

无人机自主检查输电塔绝缘子

Václav Riss, Vít Krátký, Robert Pěnička, Martin Saska

机构 * Czech Science Foundation(捷克科学基金) European Union(欧盟)

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.RO

AI总结 本文提出了一种基于摄像头和激光雷达融合的无人机自主检查输电塔绝缘子方法,通过仿真和实际飞行验证,显著提高了定位精度并节省了检查时间。

Comments 8 pages, 9 figues

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 音视频/视觉语言融合 2 篇

2602.23862 2026-03-02 cs.HC 78%

Human-Centered Multimodal Fusion for Sexism Detection in Memes with Eye-Tracking, Heart Rate, and EEG Signals

以人类为中心的多模态融合用于表情包中性别歧视检测:结合眼动追踪、心率和EEG信号

Iván Arcos, Paolo Rosso, Elena Gomis-Vicent

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)

AI总结 本文提出了一种结合眼动追踪、心率和EEG信号的多模态融合模型,用于更准确地检测表情包中的性别歧视。

Comments Accepted to appear in the Proceedings of LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23994 2026-03-02 cs.LG cs.AI cs.CV 57%

MINT: Multimodal Imaging-to-Speech Knowledge Transfer for Early Alzheimer's Screening

MINT:多模态影像到语音知识迁移用于早期阿尔茨海默病筛查

Vrushank Ahire, Yogesh Kumar, Anouck Girard, M. A. Ganaie

机构 * Department of CSE, Indian Institute of Technology Ropar(印度理工学院罗帕尔计算机科学与工程系) Embry-Riddle Aeronautical University(埃姆布里-瑞尔德航空大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 MINT通过多模态知识迁移,利用MRI生物标志物提升语音识别的阿尔茨海默病早期筛查性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 融合架构与评测 5 篇

2506.17966 2026-03-02 cs.IR cs.CV 79%

LLM-Enhanced Multimodal Fusion for Cross-Domain Sequential Recommendation

基于大语言模型的跨域序列推荐多模态融合

Wangyu Wu, Zhenhong Chen, Wenqiao Zhang, Xianglin Qiu, Siqi Song, Xiaowei Huang, Fei Ma, Jimin Xiao

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学) Microsoft(微软公司) Zhejiang University(浙江大学)

专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 本文提出LLM-EMF方法,通过融合视觉和文本数据提升跨域序列推荐性能,利用CLIP模型生成多模态嵌入并引入多重注意力机制,实验证明其在多领域推荐中的有效性。

Comments arXiv admin note: substantial text overlap with arXiv:2504.15085

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23699 2026-03-02 cs.CV cs.CL 57%

HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit

HiDrop:通过晚期注入、凹形金字塔剪枝和早期退出实现MLLM中的层次视觉令牌减少

Hao Wu, Yingqi Fan, Jinyang Dai, Junlong Tong, Yunpu Ma, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究所,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Munich Center for Machine Learning, LMU Munich(慕尼黑大学机器学习中心,慕尼黑大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 HiDrop通过晚期注入、凹形金字塔剪枝和早期退出机制,实现多模态大语言模型中视觉令牌的高效减少,提升训练效率并保持性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23614 2026-03-02 cs.LG cs.AI 50%

When Does Multimodal Learning Help in Healthcare? A Benchmark on EHR and Chest X-Ray Fusion

多模态学习在医疗领域何时有助于提升性能?基于电子健康记录与胸部X光融合的基准测试

Kejing Yin, Haizhou Xu, Wenfang Yao, Chen Liu, Zijie Chen, Yui Haang Cheung, William K. Cheung, Jing Qin

机构 * Department of Computer Science(计算机科学系) Hong Kong Baptist University(香港 Baptist 大学) Division of Artificial Intelligence(人工智能 division) Lingnan University(Lingnan 大学) School of Nursing(护理学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文通过基准测试评估了电子健康记录与胸部X光融合在医疗中的有效性,揭示了多模态学习在不同模态缺失情况下的性能差异及公平性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22294 2026-03-02 cs.LG 50%

When Should a Model Change Its Mind? An Energy-Based Theory and Regularizer for Concept Drift in Electrocardiogram (ECG) Signals

模型何时应改变观点?一种基于能量的理论和正则化器用于心电图(ECG)信号中的概念漂移

Timothy Oladunni, Blessing Ojeme, Kyndal Maclin, Clyde Baidoo

机构 * Department of Computer Science, Morgan State University(计算机科学系,莫根州立大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本研究提出Physiologic Energy Conservation Theory (PECT)和Energy-Constrained Representation Learning (ECRL),用于在ECG信号中稳定概念,通过能量守恒原理减少误判和漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19955 2026-03-02 cs.IR 50%

Multimodal-enhanced Federated Recommendation: A Group-wise Fusion Approach

多模态增强的联邦推荐:一种组级融合方法

Chunxu Zhang, Weipeng Zhang, Guodong Long, Zhiheng Xue, Riting Xia, Bo Yang

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文提出了一种多模态增强的联邦推荐方法,通过组级融合机制提升推荐系统在多模态特征整合方面的性能。

Comments Accepted at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏