arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2025-12-02 至 2025-12-02 共收录 10 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2508.08679 2025-12-02 cs.CV cs.AI 88%

MMIF-AMIN: Adaptive Loss-Driven Multi-Scale Invertible Dense Network for Multimodal Medical Image Fusion

MMIF-AMIN: 适应性损失驱动的多尺度可逆密集网络用于多模态医学图像融合

Tao Luo, Weihua Xu

专题命中 通用Image Fusion :image fusion(title,abstract);medical image fusion(title,abstract);分类 cs.CV

AI总结 MMIF-AMIN通过可逆密集网络和多尺度互补特征提取模块,实现多模态医学图像融合的高效融合与精准诊断。

Comments This manuscript is withdrawn to allow for substantial expansion and restructuring. Based on recent research progress, we plan to add Generalization experiment and reorganize the manuscript structure to improve readability and logical flow. Thank you for your understanding and support

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 遥感融合与全色锐化 2 篇

2508.00453 2025-12-02 cs.CV 79%

PIF-Net: Ill-Posed Prior Guided Multispectral and Hyperspectral Image Fusion via Invertible Mamba and Fusion-Aware LoRA

PIF-Net:基于可逆Mamba和融合感知LoRA的多光谱与高光谱图像融合

Baisong Li, Xingwang Wang, Haixiao Xu

专题命中 遥感融合与全色锐化 :image fusion(title,abstract);分类 cs.CV

AI总结 PIF-Net通过可逆Mamba和融合感知LoRA模块,有效解决多光谱与高光谱图像融合中的病态问题,实现高质量图像恢复与高效模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00363 2025-12-02 cs.CV 57%

MM-DETR: An Efficient Multimodal Detection Transformer with Mamba-Driven Dual-Granularity Fusion and Frequency-Aware Modality Adapters

MM-DETR: 一种高效的多模态检测Transformer,采用Mamba驱动的双粒度融合和频率感知模态适配器

Jianhong Han, Yupei Wang, Yuan Zhang, Liang Chen

机构 * School of Information and Electronics, Beijing Institute of Technology(信息与电子学院,北京理工大学) Beijing Institute of Technology Chongqing Innovation Center(北京理工大学重庆创新中心) National Key Laboratory for Space-Born Intelligent Information Processing(空间智能信息处理国家级重点实验室) School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学)

专题命中 遥感融合与全色锐化 :multimodal fusion(abstract);分类 cs.CV

AI总结 MM-DETR通过Mamba驱动的双粒度融合和频率感知模态适配器,实现高效的多模态目标检测,提升检测精度与轻量化性能。

Comments Manuscript submitted to IEEE Transactions on Geoscience and Remote Sensing

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 医学影像融合 1 篇

2508.20469 2025-12-02 q-bio.QM cs.CV 57%

Prediction of Distant Metastasis in Head and Neck Cancer Patients Using Tumor and Peritumoral Multi-Modal Deep Learning

利用肿瘤及周围多模态深度学习预测头颈癌患者远端转移

Nuo Tong, Changhao Liu, Zizhao Tang, Feifan Sun, Yingping Li, Shuiping Gou, Mei Shi

专题命中 医学影像融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本研究提出多模态深度学习模型,结合CT影像、放射组学和临床数据,用于预测头颈癌患者远端转移风险,通过多模态融合显著提高预测性能。

Comments 23 pages, 6 figures, 7 tables. Nuo Tong and Changhao Liu contributed equally. Corresponding Authors: Shuiping Gou and Mei Shi

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人多传感器融合 1 篇

2512.01778 2025-12-02 eess.SP cs.IT cs.NI math.IT 57%

Secure Over-the-Air Computation Against Multiple Eavesdroppers using Correlated Artificial Noise

对抗多个窃听者的安全空中计算使用相关人工噪声

David Nordlund, Luis Maßny, Antonia Wachter-Zeh, Erik G. Larsson, Zheng Chen

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 eess.SP

AI总结 本文提出了一种零强迫人工噪声设计,以提高对抗多个协作窃听者的空中计算安全性,同时保持聚合精度。

Comments 13 pages, 9 figures, submitted for possible journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 音视频/视觉语言融合 1 篇

2512.01636 2025-12-02 cs.CV 57%

Generative Editing in the Joint Vision-Language Space for Zero-Shot Composed Image Retrieval

联合视觉-语言空间中的生成编辑用于零样本复合图像检索

Xin Wang, Haipeng Zhang, Mang Li, Zhaohui Xia, Yueguo Chen, Yu Zhang, Chunyu Wei

机构 * Renmin University of China(中国人民大学) Alibaba Group(阿里巴巴集团)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 Fusion-Diff通过联合视觉-语言空间中的生成编辑策略,实现了高效的零样本复合图像检索,提升了多模态对齐的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 融合架构与评测 4 篇

2512.01750 2025-12-02 eess.SP cs.LG 57%

Multimodal Mixture-of-Experts for ISAC in Low-Altitude Wireless Networks

多模态专家混合模型用于低空无线网络中的ISAC

Kai Zhang, Wentao Yu, Hengtao He, Shenghui Song, Jun Zhang, Khaled B. Letaief

机构 * IEEE

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.SP

AI总结 本文提出了一种多模态专家混合模型,用于提升低空无线网络中ISAC的性能,通过自适应融合策略提高环境感知和通信效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01519 2025-12-02 cs.CV cond-mat.mtrl-sci quant-ph 57%

QuantumCanvas: A Multimodal Benchmark for Visual Learning of Atomic Interactions

QuantumCanvas:一种用于原子相互作用视觉学习的多模态基准

Can Polat, Erchin Serpedin, Mustafa Kurban, Hasan Kurban

机构 * Texas A&M University(德克萨斯大学) Ankara University(安卡拉大学) Texas A&M University at Qatar(德克萨斯大学(卡塔尔)) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 QuantumCanvas通过多模态基准统一轨道物理与视觉表示学习,为学习可转移的量子相互作用提供了系统且可解释的基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01882 2025-12-02 cs.LG 50%

New Spiking Architecture for Multi-Modal Decision-Making in Autonomous Vehicles

多模态决策中自动驾驶车辆的新脉冲架构

Aref Ghoreishee, Abhishek Mishra, Lifeng Zhou, John Walsh, Nagarajan Kandasamy

机构 * Electrical and Computer Engineering Department(电子与计算机工程系)

专题命中 融合架构与评测 :multi-modal fusion(abstract)

AI总结 本文提出了一种基于脉冲神经元的高效多模态决策架构,用于提升自动驾驶车辆的实时决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00563 2025-12-02 cs.SD cs.AI cs.LG 50%

Explainable Multi-Modal Deep Learning for Automatic Detection of Lung Diseases from Respiratory Audio Signals

可解释的多模态深度学习用于从呼吸音频信号自动检测肺部疾病

S M Asiful Islam Saky, Md Rashidul Islam, Md Saiful Arefin, Shahaba Alam

机构 * Albukhary International University(阿尔布胡亚国际大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本研究提出一种可解释的多模态深度学习框架,通过结合频谱-时间编码器和手工制作的声学特征编码器,利用呼吸音频信号自动检测肺部疾病,实现了高准确率和良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏