arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2025-11-21 至 2025-11-21 共收录 4 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 1 篇

2511.16184 2025-11-21 cs.CV 79%

Domain-Shared Learning and Gradual Alignment for Unsupervised Domain Adaptation Visible-Infrared Person Re-Identification

领域共享学习与渐进对齐用于无监督领域适应的可见-红外人员重识别

Nianchang Huang, Yi Xu, Ruida Xi, Ruida Xi, Qiang Zhang

机构 * State Key Laboratory of Electromechanical Integrated Manufacturing of High-Performance Electronic Equipments, Xidian University, Xi’an, Shaanxi 710071, China(高性能电子装备机电一体化制造国家重点实验室,西安电子科技大学,陕西西安710071,中国) Center for Complex Systems, School of Mechano-Electronic Engineering, Xidian University, Xi’an, Shaanxi 710071, China(复杂系统中心,机电工程学院,西安电子科技大学,陕西西安710071,中国)

专题命中 红外-可见光融合 :visible-infrared(title,abstract);分类 cs.CV

AI总结 本文提出DSLGA模型,通过领域共享学习和渐进对齐策略解决可见-红外人员重识别中的领域间和领域内模态差异问题,提升无监督领域适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 遥感融合与全色锐化 1 篇

2508.07369 2025-11-21 cs.CV 79%

Training and Inference within 1 Second -- Tackle Cross-Sensor Degradation of Real-World Pansharpening with Efficient Residual Feature Tailoring

在1秒内训练和推理——通过高效残差特征定制应对现实世界 pansharpening 的跨传感器退化

Tianyu Xin, Jin-Liang Xiao, Zeyu Xia, Shan Yin, Liang-Jian Deng

专题命中 遥感融合与全色锐化 :pansharpening(title,abstract);分类 cs.CV

AI总结 通过高效残差特征定制方法,在1秒内实现跨传感器退化处理的高效训练和推理。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 音视频/视觉语言融合 1 篇

2508.19390 2025-11-21 eess.SP 57%

Depression diagnosis from patient interviews using multimodal machine learning

基于多模态机器学习的抑郁症诊断

Jana Weber, Marcel Weber, Juan Miguel Lopez Alcaraz

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 eess.SP

AI总结 本研究通过多模态机器学习整合语音、语言和临床信息,提升抑郁症诊断的准确性与临床实用性。

Comments Accepted by Frontiers in Psychiatry, 19 pages, 5 figures, source code under https://github.com/UOLMDA2025/Depression

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 融合架构与评测 1 篇

2510.22946 2025-11-21 cs.CV 57%

LightFusion: A Light-weighted, Double Fusion Framework for Unified Multimodal Understanding and Generation

LightFusion: 一种轻量级、双融合框架用于统一多模态理解和生成

Zeyu Wang, Zilong Chen, Chenhui Gou, Feng Li, Chaorui Deng, Deyao Zhu, Kunchang Li, Weihao Yu, Haoqin Tu, Haoqi Fan, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克ruz分校) Tsinghua University(清华大学) Monash University(墨尔本大学) ByteDance Seed Project(字节跳动种子项目)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 LightFusion通过双融合机制实现轻量级多模态理解和生成,仅用350亿个标记训练即在多个基准测试中取得优异成绩。

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏