arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-01-27 至 2026-01-27 共收录 13 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 遥感融合与全色锐化 2 篇

2601.17342 2026-01-27 cs.CV 57%

STARS: Shared-specific Translation and Alignment for missing-modality Remote Sensing Semantic Segmentation

STARS: 共享-特定翻译与对齐用于缺失模态遥感语义分割

Tong Wang, Xiaodong Zhang, Guanzhou Chen, Jiaqi Wang, Chenxi Liu, Xiaoliang Tan, Wenchao Guo, Xuyang Li, Xuanrui Wang, Zifan Wang

机构 * State Key Laboratory of information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(测绘遥感信息工程国家重点实验室,武汉大学) Electronic Information School, Wuhan University(电子信息学院,武汉大学) Hubei FreerTech Co. Ltd(湖北弗瑞特科技有限公司)

专题命中 遥感融合与全色锐化 :multimodal fusion(abstract);分类 cs.CV

AI总结 STARS通过共享-特定翻译与对齐机制,解决多模态遥感中缺失模态带来的语义分割问题,提升鲁棒性和类别识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23118 2026-01-27 cs.CV 57%

Quantizing Space and Time: Fusing Time Series and Images for Earth Observation

量化空间与时间:融合时间序列和图像用于地球观测

Gianfranco Basile, Johannes Jakubik, Benedikt Blumenstiel, Thomas Brunschwiler, Juan Bernabe Moreno

机构 * IBM Research Europe(IBM欧洲研究院) ETH Zürich(苏黎世联邦理工学院)

专题命中 遥感融合与全色锐化 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出一种任务无关的多模态融合框架,通过时间序列和图像的统一表示空间提升地球观测任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 自动驾驶多传感器融合 2 篇

2506.21885 2026-01-27 cs.CV cs.MM cs.RO 75%

Integrating Multi-Modal Sensors: A Review of Fusion Techniques for Intelligent Vehicles

多模态传感器整合:智能车辆融合技术综述

Chuheng Wei, Ziye Qin, Ziyan Zhang, Guoyuan Wu, Matthew J. Barth

机构 * College of Engineering, Center for Environmental Research and Technology, University of California at Riverside(工程学院、环境研究与技术中心、加州大学河滨分校) School of Transportation and Logistics, Southwest Jiaotong University(交通运输与物流学院、西南交通大学)

专题命中 自动驾驶多传感器融合 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 cs.CV、cs.RO、cs.MM

AI总结 本文综述了多传感器融合技术在自动驾驶中的应用,分析了深度学习方法、多模态数据集及新兴趋势,强调了其提升系统适应性和鲁棒性的潜力。

Comments Accepted by IEEE IV 2025

Journal ref Proceedings of the 2025 IEEE Intelligent Vehicles Symposium (IV), pp. 1817-1824, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05840 2026-01-27 cs.LG 50%

Multimodal Trajectory Representation Learning for Travel Time Estimation

多模态轨迹表示学习用于旅行时间估计

Zhi Liu, Xuyuan Hu, Xiao Han, Zhehao Dai, Zhaolin Deng, Guojiang Shen, Xiangjie Kong

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang University of Technology College of Computer Science(浙江工业大学计算机科学学院)

专题命中 自动驾驶多传感器融合 :multimodal fusion(abstract)

AI总结 本文提出多模态动态轨迹整合框架,通过整合GPS、网格轨迹和道路网络约束,提升旅行时间估计的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人多传感器融合 2 篇

2509.09828 2026-01-27 cs.CV cs.LG cs.RO 84%

DGFusion: Depth-Guided Sensor Fusion for Robust Semantic Perception

DGFusion:基于深度的传感器融合用于鲁棒的语义感知

Tim Broedermannn, Christos Sakaridis, Luigi Piccinelli, Wim Abbeloos, Luc Van Gool

机构 * Computer Vision Laboratory, ETH Zurich(计算机视觉实验室,苏黎世联邦理工学院)

专题命中 机器人多传感器融合 :sensor fusion(title,abstract);multimodal fusion(abstract);分类 cs.CV、cs.RO

AI总结 DGFusion通过整合深度信息提升多模态传感器融合,实现自动驾驶中的鲁棒语义感知。

Comments Code and models are available at https://github.com/timbroed/DGFusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12884 2026-01-27 cs.CV cs.RO 81%

Cross-Level Sensor Fusion with Object Lists via Transformer for 3D Object Detection

基于Transformer的多级传感器融合用于3D目标检测

Xiangzhong Liu, Jiajie Zhang, Hao Shen

机构 * fortiss GmbH(fortiss公司) Technical University of Munich(慕尼黑技术大学)

专题命中 机器人多传感器融合 :sensor fusion(title,abstract);分类 cs.CV、cs.RO

AI总结 本文提出基于Transformer的多级传感器融合方法,通过整合抽象物体列表与原始图像数据,提升3D目标检测性能。

Comments 6 pages, 3 figures, accepted at IV2025

Journal ref 2025 IEEE Intelligent Vehicles Symposium (IV)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 音视频/视觉语言融合 3 篇

2601.18396 2026-01-27 eess.AS cs.CL cs.CV cs.SD 57%

Noise-Robust AV-ASR Using Visual Features Both in the Whisper Encoder and Decoder

利用视觉特征在Whisper编码器和解码器中提升抗噪的音频视觉自动语音识别

Zhengyang Li, Thomas Graave, Björn Möller, Zehang Wu, Matthias Franz, Tim Fingscheidt

机构 * Technische Universit\"at Braunschweig Institute for Communications Technology Schleinitzstr. 22, 38106 Braunschweig, Germany

专题命中 音视频/视觉语言融合 :information fusion(abstract);分类 cs.CV

AI总结 本研究提出在Whisper编码器和解码器中同时使用视觉特征,以提升音频视觉识别在噪声环境下的鲁棒性,实验表明在不同噪声条件下均取得显著改进。

Comments accepted at ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06515 2026-01-27 cs.CV 57%

BigTokDetect: A Clinically-Informed Vision-Language Modeling Framework for Detecting Pro-Bigorexia Videos on TikTok

BigTokDetect: 一种临床指导的视觉-语言建模框架,用于检测TikTok上促进大肌肉畸形行为的视频

Minh Duc Chu, Kshitij Pawar, Zihao He, Roxanna Sharifi, Ross Sonnenblick, Magdalayna Curry, Laura D'Adamo, Lindsay Young, Stuart B Murray, Kristina Lerman

机构 * USC Information Sciences Institute(USC信息科学研究所) Keck School of Medicine, USC(USC凯克医学院) Department of Clinical Psychology, Drexel University(德雷塞尔大学临床心理学系) Department of Psychiatry and Biobehavioral Sciences, UCLA(UCLA精神病学与生物行为科学系)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 BigTokDetect通过临床指导的视觉-语言模型,检测TikTok上促进大肌肉畸形行为的视频,建立了可扩展的有害内容缓解框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15139 2026-01-27 cs.CV 57%

Unified Cross-Modal Attention-Mixer Based Structural-Functional Connectomics Fusion for Neuropsychiatric Disorder Diagnosis

统一的跨模态注意力-混合器基于结构-功能连接组融合的神经精神疾病诊断

Badhan Mazumder, Lei Wu, Vince D. Calhoun, Dong Hye Ye

机构 * Department of Computer Science, Georgia State University(计算机科学系,佐治亚州立大学) Tri-Institutional Center for Translational Research in Neuroimaging and Data Science (TReNDS), Georgia State University, Georgia Institute of Technology, and Emory University(跨机构神经影像与数据科学转化研究中心(TReNDS),佐治亚州立大学、佐治亚理工学院和埃默里大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出ConneX方法,通过统一的跨模态注意力和MLP-Mixer实现结构-功能连接组的多模态融合,提升神经精神疾病诊断性能。

Comments Published in the Proceedings of the 47th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC 2025). IEEE Xplore. DOI: 10.1109/EMBC58623.2025.11254194

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 融合架构与评测 4 篇

2601.18589 2026-01-27 cs.CV cs.MM 76%

AGSP-DSA: An Adaptive Graph Signal Processing Framework for Robust Multimodal Fusion with Dynamic Semantic Alignment

AGSP-DSA: 一种用于鲁棒多模态融合的自适应图信号处理框架,具有动态语义对齐

KV Karthikeya, Ashok Kumar Das, Shantanu Pal, Vivekananda Bhat K, Arun Sekar Rajasekaran

专题命中 融合架构与评测 :multimodal fusion(title);分类 cs.CV、cs.MM

AI总结 AGSP-DSA通过自适应图信号处理和动态语义对齐,实现鲁棒的多模态融合,提升情感分析和多媒体分类的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17809 2026-01-27 cs.IT math.IT 71%

A Multi-Modal Fusion Platform for Joint Environment Sensing and Channel Sounding in Highly Dynamic Scenarios

一种多模态融合平台,用于高动态场景中的联合环境感知与信道探测

Xuejian Zhang, Ruisi He, Mi Yang, Zhengyu Zhang, Ziyi Qi

专题命中 融合架构与评测 :multi-modal fusion(title)

AI总结 本文提出一种多模态融合平台,用于高动态场景中联合环境感知与信道探测,支持多频段多天线测量和高精度环境感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17041 2026-01-27 cs.CV cs.AI 57%

Arabic Sign Language Recognition using Multimodal Approach

阿拉伯手语识别的多模态方法

Ghadeer Alanazi, Abir Benabid

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出结合Leap Motion和RGB摄像头的多模态方法,用于提高阿拉伯手语识别的准确率,实验结果显示78%的识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18424 2026-01-27 cs.HC cs.LG 50%

Fusion of Spatio-Temporal and Multi-Scale Frequency Features for Dry Electrodes MI-EEG Decoding

时空与多尺度频率特征融合用于干电极MI-EEG解码

Tianyi Gong, Can Han, Junxi Wu, Dahong Qian

专题命中 融合架构与评测 :decision-level fusion(abstract)

AI总结 STGMFM通过融合时空与多尺度频率特征,提升干电极MI-EEG解码的稳定性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏