arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-01-06 至 2026-01-06 共收录 11 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 4 篇

2601.01870 2026-01-06 cs.CV 88%

Entity-Guided Multi-Task Learning for Infrared and Visible Image Fusion

实体引导的多任务学习用于红外和可见图像融合

Wenyu Shao, Hongbo Liu, Yunchuan Ma, Ruili Wang

专题命中 红外-可见光融合 :image fusion(title,abstract);infrared and visible(title,abstract);分类 cs.CV

AI总结 EGMT通过实体引导的多任务学习方法,提升红外和可见图像融合的语义一致性与质量。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02249 2026-01-06 cs.CV 57%

SLGNet: Synergizing Structural Priors and Language-Guided Modulation for Multimodal Object Detection

SLGNet: 结合结构先验与语言引导调制的多模态目标检测

Xiantai Xiang, Guangyao Zhou, Zixiao Wen, Wenshuai Li, Ben Niu, Feng Wang, Lijia Huang, Qiantong Wang, Yuhan Liu, Zongxu Pan, Yuxin Hu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所) Key Laboratory of Target Cognition and Application Technology, Chinese Academy of Sciences(中国科学院目标认知与应用技术重点实验室) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件学院)

专题命中 红外-可见光融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 SLGNet通过结合结构先验与语言引导调制,在冻结的ViT基础上实现高效多模态目标检测,提升环境适应性和检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10294 2026-01-06 cs.CV 57%

A Mutual-Structure Weighted Sub-Pixel Multimodal Optical Remote Sensing Image Matching Method

一种互结构加权的子像素多模光学遥感图像匹配方法

Tao Huang, Hongbo Pan, Nanxi Zhou, Siyuan Zou, Shun Zhou

专题命中 红外-可见光融合 :visible-infrared(abstract);分类 cs.CV

AI总结 本文提出了一种基于相位一致性互结构加权的子像素多模光学遥感图像匹配方法,通过粗到细的框架提升匹配精度,实测平均精度达0.4像素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23252 2026-01-06 cs.CV 57%

DGE-YOLO: Dual-Branch Gathering and Attention for Accurate UAV Object Detection

DGE-YOLO:双分支聚集与注意力用于准确的无人机目标检测

Kunwei Lv, Zhiren Xiao, Hang Ren, Ping Lan

专题命中 红外-可见光融合 :infrared and visible(abstract);分类 cs.CV

AI总结 DGE-YOLO 通过双分支架构和高效多尺度注意力机制,提升多模态无人机目标检测的准确性和鲁棒性。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人多传感器融合 3 篇

2601.01578 2026-01-06 cs.ET 71%

Adaptive Tuning of the Unscented Kalman Filter using Particle Swarm Optimization for Inertial-GPS Sensor Fusion Systems

基于粒子群优化的自适应无迹卡尔曼滤波器在惯性导航-GPS传感器融合系统中的应用

Psyche T. Malabo, Bobby D. Gerardo

专题命中 机器人多传感器融合 :sensor fusion(title)

AI总结 本文提出基于粒子群优化的自适应UKF方法,通过优化参数提升IMU-GPS融合精度,实现82.14%的准确率提升和21606.59米的漂移减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01675 2026-01-06 cs.RO 57%

VisuoTactile 6D Pose Estimation of an In-Hand Object using Vision and Tactile Sensor Data

利用视觉和触觉传感器数据进行手持物体的6D位姿估计

Snehal s. Dikhale, Karankumar Patel, Daksh Dhingra, Itoshi Naramura, Akinobu Hayashi, Soshi Iba, Nawid Jamali

机构 * Honda Research Institute USA, Inc.(本田美国研究院) Honda R&D Co., Ltd.(本田研发公司) Department of Mechanical Engineering, University of Washington(华盛顿大学机械工程系)

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.RO

AI总结 本文提出利用视觉和触觉数据融合方法,提高机器人在手物体的6D位姿估计精度。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L), January 2022. Presented at ICRA 2022. This is the author's version of the manuscript

Journal ref IEEE Robotics and Automation Letters, vol. 7, no. 2, pp. 2228-2235, April 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01561 2026-01-06 cs.RO 57%

AIMS: An Adaptive Integration of Multi-Sensor Measurements for Quadrupedal Robot Localization

AIMS: 多传感器测量自适应集成用于四足机器人定位

Yujian Qiu, Yuqiu Mu, Wen Yang, Hao Zhu

机构 * College of Automation Chongqing University of Posts

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.RO

AI总结 AIMS通过自适应融合LiDAR、IMU和腿里程计,提升四足机器人在退化环境中的定位精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 音视频/视觉语言融合 1 篇

2601.01339 2026-01-06 cs.CV 57%

Achieving Fine-grained Cross-modal Understanding through Brain-inspired Hierarchical Representation Learning

通过脑启发的分层表征学习实现细粒度跨模态理解

Weihang You, Hanqi Jiang, Yi Pan, Junhao Chen, Tianming Liu, Fei Dou

机构 * School of Computing, University of Georgia, Athens, GA, USA(计算学院,佐治亚大学,亚特兰大,GA,USA)

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 NeuroAlign通过脑启发的分层表征学习,在fMRI-视频对齐中实现细粒度跨模态理解,提升跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 融合架构与评测 3 篇

2601.00907 2026-01-06 eess.IV cs.AI cs.CV cs.LG 73%

Placenta Accreta Spectrum Detection using Multimodal Deep Learning

利用多模态深度学习进行胎盘增生谱检测

Sumaiya Ali, Areej Alhothali, Sameera Albasri, Ohoud Alzamzami, Ahmed Abduljabbar, Muhammad Alwazzan

机构 * Department of Computer Science, Faculty of Computing and Information Technology, King Abdulaziz University(计算机科学系,计算与信息科技学院,国王阿卜杜勒阿齐兹大学) Department of Radiology, King Abdulaziz University Hospital(放射科,国王阿卜杜勒阿齐兹大学医院)

专题命中 融合架构与评测 :multimodal fusion(abstract);feature-level fusion(abstract);分类 cs.CV、eess.IV

AI总结 本研究提出多模态深度学习方法,通过整合3D MRI和2D US数据,提高胎盘增生谱检测的准确率和AUC值,有效提升产前风险评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01033 2026-01-06 eess.SP 57%

System-Level Comparison of Multimodal and In-Band mmWave Sensing for Beam Prediction in 6G ISAC

6G ISAC中多模态与带内毫米波感知的系统级比较:用于基站预测

Abidemi Orimogunje, Hyunwoo Park, Igbafe Orikumhi, Sunwoo Kim, Dejan Vukobratovic

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.SP

AI总结 本文提出了一种系统级框架,通过多模态融合评估毫米波与体外传感器在6G ISAC中的波束预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01022 2026-01-06 cs.CV cs.AI cs.LG 57%

Decoupling Amplitude and Phase Attention in Frequency Domain for RGB-Event based Visual Object Tracking

频域中解耦幅度与相位注意力以实现RGB-事件视觉目标跟踪

Shiao Wang, Xiao Wang, Haonan Zhao, Jiarui Xu, Bo Jiang, Lin Zhu, Xin Zhao, Yonghong Tian, Jin Tang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Northeastern University(东北大学) Beijing Institute of Technology(北京理工大学) School of Computer and Communication Engineering, University of Science and Technology Beijing(北京科技大学计算机与通信工程学院) Peng Cheng Laboratory(鹏城实验室) National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室) School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院)

专题命中 融合架构与评测 :feature-level fusion(abstract);分类 cs.CV

AI总结 本文提出了一种在频域中解耦幅度与相位注意力的RGB-事件视觉目标跟踪方法,通过高频信息融合和运动引导稀疏化模块提升跟踪性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏