arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2025-09-23 至 2025-09-23 共收录 7 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2503.13806 2025-09-23 cs.CV cs.AI 74%

DescriptorMedSAM: Language-Image Fusion with Multi-Aspect Text Guidance for Medical Image Segmentation

Wenjie Zhang, Liming Luo, Mengnan He, Jiarui Hai, Jiancheng Ye

专题命中 通用Image Fusion :image fusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 医学影像融合 2 篇

2509.17520 2025-09-23 cs.CV 57%

Unified Multimodal Coherent Field: Synchronous Semantic-Spatial-Vision Fusion for Brain Tumor Segmentation

Mingda Zhang, Yuyang Zheng, Ruixiang Tang, Jingru Qiu, Haiyan Ding

机构 * School of Software, Yunnan University(云南大学软件学院)

专题命中 医学影像融合 :information fusion(abstract);分类 cs.CV

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16900 2025-09-23 cs.CV cs.AI 57%

ME-Mamba: Multi-Expert Mamba with Efficient Knowledge Capture and Fusion for Multimodal Survival Analysis

Chengsheng Zhang, Linhao Qu, Xiaoyu Liu, Zhijian Song

机构 * Digital Medical Research Center, School of Basic Medical Science, Fudan University, Shanghai 200032, China(复旦大学基础医学学院数字医学研究中心) Shanghai Key Lab of Medical Image Computing(上海医学图像计算重点实验室)

专题命中 医学影像融合 :information fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人多传感器融合 3 篇

2509.18005 2025-09-23 cs.RO 57%

M3ET: Efficient Vision-Language Learning for Robotics based on Multimodal Mamba-Enhanced Transformer

Yanxin Zhang, Liang He, Zeyi Kang, Zuheng Ming, Kaixing Zhao

机构 * School of Software Northwestern Polytechnical University Xi'an, China(软件学院 西安理工大学 西安) Laboratoire L2Tl University Sorbonne Paris Nord Paris, France(L2Tl实验室 索邦巴黎北大学 巴黎)

专题命中 机器人多传感器融合 :information fusion(abstract);分类 cs.RO

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16863 2025-09-23 cs.CV 57%

ConfidentSplat: Confidence-Weighted Depth Fusion for Accurate 3D Gaussian Splatting SLAM

Amanuel T. Dufera, Yuan-Li Cai

机构 * Control Science and Engineering(控制科学与工程) Xi'an Jiaotong University(西安交通大学) School of Automation Science and Engineering(自动化科学与工程学院)

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16924 2025-09-23 cs.AI cs.SD 50%

Audio-Guided Dynamic Modality Fusion with Stereo-Aware Attention for Audio-Visual Navigation

Jia Li, Yinfeng Yu, Liejun Wang, Fuchun Sun, Wendong Zheng

机构 * Xinjiang Multimodal Intelligent Processing and Information Security Engineering Technology Research Center(新疆多模态智能处理与信息安全工程技术创新中心) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Electrical Engineering and Automation, Tianjin University of Technology(天津理工大学电气工程与自动化学院)

专题命中 机器人多传感器融合 :multi-modal fusion(abstract)

Comments Main paper (14 pages). Accepted for publication by ICONIP( International Conference on Neural Information Processing) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 音视频/视觉语言融合 1 篇

2509.16618 2025-09-23 cs.CV cs.AI 57%

Surgical-MambaLLM: Mamba2-enhanced Multimodal Large Language Model for VQLA in Robotic Surgery

Pengfei Hao, Hongqiu Wang, Shuaibo Li, Zhaohu Xing, Guang Yang, Kaishun Wu, Lei Zhu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Imperial College London(帝国理工学院伦敦分校) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

Comments Early accepted by MICCAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏