arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2025-12-25 至 2025-12-25 共收录 7 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2512.20921 2025-12-25 cs.CV 85%

Self-supervised Multiplex Consensus Mamba for General Image Fusion

自监督多乘共识Mamba用于通用图像融合

Yingying Wang, Rongjin Zhuang, Hui Zheng, Xuanhua He, Ke Cao, Xiaotong Tu, Xinghao Ding

专题命中 通用Image Fusion :image fusion(title,abstract);multi-focus(abstract);multi-exposure(abstract);分类 cs.CV

AI总结 SMC-Mamba通过自监督多乘共识机制提升通用图像融合性能,有效整合多模态信息并优化下游任务表现。

Comments Accepted by AAAI 2026, 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人多传感器融合 1 篇

2512.20964 2025-12-25 cs.CR 50%

Neutralization of IMU-Based GPS Spoofing Detection using external IMU sensor and feedback methodology

利用外部IMU传感器和反馈方法中和基于IMU的GPS欺骗检测

Ji Hyuk Jung, Ji Won Yoon

专题命中 机器人多传感器融合 :sensor fusion(abstract)

AI总结 本文提出了一种利用外部IMU传感器和反馈方法中和基于IMU的GPS欺骗检测的攻击系统,通过窃取内部动态状态信息实现对检测机制的中和。

Comments 12 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 音视频/视觉语言融合 2 篇

2512.21135 2025-12-25 cs.CV cs.AI 57%

TGC-Net: A Structure-Aware and Semantically-Aligned Framework for Text-Guided Medical Image Segmentation

TGC-Net:一种结构感知且语义对齐的文本引导医学图像分割框架

Gaoren Lin, Huangxuan Zhao, Yuan Xiong, Lefei Zhang, Bo Du, Wentao Zhu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Department of Orthopedics, Tongji Hospital, Tongji Medical College, Huazhong University of Science(同济大学同济医学学院骨科部,华中科技大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 TGC-Net通过引入语义-结构协同编码器、域增强文本编码器和视觉-语言校准模块,提升文本引导的医学图像分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20898 2025-12-25 cs.CV cs.AI 57%

DGSAN: Dual-Graph Spatiotemporal Attention Network for Pulmonary Nodule Malignancy Prediction

DGSAN:双图时空注意力网络用于肺结节恶性预测

Xiao Yu, Zhaojie Fang, Guanyu Zhou, Yin Shen, Huoling Luo, Ye Li, Ahmed Elazab, Xiang Wan, Ruiquan Ge, Changmiao Wang

专题命中 音视频/视觉语言融合 :information fusion(abstract);分类 cs.CV

AI总结 DGSAN通过双图时空注意力网络融合多模态数据,提升肺结节恶性预测的准确性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 融合架构与评测 3 篇

2512.21215 2025-12-25 eess.AS 50%

USE: A Unified Model for Universal Sound Separation and Extraction

USE: 一种统一的通用声音分离与提取模型

Hongyu Wang, Chenda Li, Xin Zhou, Shuai Wang, Yanmin Qian

专题命中 融合架构与评测 :multi-modal fusion(abstract)

AI总结 本文提出USE模型,通过统一框架结合声音分离与目标声音提取,提升两者性能,实验显示在SS和TSE任务中分别取得1.4 dB SDR提升和86%准确率。

Comments Accepted as an oral presentation by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21105 2025-12-25 cs.HC 50%

Volatile Organic Compounds for Stress Detection: A Scoping Review and Exploratory Feasibility Study with Low-Cost Sensors

挥发性有机化合物用于压力检测:一项综述和探索可行性研究,结合低成本传感器

Nicolai Plintz, Marcus Vetter, Dirk Ifenthaler

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文通过综述和探索性研究,证明低成本传感器可捕捉压力相关的VOC模式,揭示了VOC在情绪识别中的应用潜力及实施挑战。

Comments 13 pages, 5 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20948 2025-12-25 cs.CL cs.SD 50%

Foundation Model-based Evaluation of Neuropsychiatric Disorders: A Lifespan-Inclusive, Multi-Modal, and Multi-Lingual Study

基于基础模型的神经精神障碍评估:一项涵盖全生命周期、多模态和多语言的研究

Zhongren Dong, Haotian Guo, Weixiang Xu, Huan Zhao, Zixing Zhang

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) Shenzhen Research Institute, Hunan University(湖南大学深圳研究院) Ministry of Education Key Laboratory of Fusion Computing of Supercomputing and Artificial Intelligence, Hunan University(湖南大学教育部长春计算机与人工智能融合计算重点实验室)

专题命中 融合架构与评测 :multi-modal fusion(abstract)

AI总结 FEND提出一种多模态框架,利用多语言数据集评估神经精神障碍,揭示多模态融合在不同障碍检测中的性能差异及影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏