arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-09-01 至 2026-09-01 共收录 9 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2608.29220 2026-09-01 cs.CV 新提交 90%

SGPDFuse: Semantically-Guided Physics-Disentanglement General Multi-Modal Image Fusion

SGPDFuse:语义引导的物理解耦通用多模态图像融合

Haozhen Wei, Chengjun Jiang, Yutong Guo, Xinrui Ju, Xingyuan Li, Xiang Chen, Jinyuan Liu

机构 * Dalian University of Technology(大连理工大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 通用Image Fusion :image fusion(title,abstract);multi-modal image fusion(title);multimodal image fusion(abstract);multi-focus(abstract)

AI总结 本文提出SGPDFuse模型,通过语义-物理参数桥解耦场景属性与环境干扰,结合语义对齐机制实现多模态图像融合,在三类基准测试中达到最先进性能。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红外-可见光融合 2 篇

2608.31002 2026-09-01 cs.RO cs.CV 新提交 62%

DARP: A Calibrated Dual-Arm RGB-D-IR Dataset for Multi-View Robotic Perception

DARP:用于多视角机器人感知的校准双臂RGB-D-IR数据集

Manish Kansana, Mohammed Yusuf Mujawar, Sudip Mittal, Shahram Rahimi, Noorbakhsh Amiri Golilarz

机构 * The University of Alabama(阿拉巴马大学)

专题命中 红外-可见光融合 :multimodal fusion(abstract);分类 cs.CV、cs.RO

AI总结 本文提出DARP双臂机器人感知数据集,含10种桌面物体,经评估几何一致性良好,可用于多视角重建等多类机器人感知相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29235 2026-09-01 cs.CV 新提交 57%

Uncertainty-Aware Multimodal Anti-UAV Detection via Evidential Fusion and Conflict-Discounted Belief Aggregation

基于证据融合与冲突折扣信念聚合的不确定性感知多模态反无人机检测

Sharanda Suttorp, Seyed Sahand Mohammadi Ziabari, Ali Mohammed Mansour Alsahag

机构 * University of Amsterdam(阿姆斯特丹大学) SUNY Empire State University(纽约州立大学帝国州立大学)

专题命中 红外-可见光融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对现有多模态反无人机检测未建模不确定性的问题,本文扩展EDTC提出DBF方法实现多模态融合,在Anti-UAV基准上达到0.670准确率、至少38 FPS,校准良好但定位失败检测能力弱于空间方差。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多聚焦/多曝光融合 1 篇

2608.28674 2026-09-01 cs.CV 新提交 79%

Multi-exposure HDR Imaging: A Review of Pixel-level and Feature-level Reconstruction Methods

多曝光高动态范围(HDR)成像:像素级与特征级重建方法综述

Qian Tao, Wei Wang, Chaobing Zheng, Zhengguo Li

专题命中 多聚焦/多曝光融合 :multi-exposure(title,abstract);分类 cs.CV

AI总结 本文对多曝光HDR成像的多曝光融合与重影去除方法进行分类,对比深度学习等方法,总结设计原则、数据集指标,指出瓶颈与未来方向。

Comments Published in Sensors, 2026, 26(14), 4649

Journal ref Sensors 2026, 26(14), 4649

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 医学影像融合 1 篇

2608.30824 2026-09-01 cs.CV 新提交 57%

Whole-Body MRI Classification via Prompt-Based Clinical Conditioning

基于提示的临床条件下的全身MRI分类

Laura Daza, Marta Hasny, Cristina González, Julia A. Schnabel

机构 * Helmholtz Munich(亥姆霍兹慕尼黑) Technical University of Munich(慕尼黑工业大学) King’s College London(伦敦国王学院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 医学影像融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本研究提出基于提示的多模态框架TACTIC,整合全身MRI与结构化临床数据,可处理缺失临床数据,在五项WB-MRI分类任务中优于仅图像方法,提升诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人多传感器融合 1 篇

2608.28778 2026-09-01 cs.RO cs.CV cs.ET cs.LG cs.SY eess.SY 新提交 62%

Adversarial Calibration Attack on Autonomous Vehicles

针对自动驾驶汽车的对抗性校准攻击

Liangkai Liu, Qingzhao Zhang, Kang G. Shin

机构 * Texas Tech University(德克萨斯理工大学) University of Arizona(亚利桑那大学) University of Michigan(密歇根大学)

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.CV、cs.RO

AI总结 该研究提出针对自动驾驶汽车相机-激光雷达在线校准的对抗性校准攻击(ACA),通过对抗性海报可诱导校准误差,引发感知等系统错误,在仿真和物理实验中均验证了其有效性。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 音视频/视觉语言融合 2 篇

2608.30857 2026-09-01 cs.CV cs.AI 新提交 79%

TAMI: Temporally Aligned, Missingness-Aware, and Interpretable Multimodal Fusion for Mental Health Assessment in Older Adults with Mild Cognitive Impairment

TAMI:面向轻度认知障碍老年人心理健康评估的时间对齐、缺失感知与可解释多模态融合框架

Merna Bibars, Bolaji Omofojoye, Allan I. Levey, Rachel Hershenberg, Gari D. Clifford, Hyeokhyen Kwon

机构 * Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学) Cairo University(开罗大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 本研究针对轻度认知障碍老年人心理健康筛查的多模态分析局限,提出TAMI框架,通过时间对齐、缺失感知与可解释性设计,在49名受试者的抑郁、焦虑分类中取得良好效果,且开放式问题可实现与完整访谈相当的筛查性能。

Comments 19 pages, submitted to IEEE Transactions on Affective Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30903 2026-09-01 cs.CL 新提交 50%

MMDS-Bench: Benchmarking Multimodal Large Language Models on Dynamic Stance in Social Media Interactions

MMDS-Bench:面向社交媒体互动中动态立场的多模态大语言模型基准测试

Yuzhe Ding, Kang He, Li Zheng, Shengwu Zheng, Teng Shi, Fei Li, Chong Teng, Donghong Ji

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学网络安全学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本研究构建多模态动态立场分类基准MMDS-Bench,评估12个多模态大语言模型,发现其在关系推理类多模态动态立场理解上仍存在不足。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 融合架构与评测 1 篇

2608.29579 2026-09-01 cs.LG 新提交 50%

Predicting the Unpredictable: LLM-powered Long-term Chaotic Time Series Forecasting under Short-term Observations

预测不可预测之物:基于大语言模型的短期观测下长期混沌时间序列预测

Yuhang Yao, Bohan Jiang

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) Arizona State University(亚利桑那州立大学)

专题命中 融合架构与评测 :information fusion(abstract)

AI总结 针对短期观测下长期混沌时间序列预测难题,提出PAC-LLM框架,结合相空间特征与LLMs能力,在多组混沌系统实验中优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏