arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-09-01 至 2026-09-01 共收录 13 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 2 篇

2608.29220 2026-09-01 cs.CV 新提交 90%

SGPDFuse: Semantically-Guided Physics-Disentanglement General Multi-Modal Image Fusion

SGPDFuse:语义引导的物理解耦通用多模态图像融合

Haozhen Wei, Chengjun Jiang, Yutong Guo, Xinrui Ju, Xingyuan Li, Xiang Chen, Jinyuan Liu

机构 * Dalian University of Technology(大连理工大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 通用Image Fusion :image fusion(title,abstract);multi-modal image fusion(title);multimodal image fusion(abstract);multi-focus(abstract)

AI总结 本文提出SGPDFuse模型,通过语义-物理参数桥解耦场景属性与环境干扰,结合语义对齐机制实现多模态图像融合,在三类基准测试中达到最先进性能。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21786 2026-09-01 cs.CV 版本更新 87%

UniDiffFusion: A Unified Diffusion Framework for Multi-Task and Degradation-Robust Image Fusion

HP-UniIF:用于统一图像融合的分层提示学习

Xingxin Xu, Siqi Zhao, Xin Li, Xinjie Yao, Yiming Sun, Pengfei Zhu

专题命中 通用Image Fusion :image fusion(title,abstract);visible-infrared(abstract);multi-focus(abstract);multi-exposure(abstract)

AI总结 HP-UniIF是一种基于分层条件调制策略的统一视觉框架,利用扩散先验实现异构图像融合、视觉恢复与下游感知的协同,在多任务实验中表现出优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红外-可见光融合 2 篇

2608.31002 2026-09-01 cs.RO cs.CV 新提交 62%

DARP: A Calibrated Dual-Arm RGB-D-IR Dataset for Multi-View Robotic Perception

DARP:用于多视角机器人感知的校准双臂RGB-D-IR数据集

Manish Kansana, Mohammed Yusuf Mujawar, Sudip Mittal, Shahram Rahimi, Noorbakhsh Amiri Golilarz

机构 * The University of Alabama(阿拉巴马大学)

专题命中 红外-可见光融合 :multimodal fusion(abstract);分类 cs.CV、cs.RO

AI总结 本文提出DARP双臂机器人感知数据集,含10种桌面物体,经评估几何一致性良好,可用于多视角重建等多类机器人感知相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29235 2026-09-01 cs.CV 新提交 57%

Uncertainty-Aware Multimodal Anti-UAV Detection via Evidential Fusion and Conflict-Discounted Belief Aggregation

基于证据融合与冲突折扣信念聚合的不确定性感知多模态反无人机检测

Sharanda Suttorp, Seyed Sahand Mohammadi Ziabari, Ali Mohammed Mansour Alsahag

机构 * University of Amsterdam(阿姆斯特丹大学) SUNY Empire State University(纽约州立大学帝国州立大学)

专题命中 红外-可见光融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对现有多模态反无人机检测未建模不确定性的问题,本文扩展EDTC提出DBF方法实现多模态融合,在Anti-UAV基准上达到0.670准确率、至少38 FPS,校准良好但定位失败检测能力弱于空间方差。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多聚焦/多曝光融合 1 篇

2608.28674 2026-09-01 cs.CV 新提交 79%

Multi-exposure HDR Imaging: A Review of Pixel-level and Feature-level Reconstruction Methods

多曝光高动态范围(HDR)成像:像素级与特征级重建方法综述

Qian Tao, Wei Wang, Chaobing Zheng, Zhengguo Li

专题命中 多聚焦/多曝光融合 :multi-exposure(title,abstract);分类 cs.CV

AI总结 本文对多曝光HDR成像的多曝光融合与重影去除方法进行分类,对比深度学习等方法,总结设计原则、数据集指标,指出瓶颈与未来方向。

Comments Published in Sensors, 2026, 26(14), 4649

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 遥感融合与全色锐化 1 篇

2608.20810 2026-09-01 cs.MM cs.AI cs.CV cs.GR 版本更新 73%

When Images Look Right and Retrieve Wrong: Coverage-Guided Cross-Scale Re-Indexing for Knowledge-Faithful Generative Perception

当生成图像看起来正确但检索错误:面向知识保真生成感知的覆盖度引导跨尺度重索引

Guangyuan Dong, Chuang Liu, Haoyu Wang, Yangchen Zeng, Jiaqi Zhang, Li Jiuxing, Xiaoyang Yu, Pinlong Zhao, Yuchao Hou, Ziwei Li, Zheng Lin, Alexander Lim Han Yang, Yusen Wu

机构 * National University of Singapore(新加坡国立大学) Wuhan University(武汉大学) ByteDance(字节跳动) Nankai University(南开大学) JD Research, JD.com, Inc.(京东研究院(京东有限公司)) Zhejiang University(浙江大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) The University of Hong Kong(香港大学)

专题命中 遥感融合与全色锐化 :pansharpening(abstract,abstract_cn);分类 cs.CV、cs.MM

AI总结 针对生成图像因尺度差异导致的语义崩溃问题,提出闭环多模态索引框架CERES,在多基准上实现SOTA,显著提升概念-查询检索性能。

Comments 20 pages, 7 figures, and 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 医学影像融合 1 篇

2608.30824 2026-09-01 cs.CV 新提交 57%

Whole-Body MRI Classification via Prompt-Based Clinical Conditioning

基于提示的临床条件下的全身MRI分类

Laura Daza, Marta Hasny, Cristina González, Julia A. Schnabel

机构 * Helmholtz Munich(亥姆霍兹慕尼黑) Technical University of Munich(慕尼黑工业大学) King’s College London(伦敦国王学院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 医学影像融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 本研究提出基于提示的多模态框架TACTIC,整合全身MRI与结构化临床数据,可处理缺失临床数据,在五项WB-MRI分类任务中优于仅图像方法,提升诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人多传感器融合 1 篇

2608.28778 2026-09-01 cs.RO cs.CV cs.ET cs.LG eess.SY 新提交 62%

Adversarial Calibration Attack on Autonomous Vehicles

针对自动驾驶汽车的对抗性校准攻击

Liangkai Liu, Qingzhao Zhang, Kang G. Shin

机构 * Texas Tech University(德克萨斯理工大学) University of Arizona(亚利桑那大学) University of Michigan(密歇根大学)

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.CV、cs.RO

AI总结 该研究提出针对自动驾驶汽车相机-激光雷达在线校准的对抗性校准攻击(ACA),通过对抗性海报可诱导校准误差,引发感知等系统错误,在仿真和物理实验中均验证了其有效性。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 音视频/视觉语言融合 3 篇

2608.30857 2026-09-01 cs.CV cs.AI 新提交 79%

TAMI: Temporally Aligned, Missingness-Aware, and Interpretable Multimodal Fusion for Mental Health Assessment in Older Adults with Mild Cognitive Impairment

TAMI:面向轻度认知障碍老年人心理健康评估的时间对齐、缺失感知与可解释多模态融合框架

Merna Bibars, Bolaji Omofojoye, Allan I. Levey, Rachel Hershenberg, Gari D. Clifford, Hyeokhyen Kwon

机构 * Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学) Cairo University(开罗大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 本研究针对轻度认知障碍老年人心理健康筛查的多模态分析局限,提出TAMI框架,通过时间对齐、缺失感知与可解释性设计,在49名受试者的抑郁、焦虑分类中取得良好效果,且开放式问题可实现与完整访谈相当的筛查性能。

Comments 19 pages, submitted to IEEE Transactions on Affective Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21670 2026-09-01 cs.CV cs.LG 版本更新 79%

Diverse via bounded Agreement: Geometric Regularization for Multimodal Fusion

通过有界一致性实现多样性:多模态融合的几何正则化

Zixuan Xia, Hao Wang, Pengcheng Weng, Yanyu Qian, Yangxin Xu, William Dan, Fei Wang

机构 * Department of Informatics University of Bern(伯尔尼大学信息学院) College of Computing and Data Science Nanyang Technological University(南洋理工大学计算机与数据科学学院) School of Software Engineering Xi’an Jiaotong University(西安交通大学软件工程学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV

AI总结 提出一种轻量级即插即用的几何正则化框架,通过有界一致性原则在保持模态特异多样性的同时约束跨模态漂移,提升多模态融合性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30903 2026-09-01 cs.CL 新提交 50%

MMDS-Bench: Benchmarking Multimodal Large Language Models on Dynamic Stance in Social Media Interactions

MMDS-Bench:面向社交媒体互动中动态立场的多模态大语言模型基准测试

Yuzhe Ding, Kang He, Li Zheng, Shengwu Zheng, Teng Shi, Fei Li, Chong Teng, Donghong Ji

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学网络安全学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 本研究构建多模态动态立场分类基准MMDS-Bench,评估12个多模态大语言模型,发现其在关系推理类多模态动态立场理解上仍存在不足。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 融合架构与评测 2 篇

2601.17809 2026-09-01 cs.IT 版本更新 71%

A Multi-Modal Channel Sounding System for Environment-Aware Channel Measurements in 6G Dynamic Scenarios

一种多模态融合平台,用于高动态场景中的联合环境感知与信道探测

Xuejian Zhang, Ruisi He, Mi Yang, Zhengyu Zhang, Ziyi Qi

专题命中 融合架构与评测 :multi-modal fusion(title)

AI总结 本文提出一种多模态融合平台,用于高动态场景中联合环境感知与信道探测,支持多频段多天线测量和高精度环境感知。

Comments Substantially revised version after peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29579 2026-09-01 cs.LG 新提交 50%

Predicting the Unpredictable: LLM-powered Long-term Chaotic Time Series Forecasting under Short-term Observations

预测不可预测之物:基于大语言模型的短期观测下长期混沌时间序列预测

Yuhang Yao, Bohan Jiang

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) Arizona State University(亚利桑那州立大学)

专题命中 融合架构与评测 :information fusion(abstract)

AI总结 针对短期观测下长期混沌时间序列预测难题,提出PAC-LLM框架,结合相空间特征与LLMs能力,在多组混沌系统实验中优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏