arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-08-24 至 2026-08-24 共收录 7 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 2 篇

2608.21099 2026-08-24 cs.CV cs.AI 新提交 57%

A2DINOv3: Rethinking Multi-Modal Object Detection via Socialized Collaboration

A2DINOv3:通过社会化协作重新思考多模态目标检测

Jiekang Feng, Zhihe Fan, Yunqi Zhu, Xinjie Yao, Yueying Zhang, Yike Gao, Ranxin Li, Guanzuo Chen

专题命中 红外-可见光融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出A2DINOv3框架,通过社会化协作协议让RGB与红外分支以异构专家模式选择性交互,结合零初始化策略,在四个多模态基准上实现了多模态目标检测的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20383 2026-08-24 eess.SY cs.AI 新提交 50%

Infrared Hotspot-Guided Early Warning of Lithium-Ion Battery Thermal Runaway Under Mechanical Abuse

机械滥用下锂离子电池热失控的红外热点引导预警

Syed Sajid Ullah, Salman Khan, Muhammad Zunair Zamir

专题命中 红外-可见光融合 :multimodal fusion(abstract)

AI总结 针对机械滥用下锂离子电池热失控预警问题,提出两阶段融合红外热点动态与多模态特征的方法,经实验验证可实现更早的预警与更高的ROC-AUC。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 遥感融合与全色锐化 2 篇

2608.20810 2026-08-24 cs.MM cs.AI cs.CV cs.GR 新提交 73%

When Generated Images Look Right and Retrieve Wrong: Coverage-Guided Cross-Scale Re-Indexing for Knowledge-Faithful Generative Perception

当生成图像看起来正确但检索错误:面向知识保真生成感知的覆盖度引导跨尺度重索引

Guangyuan Dong, Chuang Liu, Yangchen Zeng, Haoyu Wang, Xiaoyang Yu, Pinlong Zhao, Yuchao Hou, Ziwei Li, Zheng Lin

专题命中 遥感融合与全色锐化 :pansharpening(abstract,abstract_cn);分类 cs.CV、cs.MM

AI总结 针对生成图像因尺度差异导致的语义崩溃问题,提出闭环多模态索引框架CERES,在多基准上实现SOTA,显著提升概念-查询检索性能。

Comments 20 pages, 7 figures, and 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20944 2026-08-24 cs.CV 新提交 57%

SuppreSensing: Expert-Guided Feature Recalibration and Discrepancy Augmentation for Multimodal Object Detection

SuppreSensing:面向多模态目标检测的专家引导特征重校准与差异增强

Xin Wu, Zhenyu Gao, Qiankun Zhang, Shaoyong Guo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 遥感融合与全色锐化 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对遥感多模态目标检测的语义异质性与模态噪声问题,本文提出SuppreSensing,通过EMFR模块、差异增强策略和ECFP模块实现最优性能,在多个数据集上达到SOTA并具备良好泛化性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人多传感器融合 1 篇

2608.21355 2026-08-24 cs.RO 新提交 57%

ViTacPhys: Physical Property-Aware Grasping from Human Visual-Tactile Demonstrations

ViTacPhys:基于人类视觉-触觉演示的感知物体物理属性的抓取方法

Yiwen Liu, Yujun Zhu, Kui Jia, Zhao Liao, Yangwei You, Shuaijun Wang

机构 * Xiaomi Robotics(小米机器人)

专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.RO

AI总结 该研究提出ViTacPhys视觉-触觉框架,可从人类演示中估计物体物理属性,迁移至机器人后实现高抓取成功率,力曲线更贴合人类遥操作。

Comments 11 pages, 7 figures. Project page: this https URL (https://vitacphys.github.io/ViTacPhys/)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 融合架构与评测 2 篇

2608.21098 2026-08-24 cs.CV 新提交 57%

When does fusing hand-crafted knowledge with learned representations pay? A cost-normalized benchmark of stacking, substitution, and interference

将手工知识与学习表示融合何时有效?一种针对堆叠、替代和干扰的成本归一化基准

Ahmad AlMughrabi, Albert Clop, Benjamin Busam, Ricardo Marques, Petia Radeva

机构 * Universitat de Barcelona(巴塞罗那大学) Technical University of Munich(慕尼黑工业大学) Universitat Pompeu Fabra(庞培法布拉大学)

专题命中 融合架构与评测 :decision-level fusion(abstract);分类 cs.CV

AI总结 该研究以成本归一化基准分析手工知识与学习表示融合的效果,发现三种结果并提出可预测端到端增益的分解式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20969 2026-08-24 cs.CV 新提交 57%

Kinematic Knowledge Maps for Pattern Alignment: Structured Latent Representational Learning in Multimodal Gait Analysis

用于模式对齐的运动学知识图谱:多模态步态分析中的结构化潜在表示学习

Chen Dong, He Zonglin, Cheung Kenneth M.C

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本研究提出ScoliDetect框架,通过运动学知识图谱(KKM)实现多模态步态分析,其介导的融合结合三模态对比预训练提升了脊柱侧凸筛查的泛化性与可解释性,外部ROC-AUC达0.972。

详情

展开后加载摘要…

URL PDF HTML 收藏