arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-02-06 至 2026-02-06 共收录 5 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 红外-可见光融合 1 篇

2602.06017 2026-02-06 cs.CV 70%

MambaVF: State Space Model for Efficient Video Fusion

MambaVF:用于高效视频融合的状态空间模型

Zixiang Zhao, Yukun Cui, Lilun Deng, Haowen Bai, Haotong Qin, Tao Feng, Konrad Schindler

机构 * Xi'an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 红外-可见光融合 :multi-focus(abstract);multi-exposure(abstract);分类 cs.CV

AI总结 MambaVF通过基于状态空间模型的高效框架,实现了无需显式运动估计的视频融合,显著提升效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 遥感融合与全色锐化 1 篇

2602.05480 2026-02-06 cs.CV 57%

SOMA-1M: A Large-Scale SAR-Optical Multi-resolution Alignment Dataset for Multi-Task Remote Sensing

SOMA-1M: 一种大规模SAR-光学多分辨率对齐数据集用于多任务遥感

Peihao Wu, Yongxiang Yao, Yi Wan, Wenfei Zhang, Ruipeng Zhao, Jiayuan Li, Yongjun Zhang

机构 * School of Remote Sensing Information Engineering, Wuhan University(遥感信息工程学院,武汉大学) Hubei LuoJia Laboratory(湖北珞珈实验室) Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, Ministry of Natural Resources(粤港澳大湾区自然资源数据协同应用技术创新中心,自然资源部)

专题命中 遥感融合与全色锐化 :image fusion(abstract);分类 cs.CV

AI总结 SOMA-1M是首个大规模SAR-光学多分辨率对齐数据集,用于提升多任务遥感图像处理的性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人多传感器融合 2 篇

2602.04904 2026-02-06 cs.LG cs.AI cs.MM eess.IV 62%

DCER: Dual-Stage Compression and Energy-Based Reconstruction

DCER:双阶段压缩与基于能量的重建

Yiwen Wang, Jiahao Qin

机构 * Yiwen Wang(无) Jiahao Qin(无)

专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 eess.IV、cs.MM

AI总结 DCER通过双阶段压缩和基于能量的重建解决多模态融合中的噪声和缺失模态问题,实现鲁棒性提升。

Comments 13 pages, 2 figures, 8 tables. Submitted to ICML 2026. Code will be available on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05855 2026-02-06 cs.RO cs.LG 57%

A Hybrid Autoencoder for Robust Heightmap Generation from Fused Lidar and Depth Data for Humanoid Robot Locomotion

一种用于人形机器人运动的融合激光雷达和深度数据的鲁棒高度图生成的混合自编码器

Dennis Bank, Joost Cordes, Thomas Seel, Simon F. G. Ehlers

机构 * Institute of Mechatronic Systems, Leibniz University Hannover(机械系统研究所,莱比锡洪堡大学)

专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.RO

AI总结 本文提出了一种混合自编码器,通过融合激光雷达和深度数据生成鲁棒的高度图,以提升人形机器人在非结构化环境中的运动性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 音视频/视觉语言融合 1 篇

2602.04920 2026-02-06 cs.LG cs.SD 50%

CyIN: Cyclic Informative Latent Space for Bridging Complete and Incomplete Multimodal Learning

CyIN:循环信息潜在空间用于连接完整与不完整多模态学习

Ronghao Lin, Qiaolin He, Sijie Mai, Ying Zeng, Aolin Xiong, Li Huang, Yap-Peng Tan, Haifeng Hu

机构 * School of Electronics and Information Technology, Sun Yat-Sen University(中山大学电子与信息学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) School of Computer Science, South China Normal University(华南师范大学计算机科学学院) Desay SV Automotive Co., Ltd(德赛股份有限公司) Pazhou Laboratory(琶洲实验室)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 CyIN通过构建循环信息潜在空间,解决多模态学习中完整与不完整数据之间的性能差距,实现统一优化。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏