arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2025-12-18 至 2025-12-18 共收录 3 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 遥感融合与全色锐化 1 篇

2512.15261 2025-12-18 cs.CV 79%

MMMamba: A Versatile Cross-Modal In Context Fusion Framework for Pan-Sharpening and Zero-Shot Image Enhancement

MMMamba: 一种多功能跨模态在上下文融合框架用于全色锐化和零样本图像增强

Yingying Wang, Xuanhua He, Chen Wu, Jialing Huang, Suiyun Zhang, Rui Liu, Xinghao Ding, Haoxuan Che

专题命中 遥感融合与全色锐化 :pan-sharpening(title,abstract);分类 cs.CV

AI总结 MMMamba通过跨模态在上下文融合框架实现全色锐化和零样本图像增强,结合Mamba架构和多模态交错扫描机制,提升跨模态交互能力与计算效率。

Comments \link{Code}{https://github.com/Gracewangyy/MMMamba}

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人多传感器融合 1 篇

2503.22943 2025-12-18 cs.RO cs.CV 62%

Event Camera Meets Mobile Embodied Perception: Abstraction, Algorithm, Acceleration, Application

事件相机与移动具身感知:抽象、算法、加速与应用

Haoyang Wang, Ruishan Guo, Pengtao Ma, Ciyu Ruan, Xinyu Luo, Wenhua Ding, Tianyang Zhong, Jingao Xu, Yunhao Liu, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The University of Hong Kong(香港大学) Global Innovation Exchange, Tsinghua University(清华大学全球创新交换)

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.CV、cs.RO

AI总结 本文综述了基于事件的移动传感技术,涵盖其原理、抽象方法、算法进展及加速策略,并探讨了其在视觉里程计、目标跟踪等应用中的挑战与未来发展方向。

Comments Accepted by ACM CSUR,35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 音视频/视觉语言融合 1 篇

2510.26569 2025-12-18 cs.CV cs.IR cs.MM 62%

AdSum: Two-stream Audio-visual Summarization for Automated Video Advertisement Clipping

AdSum:用于自动化视频广告剪辑的双流音频视觉摘要

Wen Xie, Yanjun Zhu, Gijs Overgoor, Yakov Bart, Agata Lapedriza Garcia, Sarah Ostadabbas

机构 * Northeastern University(东北大学) Southern Methodist University(南方 Methodist 大学)

专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV、cs.MM

AI总结 AdSum提出了一种双流音频视觉融合模型,用于自动化视频广告剪辑,通过重要性预测提升广告剪辑效率。

Comments Accepted at 32nd International Conference on MultiMedia Modeling

详情

展开后加载摘要…

URL PDF HTML 收藏