arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-02-25 至 2026-02-25 共收录 3 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 1 篇

2602.20851 2026-02-25 cs.CV 86%

Hybrid Fusion: One-Minute Efficient Training for Zero-Shot Cross-Domain Image Fusion

混合融合:一分钟高效训练的零样本跨域图像融合

Ran Zhang, Xuanhua He, Liu Liu

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 通用Image Fusion :image fusion(title,abstract);hybrid fusion(title);分类 cs.CV

AI总结 本文提出一种混合融合框架,通过可学习的U-Net生成动态指导图,结合经典固定拉普拉斯金字塔融合内核,实现高效全分辨率训练,实现零样本跨域图像融合的高效与高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人多传感器融合 1 篇

2602.20342 2026-02-25 cs.CV cs.RO 62%

Large-scale Photorealistic Outdoor 3D Scene Reconstruction from UAV Imagery Using Gaussian Splatting Techniques

基于高斯点扩散技术的无人机影像大规模真实感户外3D场景重建

Christos Maikos, Georgios Angelidis, Georgios Th. Papadopoulos

机构 * Department of Informatics and Telematics(信息学与电信学系)

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.CV、cs.RO

AI总结 本文提出基于高斯点扩散技术的无人机影像大规模真实感户外3D场景重建方法,实现低延迟的高保真度3D重建。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 音视频/视觉语言融合 1 篇

2602.20818 2026-02-25 cs.CV 74%

GatedCLIP: Gated Multimodal Fusion for Hateful Memes Detection

GatedCLIP:用于仇恨表情包检测的门控多模态融合

Yingying Guo, Ke Zhang, Zirong Zeng

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 音视频/视觉语言融合 :multimodal fusion(title);分类 cs.CV

AI总结 GatedCLIP通过门控融合和对比学习提升多模态仇恨表情包检测性能,实现0.66 AUROC优于CLIP基线。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏