arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-03-04 至 2026-03-04 共收录 2 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 2 篇

2506.17623 2026-03-04 cs.MM cs.CV 62%

Synthetic Perception: Can Generated Images Unlock Latent Visual Prior for Text-Centric Reasoning?

合成感知:生成图像能否解锁潜在的视觉先验以用于以文本为中心的推理?

Yuesheng Huang, Peng Zhang, Xiaoxin Wu, Riliang Liu, Jiaqi Liang

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV、cs.MM

AI总结 本文探讨生成图像能否解锁潜在视觉先验以提升文本中心推理,通过多模态融合架构和提示工程策略实现性能提升。

Comments Accepted as a poster at the International Conference on Machine Learning (ICML 2025) NewInML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01404 2026-03-04 cs.RO 57%

D-GVIO: A Buffer-Driven and Efficient Decentralized GNSS-Visual-Inertial State Estimator for Multi-Agent Systems

D-GVIO: 一种基于缓冲的高效分布式GNSS-视觉-惯性状态估计器用于多智能体系统

Yarong Luo, Wentao Lu, Chi Guo, Ming Li

机构 * School of Robotics, Wuhan University(机器人学院,武汉大学) School of Electronic Information of Wuhan University, Hubei Luojia Laboratory(武汉大学电子信息学院,湖北珞珈实验室)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.RO

AI总结 D-GVIO通过基于缓冲的分布式框架和L-IEKF实现高效鲁棒的GNSS-视觉-惯性状态估计,适用于多智能体系统的协同定位任务。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏