arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2025-12-29 至 2025-12-29 共收录 4 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 通用Image Fusion 4 篇

2512.21495 2025-12-29 cs.CV 88%

Generative Multi-Focus Image Fusion

生成式多焦点图像融合

Xinzhe Xie, Buyu Guo, Bolin Li, Shuangyan He, Yanzhen Gu, Qingyan Jiang, Peiliang Li

机构 * State Key Laboratory of Ocean Sensing & Ocean College, Zhejiang University(海洋传感国家重点实验室与海洋学院,浙江大学) Donghai Laboratory(东海实验室) Hainan Institute, Zhejiang University(海南学院,浙江大学) Hainan Provincial Observatory of Ecological Environment and Fishery Resource in Yazhou Bay(三亚市生态环境与渔业资源省级观测站)

专题命中 通用Image Fusion :image fusion(title,abstract);multi-focus(title,abstract);分类 cs.CV

AI总结 本文提出GMFF框架,通过确定性融合和生成式修复两个阶段,实现高效多焦点图像融合,解决边缘伪影问题并提升实际应用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21544 2025-12-29 cs.LG 71%

AVP-Fusion: Adaptive Multi-Modal Fusion and Contrastive Learning for Two-Stage Antiviral Peptide Identification

AVP-Fusion:适应性多模态融合与对比学习用于两阶段抗病毒肽识别

Xinru Wen, Weizhong Lin, Xuan Xiao

专题命中 通用Image Fusion :multi-modal fusion(title)

AI总结 AVP-Fusion通过自适应多模态融合与对比学习,实现了抗病毒肽的两阶段高效识别,显著提升准确率和决策边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21861 2025-12-29 cs.CV cs.AI cs.LG 57%

Balancing Accuracy and Efficiency: CNN Fusion Models for Diabetic Retinopathy Screening

在准确性和效率之间平衡:用于糖尿病视网膜病变筛查的CNN融合模型

Md Rafid Islam, Rafsan Jany, Akib Ahmed, Mohammad Ashrafuzzaman Khan

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) North South University(北南大学) Digital Health Research Division(数字健康研究部) Korea Institute of Oriental Medicine(韩国东方医学研究院) Department of Computer Science(计算机科学系) American International University--Bangladesh(美国国际大学-孟加拉国)

专题命中 通用Image Fusion :feature-level fusion(abstract);分类 cs.CV

AI总结 本研究提出通过特征级融合提升糖尿病视网膜病变筛查的准确性和效率,采用EfficientNet-B0和DenseNet121的融合模型在准确率和延迟之间取得良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21641 2025-12-29 cs.CV cs.AI 57%

TrackTeller: Temporal Multimodal 3D Grounding for Behavior-Dependent Object References

TrackTeller: 基于时间的多模态3D定位用于行为依赖的对象引用

Jiahong Yu, Ziqi Wang, Hailiang Zhao, Wei Zhai, Xueqiang Yan, Shuiguang Deng

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 通用Image Fusion :image fusion(abstract);分类 cs.CV

AI总结 TrackTeller通过融合LiDAR图像、语言条件解码和时间推理,提升动态3D场景中基于语言的物体定位与跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏