arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-09 至 2026-02-09 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 2 篇

2602.06184 2026-02-09 cs.CV cs.CL 79%

PhenoLIP: Integrating Phenotype Ontology Knowledge into Medical Vision-Language Pretraining

PhenoLIP:将表型本体知识整合到医学视觉-语言预训练中

Cheng Liang, Chaoyi Wu, Weike Zhao, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 PhenoLIP通过整合表型本体知识提升医学视觉-语言模型的表型识别与跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06799 2026-02-09 cs.CL 57%

Visual Word Sense Disambiguation with CLIP through Dual-Channel Text Prompting and Image Augmentations

通过双通道文本提示和图像增强的CLIP实现视觉词义消歧

Shamik Bhattacharya, Daniel Perkins, Yaren Dogan, Vineeth Konjeti, Sudarshan Srinivasan, Edmon Begoli

机构 * 2 The Bredesen Center for Interdisciplinary Research 3 Department of Electrical Engineering \& Computer Science, University of Tennessee, Knoxville, TN 37916 4 Oak Ridge National Laboratory (ORNL), Oak Ridge, TN 37830

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出通过CLIP和双通道提示与图像增强实现视觉词义消歧,提升MRR和命中率,验证了精确提示的有效性。

Comments 9 pages, 6 figures, pending journal/workshop submission

详情

展开后加载摘要…

URL PDF HTML 收藏