arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-15 至 2025-09-15 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2504.04323 2025-09-15 cs.CV 77%

MedM-VL: What Makes a Good Medical LVLM?

Yiming Shi, Shaoshuai Yang, Xun Zhu, Haoyu Wang, Xiangling Fu, Miao Li, Ji Wu

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) College of AI, Tsinghua University(清华大学人工智能学院) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心) School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院)

专题命中 视觉问答 :vision-language model(abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07879 2025-09-15 cs.IR cs.AI cs.CV 62%

OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal Retrieval

Wei Yang, Jingjing Fu, Rui Wang, Jinyu Wang, Lei Song, Jiang Bian

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏