arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-23 至 2026-02-23 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 4 篇

2602.17871 2026-02-23 cs.CV cs.AI cs.LG cs.MM 87%

Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models

理解视觉语言模型的细粒度知识能力

Dhruba Ghosh, Yuhui Zhang, Ludwig Schmidt

机构 * Stanford University(斯坦福大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文研究了视觉语言模型在细粒度知识任务中的表现,发现更好的语言模型和视觉编码器对细粒度分类性能有显著影响,预训练阶段也至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17689 2026-02-23 cs.LG cs.AI cs.CL cs.CV 75%

Robust Pre-Training of Medical Vision-and-Language Models with Domain-Invariant Multi-Modal Masked Reconstruction

具有领域不变多模态掩码重建的医学视觉-语言模型鲁棒预训练

Melika Filvantorkaman, Mohsen Piri

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出Robust-MMR框架,通过显式建模鲁棒性提升医学视觉-语言模型在跨领域和扰动下的表现,实现更可靠的医疗应用。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14201 2026-02-23 cs.CV cs.AI 62%

GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery

GeoEyes: 面向超高清遥感影像证据驱动理解的按需视觉聚焦

Fengxiang Wang, Mingshuo Chen, Yueying Li, Yajie Yang, Yifan Zhang, Long Lan, Xue Yang, Hongda Sun, Yulin Wang, Di Wang, Jun Song, Jing Zhang, Bo Du

机构 * National University of Defense Technology, China(国防科技大学) Beijing University of Posts and Telecommunications, China(北京邮电大学) University of the Chinese Academy of Sciences, China(中国科学院大学) Shanghai Jiao Tong University, China(上海交通大学) Wuhan University, China(武汉大学) Chinese Academy of Science, China(中国科学院) Tsinghua University, China(清华大学) Renmin University of China, China(中国人民大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 GeoEyes通过分阶段训练框架,结合冷启动数据集和代理强化学习方法,解决超高清遥感影像中证据获取不足的问题,提升视觉问答任务的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13662 2026-02-23 cs.CV cs.AI 62%

LeafNet: A Large-Scale Dataset and Comprehensive Benchmark for Foundational Vision-Language Understanding of Plant Diseases

LeafNet:一个大规模数据集和全面基准,用于植物病害的基础视觉-语言理解

Khang Nguyen Quoc, Phuong D. Dao, Luyl-Da Quach

机构 * School of Electrical Engineering, Korea University(韩国大学电气工程学院) Department of Integrative Biology, The University of Texas at Austin(德克萨斯大学奥斯汀分校整合生物学系) Department of Software Engineering, FPT University(FPT大学软件工程系)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 LeafNet通过大规模多模态数据集和基准测试,揭示了VLMs在植物疾病理解中的性能差异,强调了多模态架构在提升诊断精度中的关键作用。

Comments 26 pages, 13 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏