arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-19 至 2026-02-19 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 7 篇

2602.15915 2026-02-19 cs.CV cs.AI 84%

MaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question Answering

MaS-VQA: 一种基于掩码和选择的基于知识的视觉问答框架

Xianwei Mao, Kai Ye, Sheng Zhou, Nan Zhang, Haikuan Huang, Bin Li, Jiajun Bu

机构 * Zhejiang University, Hangzhou, China(浙江大学, 杭州, 中国) Alibaba Group, Hangzhou, China(阿里巴巴集团, 杭州, 中国)

专题命中 视觉问答 :visual question answering(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 MaS-VQA通过结合显式知识过滤与隐式知识推理,提升基于知识的视觉问答任务的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16138 2026-02-19 cs.CV 74%

IRIS: Intent Resolution via Inference-time Saccades for Open-Ended VQA in Large Vision-Language Models

IRIS:通过推理时的注视来解决大型视觉-语言模型中开放式视觉问答的意图

Parsa Madinei, Srijita Karmakar, Russell Cohen Hoffing, Felix Gervitz, Miguel P. Eckstein

机构 * Department of Computer Science, UC Santa Barbara(计算机科学系,加州大学圣芭芭拉分校) Department of Psychological & Brain Sciences, UC Santa Barbara(心理学与脑科学系,加州大学圣芭芭拉分校) DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 视觉问答 :vision-language model(title);分类 cs.CV

AI总结 IRIS通过实时眼动数据提升大型视觉-语言模型在开放式视觉问答中的意图解析准确率

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25867 2026-02-19 cs.LG 74%

Synthesizing High-Quality Visual Question Answering from Medical Documents with Generator-Verifier LMMs

从医学文献合成高质量的视觉问答系统:基于生成-验证框架的大型多模态模型

Xiaoke Huang, Ningsen Wang, Hui Liu, Xianfeng Tang, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克ruz分校) Fudan University(复旦大学) Amazon Research(亚马逊研究)

专题命中 视觉问答 :visual question answering(title);分类 cs.LG

AI总结 MedVLSynther通过生成-验证框架从开放文献合成高质量医学VQA数据,提升六个基准测试的准确率,达到77.57的VQA-RAD表现。

Comments Project page, code, data, and models: https://ucsc-vlaa.github.io/MedVLSynther/ ; Accepted by ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16689 2026-02-19 cs.CV cs.LG 62%

Are Object-Centric Representations Better At Compositional Generalization?

基于对象中心表示的组合泛化能力是否更强?

Ferdinand Kapl, Amir Mohammad Karimi Mamaghan, Maximilian Seitzer, Karl Henrik Johansson, Carsten Marr, Stefan Bauer, Andrea Dittadi

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz AI, Munich(慕尼黑海德堡人工智能研究所) KTH Royal Institute of Technology(皇家理工学院) MPI for Intelligent Systems, Tübingen(图宾根人工智能研究所) Institute of AI for Health, Computational Health Center, Helmholtz Munich(健康人工智能研究所,计算健康中心,海德堡慕尼黑)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 本研究通过三个视觉世界基准,发现对象中心表示在组合泛化任务中表现更优,尤其在数据受限时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16334 2026-02-19 cs.SD cs.AI 57%

Spatial Audio Question Answering and Reasoning on Dynamic Source Movements

空间音频问答与动态声源运动推理

Arvind Krishna Sridhar, Yinyi Guo, Erik Visser

机构 * Qualcomm Technologies Inc.(高通技术公司)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种空间音频问答方法,通过运动推理和多模态微调提升动态声源识别与理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12255 2026-02-19 cs.CV 57%

Fusionista2.0: Efficiency Retrieval System for Large-Scale Datasets

Fusionista2.0:大规模数据集的高效检索系统

Huy M. Le, Dat Tien Nguyen, Phuc Binh Nguyen, Gia Bao Le Tran, Phu Truong Thien, Cuong Dinh, Minh Nguyen, Nga Nguyen, Thuy T. N. Nguyen, Tan Nhat Nguyen, Binh T. Nguyen

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI), UAE(Mohamed Bin Zayed人工智能大学(MBZUAI)) AISIA Research Lab(AISIA研究实验室) University of Information Technology(信息技术大学) Ho Chi Minh University of Science(胡志明科学大学) Vietnam National University, Ho chi Minh City(越南国家大学,胡志明市)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 Fusionista2.0通过优化预处理、识别技术和用户界面,实现了大规模视频检索的高效性和准确性提升。

Journal ref MultiMedia Modeling. MMM 2026. Lecture Notes in Computer Science, vol 16415

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15850 2026-02-19 cs.CL 50%

Large Language Models for Assisting American College Applications

大型语言模型用于协助美国大学申请

Zhengliang Liu, Weihang You, Peng Shu, Junhao Chen, Yi Pan, Hanqi Jiang, Yiwei Li, Zhaojun Ding, Chao Cao, Xinliang Li, Yifan Zhou, Ruidong Zhang, Shaochen Xu, Wei Ruan, Huaqin Zhao, Dajiang Zhu, Tianming Liu

专题命中 视觉问答 :grounding(abstract)

AI总结 EZCollegeApp 通过大型语言模型帮助高中生处理复杂大学申请流程,提供结构化表格、权威文件支持及人工控制,提升申请效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏