arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-04 至 2025-11-04 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 9 篇

2507.10449 2025-11-04 cs.CV cs.AI 84%

CoralVQA: A Large-Scale Visual Question Answering Dataset for Coral Reef Image Understanding

Hongyong Han, Wei Wang, Gaowei Zhang, Mingjie Li, Yi Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Technology Innovation Center for South China Sea Remote Sensing, Surveying and Mapping Collaborative Application, Ministry of Natural Resources(自然资源部南海遥感测绘协同应用技术创新中心) South China Sea Development Research Institute, Ministry of Natural Resources(自然资源部南海发展研究 institute) Inspur Computer Technology Co., Ltd(Inspur 计算机技术有限公司) Shandong Key Laboratory of Advanced Computing(山东先进计算重点实验室)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00916 2025-11-04 cs.CV 83%

Fleming-VL: Towards Universal Medical Visual Reasoning with Multimodal LLMs

Yan Shu, Chi Liu, Robin Chen, Derek Li, Bryan Dai

机构 * Ubiquant(乌比量化)

专题命中 视觉问答 :visual reasoning(title);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01357 2025-11-04 cs.CV cs.AI 81%

CMI-MTL: Cross-Mamba interaction based multi-task learning for medical visual question answering

Qiangguo Jin, Xianyao Zheng, Hui Cui, Changming Sun, Yuqi Fang, Cong Cong, Ran Su, Leyi Wei, Ping Xuan, Junbo Wang

机构 * School of Software, Northwestern Polytechnical University, Shaanxi, China(西北工业大学软件学院) Yangtze River Delta Research Institute of Northwestern Polytechnical University, Taicang, China(西北工业大学长江三角研究 institute) Department of Computer Science and Information Technology, La Trobe University, Melbourne, Australia(拉筹伯大学计算机科学与信息技术系) CSIRO Data61, Sydney, Australia(CSIRO Data61) School of Intelligence Science and Technology, Nanjing University, Suzhou, China(南京大学智能科学与技术学院) Australian Institute of Health Innovation (AIHI), Macquarie University, Australia(麦考瑞大学健康创新研究所) School of Computer Software, College of Intelligence and Computing, Tianjin University, Tianjin, China(天津大学计算机软件学院) Centre for Artificial Intelligence driven Drug Discovery, Faculty of Applied Science, Macao Polytechnic University, Macao Special Administrative Region of China(澳门理工学院人工智能驱动药物发现中心) Department of Computer Science, School of Engineering, Shantou University, Guangdong, China(汕头大学计算机科学系)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments The paper has been accepted by the 33rd Pacific Conference on Computer Graphics and Applications (Pacific Graphics 2025)

Journal ref PG2025 Conference Papers, Posters, and Demos, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01213 2025-11-04 cs.CV cs.AI 81%

Thought-For-Food: Reasoning Chain Induced Food Visual Question Answering

Riddhi Jain, Manasi Patwardhan, Parijat Deshpande, Venkataramana Runkana

机构 * TCS-Research(TCS研究)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 10 pages, 11 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00389 2025-11-04 cs.CV 79%

Rethinking Facial Expression Recognition in the Era of Multimodal Large Language Models: Benchmark, Datasets, and Beyond

Fan Zhang, Haoxuan Li, Shengju Qian, Xin Wang, Zheng Lian, Hao Wu, Zhihong Zhu, Yuan Gao, Qiankun Li, Yefeng Zheng, Zhouchen Lin, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Tencent(腾讯) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Westlake University(西湖大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22765 2025-11-04 cs.AI 77%

Jarvis: Towards Personalized AI Assistant via Personal KV-Cache Retrieval

Binxiao Xu, Junyu Feng, Shaolin Lu, Yulin Luo, Shilin Yan, Hao Liang, Ming Lu, Wentao Zhang

机构 * Peking University(北京大学) Xi’an Jiaotong University(西安交通大学) Alibaba Group(阿里巴巴集团) Intel Labs China(英特尔中国实验室)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.AI

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01458 2025-11-04 cs.CV cs.AI 73%

When to Trust the Answer: Question-Aligned Semantic Nearest Neighbor Entropy for Safer Surgical VQA

Dennis Pierantozzi, Luca Carlini, Mauro Orazio Drago, Chiara Lena, Cesare Hassan, Elena De Momi, Danail Stoyanov, Sophia Bano, Mobarak I. Hoque

机构 * IRCCS Humanitas Research Hospital(Humanitas研究医院)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07769 2025-11-04 cs.CV 57%

BiMediX2: Bio-Medical EXpert LMM for Diverse Medical Modalities

Sahal Shaji Mullappilly, Mohammed Irfan Kurpath, Sara Pieri, Saeed Yahya Alseiari, Shanavas Cholakkal, Khaled Aldahmani, Fahad Khan, Rao Anwer, Salman Khan, Timothy Baldwin, Hisham Cholakkal

机构 * Mohamed Bin Zayed University of Artificial Intelligence(Mohamed Bin Zayed大学人工智能学院) Linköping University(林肯大学) Shaikh Tahnoon bin Mohammed Medical City(Shaikh Tahnoon bin Mohammed医疗城) Tawam Hospital(Tawam医院) Sheikh Shakhbout Medical City(Sheikh Shakhbout医疗城) Govt Medical College Kozhikode(科钦政府医学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted to EMNLP 2025 (Findings)

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 14051-14071

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03659 2025-11-04 cs.CL 50%

Trustworthy Medical Question Answering: An Evaluation-Centric Survey

Yinuo Wang, Baiyang Wang, Robert E. Mercer, Frank Rudzicz, Sudipta Singha Roy, Pengjie Ren, Zhumin Chen, Xindi Wang

机构 * Shandong University(山东大学) University of Western Ontario(西方大学) Dalhousie University(达尔豪斯大学) University of Toronto(多伦多大学)

专题命中 视觉问答 :grounding(abstract)

Comments accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏