arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

2403.18346 2024-11-14 cs.CL cs.CV 83%

Quantifying and Mitigating Unimodal Biases in Multimodal Large Language Models: A Causal Perspective

Meiqi Chen, Yixin Cao, Yan Zhang, Chaochao Lu

专题命中 视觉问答 :multimodal large language model(title);visual question answering(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02722 2024-11-06 cs.CL cs.AI 83%

Multimodal Commonsense Knowledge Distillation for Visual Question Answering

Shuo Yang, Siwen Luo, Soyeon Caren Han

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.AI

Comments AAAI 2025 (Accepted, Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14200 2024-10-21 eess.IV cs.CL cs.CV 83%

E3D-GPT: Enhanced 3D Visual Foundation for Medical Vision-Language Model

Haoran Lai, Zihang Jiang, Qingsong Yao, Rongsheng Wang, Zhiyang He, Xiaodong Tao, Wei Wei, Weifu Lv, S. Kevin Zhou

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06420 2024-10-10 cs.CL cs.CV 83%

ERVQA: A Dataset to Benchmark the Readiness of Large Vision Language Models in Hospital Environments

Sourjyadip Ray, Kushal Gupta, Soumi Kundu, Payal Arvind Kasat, Somak Aditya, Pawan Goyal

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted at EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12372 2024-10-08 cs.CV 83%

MedThink: Explaining Medical Visual Question Answering via Multimodal Decision-Making Rationale

Xiaotang Gai, Chenyi Zhou, Jiaxiang Liu, Yang Feng, Jian Wu, Zuozhu Liu

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04107 2024-10-08 cs.CV cs.CL 83%

TUBench: Benchmarking Large Vision-Language Models on Trustworthiness with Unanswerable Questions

Xingwei He, Qianru Zhang, A-Long Jin, Yuan Yuan, Siu-Ming Yiu

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01089 2024-10-03 cs.CV 83%

FMBench: Benchmarking Fairness in Multimodal Large Language Models on Medical Tasks

Peiran Wu, Che Liu, Canyu Chen, Jun Li, Cosmin I. Bercea, Rossella Arcucci

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19232 2024-10-01 cs.CV 83%

TrojVLM: Backdoor Attack Against Vision Language Models

Weimin Lyu, Lu Pang, Tengfei Ma, Haibin Ling, Chao Chen

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18753 2024-09-30 cs.CV 83%

Enhancing Explainability in Multimodal Large Language Models Using Ontological Context

Jihen Amara, Birgitta König-Ries, Sheeba Samuel

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11007 2024-09-18 cs.CL cs.CV 83%

CAST: Cross-modal Alignment Similarity Test for Vision Language Models

Gautier Dagan, Olga Loginova, Anil Batra

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13898 2024-08-27 cs.CV 83%

Evaluating Attribute Comprehension in Large Vision-Language Models

Haiwen Zhang, Zixi Yang, Yuanzhi Liu, Xinran Wang, Zheqi He, Kongming Liang, Zhanyu Ma

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12480 2024-08-26 cs.LG cs.CL 83%

Vintern-1B: An Efficient Multimodal Large Language Model for Vietnamese

Khang T. Doan, Bao G. Huynh, Dung T. Hoang, Thuc D. Pham, Nhat H. Pham, Quan T. M. Nguyen, Bang Q. Vo, Suong N. Hoang

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06400 2024-08-23 cs.CL cs.CV 83%

Generalizing Visual Question Answering from Synthetic to Human-Written Questions via a Chain of QA with a Large Language Model

Taehee Kim, Yeongjae Cho, Heejun Shin, Yohan Jo, Dongmyung Shin

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17419 2024-08-22 cs.CV 83%

AntifakePrompt: Prompt-Tuned Vision-Language Models are Fake Image Detectors

You-Ming Chang, Chen Yeh, Wei-Chen Chiu, Ning Yu

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03043 2024-08-07 cs.CV 83%

Targeted Visual Prompting for Medical Visual Question Answering

Sergio Tascon-Morales, Pablo Márquez-Neila, Raphael Sznitman

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted at the MICCAI AMAI Workshop 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00300 2024-08-02 cs.CV cs.MM 83%

Towards Flexible Evaluation for Generative Visual Question Answering

Huishan Ji, Qingyi Si, Zheng Lin, Weiping Wang

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07163 2024-05-14 physics.ed-ph cs.AI 83%

Realizing Visual Question Answering for Education: GPT-4V as a Multimodal AI

Gyeong-Geon Lee, Xiaoming Zhai

专题命中 视觉问答 :visual question answering(title,abstract);visual language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03203 2024-03-06 cs.AI 83%

CLEVR-POC: Reasoning-Intensive Visual Question Answering in Partially Observable Environments

Savitha Sam Abraham, Marjan Alirezaie, Luc De Raedt

专题命中 视觉问答 :visual question answering(title,abstract);vision language model(abstract);分类 cs.AI

Comments 17 pages, 10 images, Accepted at LREC-COLING 2024 - The 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02707 2024-03-06 cs.CV cs.MM 83%

Enhancing Generalization in Medical Visual Question Answering Tasks via Gradient-Guided Model Perturbation

Gang Liu, Hongyang Li, Zerui He, Shenjun Zhong

专题命中 视觉问答 :visual question answering(title,abstract);visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05779 2024-02-09 cs.CY cs.CL cs.CV 83%

Examining Gender and Racial Bias in Large Vision-Language Models Using a Novel Dataset of Parallel Images

Kathleen C. Fraser, Svetlana Kiritchenko

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments To appear at EACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12273 2023-12-20 cs.CV 83%

VQA4CIR: Boosting Composed Image Retrieval with Visual Question Answering

Chun-Mei Feng, Yang Bai, Tao Luo, Zhen Li, Salman Khan, Wangmeng Zuo, Xinxing Xu, Rick Siow Mong Goh, Yong Liu

专题命中 视觉问答 :visual question answering(title,abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10613 2023-12-19 cs.CV 83%

p-Laplacian Adaptation for Generative Pre-trained Vision-Language Models

Haoyuan Wu, Xinyun Zhang, Peng Xu, Peiyu Liao, Xufeng Yao, Bei Yu

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted by AAAI24. The first two authors contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02669 2023-12-19 cs.CV 83%

ConceptLab: Creative Concept Generation using VLM-Guided Diffusion Prior Constraints

Elad Richardson, Kfir Goldberg, Yuval Alaluf, Daniel Cohen-Or

专题命中 视觉问答 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

Comments Project page: https://kfirgoldberg.github.io/ConceptLab/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07176 2023-10-12 cs.CV 83%

Improving mitosis detection on histopathology images using large vision-language models

Ruiwen Ding, James Hall, Neil Tenenholtz, Kristen Severson

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments Submitted to IEEE ISBI 2024. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.11593 2023-09-22 cs.CV 83%

Sentence Attention Blocks for Answer Grounding

Seyedalireza Khoshsirat, Chandra Kambhamettu

专题命中 视觉问答 :grounding(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.11080 2023-09-21 cs.CV 83%

Visual Question Answering in the Medical Domain

Louisa Canepa, Sonit Singh, Arcot Sowmya

专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);分类 cs.CV

Comments 8 pages, 7 figures, Accepted to DICTA 2023 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.03726 2023-09-08 cs.CV 83%

Interpretable Visual Question Answering via Reasoning Supervision

Maria Parelli, Dimitrios Mallis, Markos Diomataris, Vassilis Pitsikalis

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11662 2023-08-29 cs.CV 83%

VQA Therapy: Exploring Answer Differences by Visually Grounding Answers

Chongyan Chen, Samreen Anjum, Danna Gurari

专题命中 视觉问答 :grounding(title,abstract);visual question answering(abstract);分类 cs.CV

Comments IEEE/CVF International Conference on Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08088 2023-08-17 cs.CV cs.IR cs.MM 83%

Pro-Cap: Leveraging a Frozen Vision-Language Model for Hateful Meme Detection

Rui Cao, Ming Shan Hee, Adriel Kuek, Wen-Haw Chong, Roy Ka-Wei Lee, Jing Jiang

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments Camera-ready for 23, ACM MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.01239 2023-06-08 cs.CV 83%

MixPHM: Redundancy-Aware Parameter-Efficient Tuning for Low-Resource Visual Question Answering

Jingjing Jiang, Nanning Zheng

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

Comments 13 pages, 6 figures, 9 tables. Accepted to CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏