arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-18 至 2025-11-18 共收录 11 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 11 篇

2511.12693 2025-11-18 cs.CV cs.AI 86%

HEDGE: Hallucination Estimation via Dense Geometric Entropy for VQA with Vision-Language Models

Sushant Gautam, Michael A. Riegler, Pål Halvorsen

机构 * Simula Metropolitan Center for Digital Engineering (SimulaMet)(Simula数字工程研究中心) Oslo Metropolitan University (OsloMet)(奥斯陆 Metropolitan 大学) Simula Research Laboratory(Simula研究实验室)

专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12446 2025-11-18 cs.CV 85%

CoTBox-TTT: Grounding Medical VQA with Visual Chain-of-Thought Boxes During Test-time Training

Jiahe Qian, Yuhao Shen, Zhangtianyi Chen, Juexiao Zhou, Peisong Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港大学深圳研究院数据科学学院)

专题命中 视觉问答 :grounding(title);vision-language model(abstract);LLaVA(abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03127 2025-11-18 cs.CV cs.AI 79%

Landsat30-AU: A Vision-Language Dataset for Australian Landsat Imagery

Sai Ma, Zhuang Li, John A Taylor

专题命中 视觉问答 :vision language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11840 2025-11-18 cs.RO 78%

LAVQA: A Latency-Aware Visual Question Answering Framework for Shared Autonomy in Self-Driving Vehicles

Shuangyu Xie, Kaiyuan Chen, Wenjing Chen, Chengyuan Qian, Christian Juette, Liu Ren, Dezhen Song, Ken Goldberg

机构 * University of California Berkeley(加州大学伯克利分校) Bosch Research(博世研究) MBZUAI Texas A&M University(德克萨斯农工大学) IEOR UC Berkeley(伯克利大学工业工程与运筹学系)

专题命中 视觉问答 :visual question answering(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07864 2025-11-18 cs.CV 70%

Tracing and Mitigating Hallucinations in Multimodal LLMs via Dynamic Attention Localization

Tiancheng Yang, Lin Zhang, Jiaye Lin, Guimin Hu, Di Wang, Lijie Hu

机构 * MBZUAI Provable Responsible AI and Data Analytics (PRADA) Lab(可证明负责任的人工智能与数据分析实验室) King Abdullah University of Science and Technology(卡迪夫大学科学与技术大学) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) University of Copenhagen(哥本哈根大学) Tsinghua University(清华大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13243 2025-11-18 cs.LG cs.AI cs.CV 67%

Uncovering and Mitigating Transient Blindness in Multimodal Model Editing

Xiaoqi Han, Ru Li, Ran Yi, Hongye Tan, Zhuomin Liang, Víctor Gutiérrez-Basulto, Jeff Z. Pan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02104 2025-11-18 cs.LG cs.AI 62%

Foundation Model in Biomedicine

Xiangrui Liu, Yuanyuan Zhang, Qianyu Shang, Yingzhou Lu, Changchang Yin, Xiaoling Hu, Xiaoou Liu, Lulu Chen, Alexander Rodríguez, Yezhou Yang, Ping Zhang, Jintai Chen, Shan Du, Huaxiu Yao, Sheng Wang, Tianfan Fu, Xiao Wang

机构 * Arizona State University(亚利桑那州立大学) Purdue University(普渡大学) University of British Columbia(不列颠哥伦比亚大学) Stanford University(斯坦福大学) The Ohio State University(俄亥俄州立大学) Massachusetts General Hospital(麻省总医院) Harvard Medical School(哈佛医学院) Virginia Polytechnic Institute(弗吉尼亚多项技术学院) University of Michigan(密歇根大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Nanjing University(南京大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12131 2025-11-18 cs.CV cs.AI 62%

OAD-Promoter: Enhancing Zero-shot VQA using Large Language Models with Object Attribute Description

Quanxing Xu, Ling Zhou, Feifei Zhang, Jinyu Tian, Rubing Huang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12530 2025-11-18 cs.CV 57%

ReaSon: Reinforced Causal Search with Information Bottleneck for Video Understanding

Yuan Zhou, Litao Hua, Shilong Jin, Wentao Huang, Haoran Duan

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

Comments Accepted to AAAI 2026. Code is available at: https://github.com/robin-hlt/AAAI26-ReaSon

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10810 2025-11-18 cs.CV 57%

SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding

Zhenyu Yang, Yuhang Hu, Zemin Du, Dizhan Xue, Shengsheng Qian, Jiahong Wu, Fan Yang, Weiming Dong, Changsheng Xu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Kuaishou Technology(快手科技) Zhengzhou University(郑州大学) ShanghaiTech University(上海科技大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

Comments ICLR 2025 Accepted (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11597 2025-11-18 cs.AI cs.CL 57%

CLINB: A Climate Intelligence Benchmark for Foundational Models

Michelle Chen Huebscher, Katharine Mach, Aleksandar Stanić, Markus Leippold, Ben Gaiarin, Zeke Hausfather, Elisa Rawat, Erich Fischer, Massimiliano Ciaramita, Joeri Rogelj, Christian Buck, Lierni Sestorain Saralegui, Reto Knutti

机构 * University of Miami(迈阿密大学) University of Zurich(苏黎世大学) Stripe(Stripe公司) ETH Zurich(苏黎世联邦理工学院) Imperial College London(伦敦帝国理工学院)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

Comments Questions, system prompt and model judge prompts available here: https://www.kaggle.com/datasets/deepmind/clinb-questions

详情

展开后加载摘要…

URL PDF HTML 收藏