arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-17 至 2026-02-17 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 8 篇

2601.13157 2026-02-17 eess.SP 87%

Seeing Radio: From Zero RF Priors to Explainable Modulation Recognition with Vision Language Models

看见无线电:从零RF先验到可解释的调制识别与视觉语言模型

Hang Zou, Bohao Wang, Yu Tian, Lina Bariah, Chongwen Huang, Samson Lasaulce, Mérouane Debbah

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);VLM(abstract);visual question answering(abstract)

AI总结 本文提出利用视觉语言模型直接感知无线电波信号并推断调制模式,通过转换IQ流为图像数据,提升模型准确性至90%,并实现可解释的调制识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14989 2026-02-17 cs.CV cs.AI cs.LG 85%

ThermEval: A Structured Benchmark for Evaluation of Vision-Language Models on Thermal Imagery

ThermEval: 一种用于评估视觉语言模型在热成像上的性能的结构化基准

Ayush Shrivastava, Kirtan Gangani, Laksh Jain, Mayank Goel, Nipun Batra

机构 * Indian Institute of Technology, Gandhinagar, India(印度理工学院加尔各答分校) Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学)

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ThermEval通过结构化基准评估视觉语言模型在热成像上的性能,揭示其在温度推理和颜色映射转换上的不足,推动热视觉语言模型的发展。

Comments 8 Pages with 2 figures of main content. 2 pages of References. 10 pages of appendix with 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18053 2026-02-17 cs.RO 82%

V2V-GoT: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models and Graph-of-Thoughts

V2V-GoT: 基于多模态大语言模型和思维图的车对车协同自动驾驶

Hsu-kuang Chiu, Ryo Hachiuma, Chien-Yi Wang, Yu-Chiang Frank Wang, Min-Hung Chen, Stephen F. Smith

机构 * NVIDIA Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract)

AI总结 本文提出V2V-GoT框架,结合多模态大语言模型和图-思维方法,提升车对车协同自动驾驶的感知、预测和规划能力。

Comments Accepted by ICRA 2026 (IEEE International Conference on Robotics and Automation). Project: https://eddyhkchiu.github.io/v2vgot.github.io/ Code: https://github.com/eddyhkchiu/V2V-GoT Dataset: https://huggingface.co/datasets/eddyhkchiu/V2V-GoT-QA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13650 2026-02-17 cs.CV cs.AI cs.CL 81%

KorMedMCQA-V: A Multimodal Benchmark for Evaluating Vision-Language Models on the Korean Medical Licensing Examination

KorMedMCQA-V: 一种用于评估视觉语言模型在韩国医学资格考试中多模态多项选择问答能力的基准测试

Byungjin Choi, Seongsu Bae, Sunjun Kweon, Edward Choi

机构 * Ajou University School of Medicine(阿乔大学医学院) KAIST(韩国科学技术院)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 KorMedMCQA-V是一个用于评估视觉语言模型在韩国医学资格考试中多模态多项选择问答能力的基准测试,展示了不同模型在医疗领域中的表现差异。

Comments 17 pages, 2 figures, 6 tables. (Includes appendix.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13289 2026-02-17 cs.CV cs.AI 79%

Evaluating the Impact of Post-Training Quantization on Reliable VQA with Multimodal LLMs

评估后训练量化对多模态大语言模型可靠视觉问答的影响

Paul Jonas Kurz, Tobias Jan Wieczorek, Mohamed A. Abdelsalam, Rahaf Aljundi, Marcus Rohrbach

机构 * TU Darmstadt(图宾根大学) Toyota Motor Europe(丰田欧洲公司)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了后训练量化对多模态大语言模型可靠视觉问答的影响,提出通过选择器置信度估计器提升可靠性,并在不同量化方法中实现了效率与可靠性的最佳平衡。

Comments Accepted poster at the 1st Workshop on Epistemic Intelligence in Machine Learning (EIML) @ EURIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14462 2026-02-17 cs.CV cs.CL 77%

RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding

RAVENEA:多模态检索增强视觉文化理解的基准

Jiaang Li, Yifei Yuan, Wenyan Li, Mohammad Aliannejadi, Daniel Hershcovich, Anders Søgaard, Ivan Vulić, Wenxuan Zhang, Paul Pu Liang, Yang Deng, Serge Belongie

机构 * University of Copenhagen(哥本哈根大学) ETH Zürich(苏黎世联邦理工学院) University of Amsterdam(阿姆斯特丹大学) University of Cambridge(剑桥大学) Massachusetts Institute of Technology(麻省理工学院) Singapore University of Technology and Design(新加坡科技设计大学) Singapore Management University(新加坡管理大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 RAVENEA通过多模态检索增强方法提升视觉文化理解,验证了文化注释对多模态检索和下游任务的增强效果,并揭示了不同国家间性能差异。

Comments ICLR 2026; Project page: https://jiaangli.github.io/ravenea/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13479 2026-02-17 cs.CV cs.HC 70%

GLIMPSE : Real-Time Text Recognition and Contextual Understanding for VQA in Wearables

GLIMPSE:面向可穿戴设备的实时文本识别与上下文理解的视频大语言模型

Akhil Ramachandran, Ankit Arun, Ashish Shenoy, Abhay Harpale, Srihari Jayakumar, Debojeet Chatterjee, Mohsen Moslehpour, Pierce Chuang, Yichao Lu, Vikas Bhardwaj, Peyman Heidari

机构 * Meta Reality Labs(Meta现实实验室)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

AI总结 GLIMPSE通过混合架构在可穿戴设备上实现低功耗的实时文本识别与上下文理解,提升视频大语言模型在资源受限设备上的VQA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13890 2026-02-17 cs.CL 50%

Evaluating Prompt Engineering Techniques for RAG in Small Language Models: A Multi-Hop QA Approach

评估用于RAG的提示工程技术在小型语言模型中的表现:一种多跳问答方法

Amir Hossein Mohammadi, Ali Moeinian, Zahra Razavizade, Afsaneh Fatemi, Reza Ramezani

专题命中 视觉问答 :grounding(abstract)

AI总结 本文通过评估24种提示模板,发现优化RAG在小型语言模型上的表现提升显著,为资源受限环境下的RAG系统提供实用建议。

Comments 32 Pages, Submitted to Journal of Computing and Security

详情

展开后加载摘要…

URL PDF HTML 收藏