MM-R$^3$: On (In-)Consistency of Vision-Language Models (VLMs)
专题命中 视觉问答 :vision-language model(title);vision language model(abstract);VLM(abstract);LLaVA(abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :vision-language model(title);vision language model(abstract);VLM(abstract);LLaVA(abstract)
机构 * Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉问答 :vision-language model(title,abstract);visual language model(abstract);LLaVA(abstract);visual question answering(abstract)
Comments Accepted by CVPR 2025
Slot2Text:面向高效且空间可追溯的手术多模态大语言模型的以对象为中心的视觉分词
专题命中 视觉问答 :MLLM(summary_cn,abstract);visual question answering(abstract);grounding(abstract);multimodal large language model(abstract)
AI总结 Slot2Text将视觉输入转为槽潜变量,推出双模式手术MLLM,在多基准上实现高效推理,Slot2Text-Fast大幅降本,Slot2Text-Reason支持可追溯空间推理。
Comments 17 pages, 8 Figures
MedLVR: 基于潜在视觉推理的可靠医学视觉问答
机构 * Department of Radiation Oncology and Winship Cancer Institute, Emory University School of Medicine(埃默里大学医学院放射肿瘤学系与温希普癌症研究所) ; Department of Biostatistics and Bioinformatics, Emory University(埃默里大学生物统计学与生物信息学系)
专题命中 视觉问答 :visual reasoning(title,abstract);visual question answering(title,abstract);分类 cs.CV、cs.AI
AI总结 MedLVR通过引入显式视觉证据状态,在自回归解码中插入短时latent推理段,提升医学视觉问答的可靠性与准确性。
DocVAL:用于基于文档的视觉问答的验证链式思维蒸馏
机构 * Department of Computer Science(计算机科学系) ; Engineering, Ohio State University, Ohio, US(工程系,俄亥俄州立大学,俄亥俄,美国) ; Department of Computer Science, University of Central Florida, Florida, US(计算机科学系,中央佛罗里达大学,佛罗里达,美国)
专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);visual question answering(abstract);grounding(abstract)
AI总结 提出DocVAL框架,通过验证链式思维蒸馏将大型教师模型的空间推理能力转移到紧凑学生模型,结合规则验证器和两阶段训练,在文档VQA任务上提升定位性能。
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Alibaba Cloud Computing(阿里云 computing) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉问答 :VLM(title,abstract);vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by NeurIPS 2025
机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) ; Shanghai Open University(上海开放大学) ; ZhuQingTing Data Technology (Zhejiang) Co., Ltd(朱清庭数据科技(浙江)有限公司)
专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(title,abstract);分类 cs.CV、cs.LG
Comments 10 pages,4 figures,accepted by CVPR2025
机构 * China Academy of Electronics and Information Technology(中国电子科技集团公司电子科学研究院) ; Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; New York University Abu Dhabi(纽约大学阿布扎比分校)
专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(title);VLM(abstract);分类 cs.CV、cs.AI
机构 * H. Lee Moffitt Cancer Center & Research Institute(H.李·莫菲特癌症中心与研究所)
专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(title,abstract);分类 cs.CV、cs.LG
Comments 43 pages; paper edited and restructured
专题命中 视觉问答 :visual question answering(title,abstract);grounding(title,abstract);分类 cs.CV、cs.AI
Comments Accepted to EMNLP 2016
问两次,看两次:提示回声解决视觉语言模型中的问题优先悖论
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 研究视觉语言模型中问题优先提示的悖论,发现问题前置虽能引导感知但后续答案生成阶段难关注到问题。提出问题回声方法,即在图像两侧重复问题,解决了悖论,在多基准测试中表现出色且无需训练等。
专题命中 视觉问答 :vision-language model(title);vision language model(abstract);VLM(abstract);visual question answering(abstract)
基于记忆树引导的关键帧查询的高效三维问答
机构 * University of Washington(华盛顿大学) ; Amazon(亚马逊公司) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视觉问答 :LLaVA(summary_cn,abstract);VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV
AI总结 本研究针对具身场景三维问答的效率问题,提出MemTree3D记忆树引导的关键帧选择方法,在OpenEQA数据集上显著提升GPT-4o与LLaVA-OneVision-7B的问答性能,优于现有视觉搜索方法。
Comments ECCV 2026
VisRAG2.0:通过视觉检索增强生成中的证据引导多图像推理减轻视觉幻觉
机构 * School of Software and Microelectronics, Peking University, China(北京大学软件与微电子学院) ; School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) ; Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系)
专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);visual question answering(abstract);grounding(abstract)
AI总结 研究针对视觉检索增强生成中VLM存在的视觉幻觉及证据识别问题,提出证据引导的多图像推理框架EVisRAG,引入RS-GRPO改进训练,实验表明该方法能提升性能、减少幻觉,有效提高视觉基础和推理可靠性。
DDVT:用于视觉问答中答案定位的动态双级视觉Transformer融合网络
机构 * National and Local Joint Engineering Laboratory of Computer Aided Design, School of Software Engineering, Dalian University(大连大学软件工程学院计算机辅助设计国家地方联合工程实验室) ; School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院)
专题命中 视觉问答 :visual question answering(title,abstract);grounding(title,abstract);分类 cs.CV
AI总结 研究视觉问答中答案定位问题,提出动态双级视觉Transformer融合网络DDVT,含问题引导的动态区域级模块和跨模态多尺度聚合模块,能精确定位相关视觉内容并融合文本特征,实验证明其性能优于现有方法。
Comments Accepted by CGI
基于视觉语言模型的持续学习用于自动驾驶中的视觉问答
机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 视觉问答 :visual question answering(title,abstract);VLM(title);vision-language model(abstract);分类 cs.CV
AI总结 本文提出结合视觉语言模型与持续学习的方法,以提升自动驾驶中视觉问答系统的性能和可靠性。
机构 * Mechanical Engineering, Colorado School of Mines(机械工程,科罗拉多矿业学院) ; Electrical Engineering, Colorado School of Mines(电气工程,科罗拉多矿业学院)
专题命中 视觉问答 :VLM(title,abstract);vision language model(title);vision-language model(abstract);分类 cs.CV
机构 * University of Memphis, TN, USA(密苏里大学) ; Adobe Research, San Jose, CA, USA(Adobe研究院) ; University of Maryland Baltimore County, USA(马里兰大学巴尔的摩县分校)
专题命中 视觉问答 :vision language model(title,abstract);visual question answering(title,abstract);分类 cs.CV
机构 * Canon Medical Research Europe(Canon医疗研究欧洲)
专题命中 视觉问答 :visual question answering(title,abstract);grounding(title,abstract);分类 cs.CV
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Salesforce AI Research(Salesforce人工智能研究)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(title);visual reasoning(abstract);分类 cs.LG
Comments SSI-FM Workshop ICLR 2025
机构 * Sorbonne University(索邦大学) ; International University of Rabat(拉巴特国际大学)
专题命中 视觉问答 :VLM(title,abstract);vision language model(title);vision-language model(abstract);分类 cs.AI
机构 * Sun Yat-sen University(中山大学) ; Tsinghua University(清华大学) ; Worcester Polytechnic Institute(伍斯特理工学院)
专题命中 视觉问答 :visual question answering(title,abstract);MLLM(title);multimodal large language model(abstract);分类 cs.CV
机构 * Walailak University(瓦莱岚大学)
专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(title,abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(title);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :visual reasoning(title,abstract);visual question answering(title,abstract);分类 cs.CV
Comments A pre-print version and submitted to journal
ReasonEdit:通过人类推理编辑视觉语言模型
机构 * University of Virginia(弗吉尼亚大学) ; University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 ReasonEdit通过引入人类推理机制,改进视觉语言模型的编辑能力,提升编辑泛化性能。
Comments ICML 2026
看到红色,想到负面:视觉语言模型中的颜色偏差
机构 * National Institute of Advanced Industrial Science and Technology (AIST)(日本产业技术综合研究所) ; University of Tsukuba(筑波大学) ; University of Technology Nuremberg(纽伦堡工业大学) ; University of Oxford(牛津大学)
专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 本研究发现VLMs存在颜色偏差,通过引入Stealth Visual Prompts控制文本视觉风格,发现颜色、对比度会影响VLMs的情感预测和VQA输出,其行为与视觉编码器潜在表示变化相关。
Comments 15 pages. Accepted to ICPR 2026
Journal ref In: Pattern Recognition. ICPR 2026. Lecture Notes in Computer Science. Springer, Cham, pp. 261-275
面向放射学的空间定位2D视觉-语言模型的可扩展训练
机构 * Computer Vision Group, University of Freiburg, Germany(德国弗莱堡大学计算机视觉组) ; Department of Radiology, Medical Center -- University of Freiburg, Germany(德国弗莱堡大学医学中心放射科) ; CRIION-AI Lab, Freiburg, Germany(德国弗莱堡CRIION-AI实验室)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract_cn);visual question answering(abstract);grounding(abstract)
AI总结 提出RefRad2D大规模双语数据集,通过LLM和自动分割生成空间定位数据,训练RadGrounder模型联合完成报告生成、VQA和空间定位,在外部基准上取得竞争性结果。
Comments Accepted for MICCAI 2026. First two authors: equal contribution. Last two authors: equal supervision
超越3D VQA:将3D空间先验注入视觉-语言模型以增强几何推理
机构 * FAIR at Meta(Meta的FAIR)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI
AI总结 提出GASP框架,通过将几何先验注入LLM的Transformer层,利用对比损失和深度一致性监督训练,显著提升VLM的3D空间推理能力,在多个基准上取得大幅提升。
Comments CVPR 2026. Project page: https://danielchyeh.github.io/GASP/
ClimateIQA: 一种新的数据集和基准,以推进气象异常分析中的视觉-语言模型
机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(人工智能研究所,香港科学与技术大学(广州)) ; Thrust of Data Science and Analytics, The Hong Kong University of Science and Technology (Guangzhou)(数据科学与分析研究所,香港科学与技术大学(广州)) ; Harvard University(哈佛大学) ; Peking University(北京大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);visual question answering(abstract)
AI总结 ClimateIQA通过引入SPOT算法和新型数据集,提升视觉-语言模型在气象异常分析中的准确性和表现。