Semantic-Clipping: Efficient Vision-Language Modeling with Semantic-Guidedd Visual Selection
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);visual reasoning(abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);visual reasoning(abstract)
波兰医学视觉问答:视觉语言模型未充分利用视觉证据
机构 * ARAAI Poland(波兰ARAAI) ; NASK National Research Institute(NASK国家研究院) ; Poznań University of Medical Sciences(波兹南医科大学) ; T. Marciniak Lower Silesian Specialist Hospital(T.马尔奇尼亚克下西里西亚专科医院) ; Adam Mickiewicz University(亚当·密茨凯维奇大学)
专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(title,abstract);grounding(abstract);分类 cs.AI
AI总结 该研究构建了波兰医学VQA基准,评估多类视觉语言模型,发现模型未充分利用视觉证据,仅从文本或答案选项即可达到高于随机水平的准确率,仅GPT-5.6在部分子集上超人类表现。
对前沿视觉-语言模型进行审计以实现可信的医学视觉问答:定位失败、格式崩溃和领域适应
机构 * New York University, New York, USA(纽约大学) ; Tsinghua University, Beijing, China(清华大学) ; Columbia University, New York, USA(哥伦比亚大学) ; University of Michigan, Ann Arbor, USA(密歇根大学)
专题命中 视觉问答 :vision-language model(title,abstract);grounding(title,abstract);visual question answering(abstract);分类 cs.AI
AI总结 本文审计了五种前沿视觉-语言模型在医学视觉问答中的表现,发现定位失败和格式崩溃是信任瓶颈,通过领域适应可提升性能。
SalArt-VQA: 诊断VLM是否理解生成图像中的显著伪影
机构 * Stanford University(斯坦福大学) ; Zhejiang University(浙江大学) ; The University of Queensland(昆士兰大学)
专题命中 视觉问答 :VLM(title_cn,summary_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 提出SalArt-VQA基准,通过950张图像和3681道多选题,从检测、定位、空间基础、缺陷识别四方面评估VLM对生成图像伪影的理解,揭示高检测准确率下隐藏的失败模式。
Comments 23 pages, 7 figures, 7 tables. Dataset: https://huggingface.co/datasets/salartvqa/SalArt-VQA
语言转换会破坏医学视觉语言模型吗?印度尼西亚放射学视觉问答案例研究
机构 * Intelligent System Laboratory, Faculty of Computer Science Brawijaya University(智能系统实验室,计算机科学学院布拉维亚大学)
专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(title,abstract);VLM(abstract_cn);分类 cs.CV
AI总结 本研究通过构建印尼语放射学VQA数据集IndoRad-VQA,评估医学视觉语言模型在非英语临床语言下的鲁棒性,发现英语与印尼语设置间存在8-25%的性能差距,表明需要更包容的多语言评估。
Comments accepted to MMFM-BIOMED Workshop @ CVPR 2026
WikiSeeker: 重新思考视觉语言模型在基于知识的视觉问答中的作用
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室 (MAIS))
专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(title,abstract);VLM(abstract);分类 cs.CV
AI总结 本文提出WikiSeeker框架,通过引入多模态检索器和重新定义视觉语言模型的角色,提升多模态检索性能和答案质量,实现在EVQA、InfoSeek和M2KR数据集上的最优表现。
Comments Accepted by ACL 2026 Findings
机构 * University of Maryland, College Park(马里兰大学)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(title,abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :VLM(title,abstract);visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(title,abstract);VLM(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(title,abstract);VLM(abstract);分类 cs.CV
位置,而非来源:在医学视觉-语言模型中分离推理中介与逢迎行为
机构 * IEM Kolkata(印度工程管理学院 Kolkata校区) ; School of UEMK Kolkata(UEMK Kolkata学院) ; Heritage Institute of Technology Kolkata(加尔各答遗产技术学院) ; Indian Institute of Information Technology, Kalyani(卡利亚尼印度信息技术学院)
专题命中 视觉问答 :LLaVA(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.LG
AI总结 本研究提出CoT-Mediate框架,结合双臂协议与来源控制干预,在VQA-RAD数据集上评估LLaVA-Med和MedGemma,发现上下文位置而非声明来源是医学VLMs使用生成推理的主要决定因素。
Earth-OneVision:将遥感多模态大语言模型扩展到更多传感器模态和任务
机构 * National Key Laboratory of Science and Technology on Space-Born Intelligent Information Processing (SBIIP), Beijing Institute of Technology(北京理工大学空间智能信息处理国家重点实验室) ; Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) ; Key Laboratory of Technology in Geo-Spatial Information Processing and Application System, Chinese Academy of Sciences(中国科学院地理空间信息处理与应用系统技术重点实验室) ; Advanced Research Institute of Multidisciplinary Sciences, Beijing Institute of Technology(北京理工大学前沿交叉科学研究院) ; School of Mechatronical Engineering, Beijing Institute of Technology(北京理工大学机电学院) ; School of Earth and Space Sciences, Peking University(北京大学地球与空间科学学院) ; School of Electronics, Peking University(北京大学电子学院) ; School of Computer Science and Hubei Key Laboratory of Intelligent Geo-Information Processing(华中科技大学计算机科学与技术学院&湖北省智能地理信息处理重点实验室)
专题命中 视觉问答 :MLLM(summary_cn,abstract);multimodal large language model(title);grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出Earth-OneVision,一个2B参数的RS-MLLM,通过全粒度视觉语言对齐、空间语言同构序列化和渐进式跨模态适应机制,统一六种传感器模态和九类任务,在多个基准上达到或超越4B-72B模型。
通过视觉语言模型从自我中心视觉解码行人过街意图
机构 * Technical University of Denmark(丹麦技术大学) ; University of Helsinki(赫尔辛基大学) ; Delft University of Technology(代尔夫特理工大学)
专题命中 视觉问答 :vision language model(title,abstract);VLM(summary_cn,abstract_cn);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 利用视觉语言模型(VLM)将行人过街意图预测转化为视觉问答任务,通过参数高效微调并结合自我运动、车辆运动和眼动等上下文线索,在自我中心视频上实现了14.5%的准确率提升,创下新纪录。
基于多模态大语言模型的遥感活动检测的时空感知
机构 * SenSIP Center, School of ECEE, Arizona State University(SenSIP中心,电子与计算机工程学院,亚利桑那州立大学) ; Prime Solutions Group Inc(Prime Solutions Group公司) ; Intelligence Advanced Research Projects Activity(智能高级研究计划局)
专题命中 视觉问答 :multimodal large language model(title);LLaVA(abstract,abstract_cn);MLLM(abstract,abstract_cn);visual question answering(abstract)
AI总结 本文提出SMART-HC-VQA数据集,用于人类活动的时空分析,通过多模态大语言模型训练框架实现遥感活动的检测与推理。
Comments Accepted to 2026 SPIE Defense + Security, Automatic Target Recognition XXXVI
BalCapRL:一种基于RL的MLLM图像描述的平衡框架
机构 * Apple(苹果公司)
专题命中 视觉问答 :MLLM(title,title_cn);LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出BalCapRL框架,通过联合优化正确性、参考覆盖和语言质量,解决图像描述中因评价指标狭窄导致的权衡问题,并通过改进的奖励解耦归一化和长度条件奖励遮蔽提升性能。
对大视觉-语言模型中偏移和幻觉的基准测试
机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) ; Amazon AGI(亚马逊人工智能实验室) ; University of Cambridge(剑桥大学)
专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出VLM-DeflectionBench基准,通过2775个样本评估模型在冲突或不足证据下的行为,揭示模型在面对噪声或误导性证据时的偏移能力不足,为可靠的KB-VQA评估提供可扩展的基准。
Comments Accepted to ACL 2026
机构 * Fudan University(复旦大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Stony Brook University(石溪大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);visual reasoning(abstract)
Comments Accepted by CVPR 2025. Project Page: https://vlmlt.github.io/
PlantExpertVQA: 一个用于植物科学中视觉语言模型基准测试的视觉问答数据集
机构 * Department of Robotics and Mechatronics Engineering, University of Dhaka(达卡大学机器人与机电工程系) ; Department of Botany, University of Dhaka(达卡大学植物学系)
专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 PlantExpertVQA数据集旨在提升视觉语言模型在农业决策中的应用,包含765,186个高质量问答对,涵盖38种作物和89种病害,通过多阶段流程生成并经专家审核,验证了参数高效微调的有效性。
Comments 36 pages, 9 figures, 14 tables and Submitted to Nature Scientific Data
专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2025:004
Journal ref Machine.Learning.for.Biomedical.Imaging. 3 (2025)
专题命中 视觉问答 :LLaVA(title,abstract);visual question answering(title,abstract);MLLM(abstract)
Comments preprint
使用多模态大语言模型从几何标签到室内建筑组件的语义理解
机构 * School of Qilu Transportation, Shandong University(山东大学齐鲁交通学院) ; Guangzhou Institute of Geography, Guangdong Academy of Sciences(广东省地理研究所)
专题命中 视觉问答 :MLLM(summary_cn,abstract);multimodal large language model(title,abstract);分类 cs.CV
AI总结 研究针对室内建筑组件,提出以点云为中心的多模态大语言模型Building-MLLM,通过特定机制解决语义集中问题,开发引擎编译数据集,实验表明其在多任务上表现优异,提升室内组件语言理解。
Comments 46 pages, 13 figures, accepted by Automation in Construction journal
回答时保持忠实:为视觉语言模型强化学习返回流畅且基于视觉依据的答案
机构 * GMLab ; Hong Kong Polytechnic University(香港理工大学) ; XPENG Robotics(XPENG机器人)
专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.AI
AI总结 提出Faithful Warm-Start (FWS)策略,通过构建具有明确视觉-语言因果关系的FaithfulQA数据集并利用VLM裁判净化,在强化学习前预热模型,提升答案准确性、稳定训练并减少无视觉依据的推理。
VISTAQA: 评估联合视觉问答与像素级证据
机构 * University of Waterloo(滑铁卢大学) ; Stanford University(斯坦福大学) ; NVIDIA(英伟达)
专题命中 视觉问答 :visual question answering(title,abstract);MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract)
AI总结 本文提出VISTAQA基准,用于评估视觉问答中自由回答的正确性和像素级证据的定位,通过引入GROVE指标,强调回答正确性与视觉证据对齐的重要性,实验显示现有系统在该指标下表现有限,揭示了回答准确性和视觉证据对齐之间的显著差距。
测试时提示法用于黑盒视觉-语言模型
机构 * AlaaLab(Alaa实验室)
专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出测试时提示法,通过单次VLM调用提升性能,无需开放权重模型访问,适用于前沿闭源模型。方法通过轻量提示生成器预测提示,引导VLM避开常见错误模式,提升自然图像VQA基准的准确率。
Proxy3D: 通过语义聚类和对齐实现视觉-语言模型的高效3D表示
机构 * Tsinghua University(清华大学) ; Panasonic AI Lab(松下人工智能实验室) ; Panasonic DX-CPS(松下DX-CPS) ; UC Berkeley(伯克利大学)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);grounding(abstract)
AI总结 本文提出Proxy3D方法,通过语义和几何编码器提取场景特征并进行语义感知聚类,生成紧凑且全面的3D代理表示,提升视觉-语言模型在3D视觉问答、视觉定位和空间智能任务中的性能。
Comments Accepted by CVPR 2026. Project page: https://wzzheng.net/Proxy3D
看到并不等于相信:揭示评估者视觉-语言模型的盲区
机构 * Nilekani Centre at AI4Bharat(AI4Bharat的Nilekani中心) ; Indian Institute of Technology Madras(印度理工学院马德拉斯分校) ; BITS Pilani, Hyderabad(海得拉巴 BITS学院)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);grounding(abstract)
AI总结 本文系统评估了评估者视觉-语言模型在I2T和T2I任务中的可靠性,通过引入针对性扰动测试其在对象幻觉、空间推理等关键错误维度上的检测能力,发现当前模型存在显著盲区。
QLIP:一种动态四叉树视觉先验增强MLLM性能无需重新训练
专题命中 视觉问答 :MLLM(title,abstract);vision language model(abstract);LLaVA(abstract);visual question answering(abstract)
AI总结 QLIP通过动态四叉树视觉先验提升MLLM的粗粒度和细粒度视觉理解能力,无需重新训练,实验显示在LLaVA v1.5系列模型上提升视觉问答准确率,且在V-star基准测试中提升细节理解性能达13.6%。
Comments Accepted as ICLR 2026 poster. 22 pages, 19 figures
专题命中 视觉问答 :vision-language model(title);vision language model(abstract);VLM(abstract);LLaVA(abstract)
专题命中 视觉问答 :vision-language model(title,abstract);visual language model(abstract);LLaVA(abstract);visual question answering(abstract)
Comments Accepted by CVPR 2025
Slot2Text:面向高效且空间可追溯的手术多模态大语言模型的以对象为中心的视觉分词
专题命中 视觉问答 :MLLM(summary_cn,abstract);visual question answering(abstract);grounding(abstract);multimodal large language model(abstract)
AI总结 Slot2Text将视觉输入转为槽潜变量,推出双模式手术MLLM,在多基准上实现高效推理,Slot2Text-Fast大幅降本,Slot2Text-Reason支持可追溯空间推理。
Comments 17 pages, 8 Figures