A Unified Hallucination Mitigation Framework for Large Vision-Language Models
专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted by TMLR
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted by TMLR
专题命中 视觉问答 :MLLM(title,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Comments ECCV 2024 Workshop EVAL-FoMo; Project Page: https://katha-ai.github.io/projects/detect-describe-discriminate/
专题命中 视觉问答 :MLLM(title,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Comments 14 pages, 8 figures
专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by ICML workshop 2024
专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.LG
Comments 13 pages
专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments 20 pages, 12 figures, 7 tables
专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments 17 pages
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.AI
Comments Preprint submitted to Information Fusion
专题命中 视觉问答 :vision-language model(title);vision language model(abstract);VLM(abstract);visual question answering(abstract)
Comments CVPR 2023
专题命中 视觉问答 :VLM(title,abstract);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Our code is available at https://github.com/imagegridworth/IG-VLM
从推理到像素:用于VQA和分割的接地医学多模态大语言模型
机构 * Nanjing University of Science and Technology(南京理工大学) ; Sungkyunkwan University(成均馆大学)
专题命中 视觉问答 :MLLM(abstract,abstract_cn);visual question answering(abstract);grounding(abstract);multimodal large language model(abstract)
AI总结 针对现有医学多模态大语言模型缺乏像素级接地的问题,提出MedREAL框架,引入SARP与R2V机制,构建MedRAVS-13K数据集,在Med-VQA和分割任务上性能优于现有方法,为医学图像分析提供可解释框架。
Comments accepted by ECCV 2026
RADAR: 通过语义规划和自主因果环境重置实现闭环机器人数据生成
机构 * Southern University of Science and Technology(南方科技大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Spatialtemporal AI(时空人工智能)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract);grounding(abstract)
AI总结 RADAR通过语义规划和自主因果环境重置实现闭环机器人数据生成,具备高适应性和可扩展性,在仿真和现实部署中均表现出卓越的性能。
Comments 8 pages, 4 figures. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page: https://radar-iros.netlify.app/
IRIS:一种通过主题树和场景驱动的VQA生成用于眼表疾病的智能视觉语言系统
机构 * The Chinese University of Hong Kong(香港中文大学) ; Westlake University(西湖大学)
专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 针对眼表疾病领域缺乏多模态数据问题,引入IRIS系统。构建IRIS-120K数据集,提出协同数据生成范式,含主题发现树和场景驱动策略,使4B参数VLM性能达最优。
Comments 11 pages, 3 figures
MSUE:多模态足球理解专家
机构 * South China University of Technology(华南理工大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Peking University(北京大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出MSUE多专家问答架构,结合VLM数据合成管道与LLM动态调度文本、图像、视频专家,在SoccerNet VQA挑战中达到0.95准确率,获第三名。
Comments 6 pages, 1 figures
放射学中比较推理的视觉语言框架
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) ; Department of Radiology, Renmin Hospital of Wuhan University(武汉大学仁民医院放射科) ; Shanghai Sixth People’s Hospital Affiliated to Shanghai Jiao Tong University(上海交通大学附属第六人民医院)
专题命中 视觉问答 :VLM(summary_cn,abstract);visual question answering(abstract);分类 cs.CV、cs.LG
AI总结 提出一个实体感知的跨图像推理框架,通过构建大规模比较影像数据集MedReCo-DB和开发MedReCo及MedReCo-VLM模型,实现了参考病例检索和时间比较解读,显著提升了放射学比较推理性能。
MASER: 面向具身3D空间智能的模态自适应专家路由
机构 * Boston University(波士顿大学)
专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出MASER框架,通过训练共享VLM骨干的五个模态适配器并学习基于问题选择最佳适配器的神经路由策略,解决具身代理在3D环境中多模态推理时忽略问题语义的问题。
Comments Accepted to CVPR 2026 Foundation Models Meet Embodied Agents Workshop
先见后议:用视觉证据对齐多智能体共识
机构 * Peking University(北京大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; Renmin University of China(中国人民大学) ; Shandong University(山东大学)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract);grounding(abstract)
AI总结 提出EAGLE框架,通过显式暴露各智能体的视觉证据区域并相互验证,实现无需训练的多智能体视觉问答协作,提升共识可靠性。
VisPhyWorld: 通过代码驱动的视频重建探测物理推理
机构 * University of Waterloo(滑铁卢大学) ; Autodesk AI Lab(Autodesk人工智能实验室) ; Independent Researcher(独立研究者)
专题命中 视觉问答 :MLLM(summary_cn,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出VisPhyWorld框架,通过要求模型从视觉观察生成可执行的模拟器代码来评估物理推理能力,引入VisPhyBench基准测试集,验证模型在重建外观和模拟物理运动方面的能力,发现最先进的MLLM在准确推断物理参数和模拟一致的物理动态方面存在困难。
DeepTumorVQA: 一种分层的3D CT基准,用于分阶段评估医学视觉语言模型和工具增强代理
机构 * Johns Hopkins University(约翰霍普金斯大学) ; University of Bologna(博洛尼亚大学) ; Istanbul Medipol University(伊斯坦布尔梅迪波尔大学) ; Center for Biomolecular Nanotechnologies, Istituto Italiano di Tecnologia(生物分子纳米技术中心,意大利技术研究院) ; The First Affiliated Hospital, Sun Yat-Sen University(中山大学第一附属医院) ; Tongji University(同济大学)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract)
AI总结 DeepTumorVQA通过分阶段证据链分解3D CT推理为四个阶段,提供工具交互环境,揭示医疗VLMs的瓶颈并展示工具增强的改进。
PLaMo 2.1-VL 技术报告
机构 * Preferred Networks, Inc.
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision language model(abstract);visual question answering(abstract);grounding(abstract)
AI总结 PLaMo 2.1-VL 是一种轻量级视觉语言模型,适用于自主设备的本地和边缘部署,支持日语操作。该模型在视觉问答和视觉定位任务中表现优异,应用于工厂任务分析和基础设施异常检测,取得了显著的性能提升。
Comments 35 pages, 9 figreus
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊) ; Penn State University(宾夕法尼亚州立大学)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);InternVL(abstract)
Comments 21 pages, 10 figures, 6 tables
当话语压力冲突时:视觉-语言模型输出中的信息结构
机构 * Department of Computer Science, Aalborg University(奥尔堡大学计算机科学系) ; Department of Psycholinguistics and Neurolinguistics, ELTE Research Centre for Linguistics(ELTE语言研究中心心理学语言学与神经语言学系) ; ELTE Bárczi Gusztáv Faculty of Special Needs Education(ELTE巴尔茨吉斯塔夫特殊教育学院)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn)
AI总结 研究视觉-语言模型在视觉问答中是否区分话语旧主题和新焦点,发现模型虽产生信息结构相关结构但过度正则化,倾向于窄响应模板,类似模式崩溃。
理解干扰项对推理视觉语言模型的影响
机构 * Pohang University of Science and Technology (POSTECH)(坡山科学技术大学(POSTECH))
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 本文通过构建包含语义和数值维度干扰项的视觉问答数据集Idis,研究视觉干扰项如何影响视觉语言模型的测试时缩放行为,发现视觉干扰项以与文本干扰项根本不同的方式降低准确率而不增加推理长度,并提出简单提示策略缓解干扰项驱动的预测。
Comments preprint
DarkQA:在低光室内场景中对视觉-原始问题进行问答的视觉语言模型基准测试
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) ; Pohang University of Science and Technology (POSTECH)(釜山科学技术大学)
专题命中 视觉问答 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 DarkQA针对低光环境下视觉语言模型的感知基本能力进行基准测试,通过多级低光条件评估,揭示模型在复杂任务中的局限性。
Comments This work has been submitted to the IEEE for possible publication
V-SEAM:视觉语义编辑与注意力调节用于视觉-语言模型的因果可解释性
机构 * Tongji University(同济大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn)
AI总结 本文提出V-SEAM框架,结合视觉语义编辑和注意力调节,提升视觉-语言模型的因果可解释性,通过多级语义分析增强模型性能。
Comments EMNLP 2025 Main
BERAG:基于贝叶斯集成的检索增强生成用于基于知识的视觉问答
机构 * Department of Engineering(工程系)
专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract,abstract_cn)
AI总结 BERAG通过将语言模型条件于单个检索文档而非单一上下文,解决检索增强生成中文档贡献不明和长上下文中的信息丢失问题,提升视觉问答任务性能。
保护多模态大语言模型免受误导性可视化的影响
机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(普遍知识处理实验室(UKP实验室)、计算机科学系,德累斯顿技术大学及应用网络安全国家研究中心ATHENE) ; Department of Electrical Engineering, KU Leuven(电气工程系,鲁文大学) ; Department of Computer Science, KU Leuven(计算机科学系,鲁文大学)
专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn)
AI总结 研究发现多模态大语言模型在面对误导性可视化时回答准确性显著下降,提出两种有效方法提升其处理能力,同时保持非误导性可视化下的准确性。
Comments Preprint. Code and data available at https://github.com/UKPLab/arxiv2025-misleading-visualizations
多模态行为树生成:一种小型视觉-语言模型用于机器人任务规划
机构 * Department of Electronics, Information, and Bioengineering, Politecnico di Milano(电子信息与生物工程系,米兰理工学院)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract)
AI总结 本文提出一种小型视觉-语言模型,通过生成行为树提升机器人任务规划效率,实验证明其在性能和资源消耗上均优于现有闭源模型。
ThermEval: 一种用于评估视觉语言模型在热成像上的性能的结构化基准
机构 * Indian Institute of Technology, Gandhinagar, India(印度理工学院加尔各答分校) ; Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学)
专题命中 视觉问答 :vision-language model(title);vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 ThermEval通过结构化基准评估视觉语言模型在热成像上的性能,揭示其在温度推理和颜色映射转换上的不足,推动热视觉语言模型的发展。
Comments 8 Pages with 2 figures of main content. 2 pages of References. 10 pages of appendix with 6 figures