IQA: Visual Question Answering in Interactive Environments
专题命中 视觉问答 :visual question answering(title);分类 cs.CV
Comments Published in CVPR 2018
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(title);分类 cs.CV
Comments Published in CVPR 2018
专题命中 视觉问答 :visual question answering(title);分类 cs.CV
Comments Submitted to Reproducibility in ML Workshop, ICML'18
专题命中 视觉问答 :visual question answering(title);分类 cs.CV
Comments Accepted to CVPR 2018
专题命中 视觉问答 :visual question answering(title);分类 cs.CV
专题命中 视觉问答 :visual question answering(title);分类 cs.CV
Comments Submitted to ECCV 2016
MedFG-VQA:用于轻量级医学视觉问答的低频记忆与图注意力
机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) ; State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(高端工程机械智能制造国家重点实验室) ; Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电气与计算机工程系) ; School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 MedFG-VQA是轻量级医学VQA框架,通过FMF和GACA实现高效视觉-文本对齐,构建含200万对问答的SynMed-VQA数据集,性能优于大模型且计算成本低,适用于临床部署。
Comments Accepted by CVPR 2026
Llama-Mobile:视觉语言模型的高效2.7位量化
机构 * Graphcore Research(Graphcore研究院) ; Arm(Arm公司)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
AI总结 针对VLMs部署于移动设备的资源瓶颈,提出结合自生成训练数据的量化流水线与2.7位参数格式的框架,将Llama 3.2 11B Vision Instruct模型压缩至3.7 GB且保留视觉问答任务性能。
通用科学人工智能的实现路径:科学图像的多模态理解
机构 * TIB Leibniz Information Centre for Science and Technology(莱布尼茨科学与技术信息中心(TIB)) ; Eindhoven University of Technology(埃因霍温理工大学) ; Freie Universität Berlin(柏林自由大学) ; International Center for Chemical and Biological Sciences, University of Karachi(卡拉奇大学国际化学与生物科学中心) ; National University of Sciences and Technology(国家科技大学) ; University of Warwick(华威大学) ; PSG College of Technology(PSG理工学院) ; Aalto University(阿尔托大学)
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出以科学图像多模态理解构建通用科学AI的路径,依托ALD/E-ImageMiner基准与2026年ICDAR竞赛,明确相关任务能力检验维度及长期研究方向,推动可机器执行的科学视觉知识与可验证多模态科学AI发展。
Comments 15 pages, 1 figure
CARE:用于可靠医学视觉问答的置信感知推理
机构 * Ant Group(蚂蚁集团) ; University of Michigan(密歇根大学) ; City University of Hong Kong(香港城市大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对医学多模态大语言模型的置信度校准问题,提出CARE框架,通过双阶段流程优化准确率与校准度,在三个医学VQA基准上取得最优性能,为临床决策支持提供可信基础。
Comments Accepted by MICCAI 2026
PinpointQA: 一个用于室内视频中微小物体中心空间理解的数据集和基准
机构 * Jilin University(吉林大学) ; National Taiwan University(国立台湾大学)
专题命中 视觉问答 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出PinpointQA数据集,用于评估多模态大语言模型在室内视频中对微小物体空间定位的精准理解能力,通过四个递进任务验证模型性能,并展示其作为诊断基准和训练数据集的效果。
Comments Accepted at the ECCV 2026 Workshop on Embodied Multimodal Reasoning in Physical Environments (EMR)
Geo-Embed:面向城市理解的统一多模态嵌入
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG
AI总结 本文针对现有多模态嵌入模型难以支持异构地理空间任务的问题,提出GeoMEB基准与Geo-Embed模型,在GeoMEB上实现15.3%的相对性能提升,为地理空间嵌入器发展提供方向。
FAU参加2026年ImageCLEF多模态推理任务:鲁棒候选评分与简洁多语种视觉问答
机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔兰根-纽伦堡大学)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.LG
AI总结 FAU提交的多模态推理系统,未做任务特定模型训练,在2026年ImageCLEF竞赛中,获Visual MCQ第三名、Visual OpenQA第一名,凸显推理工程的实用价值。
Comments 16 pages, 3 figures, 7 tables. CLEF 2026 Working Notes, ImageCLEF 2026 Multimodal Reasoning Task
LongChart VQA:面向具备复杂多图表推理能力的多模态大语言模型的综合基准
机构 * The University of Hong Kong(香港大学)
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 LongChart VQA是面向具备复杂多图表推理能力的MLLMs的综合基准,该基准含平均6.5张图像与31.2个问题,评估10个SOTA MLLMs发现其准确率随计算复杂性提升下降,为多图表推理研究指明方向。
ORCA:面向无需训练的3D CT视觉令牌压缩的器官质心聚合方法
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 针对3D CT视觉令牌压缩的痛点,提出无需训练的即插即用ORCA方法,在多数据集、多任务上实现显著压缩比与速度提升,性能优于现有方法。
FORGE:用于长视频理解的相关几何中的帧正交性
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Center for Signal and Information Processing (CSIP)(信号与信息处理中心 (CSIP)) ; School of Electrical and Computer Engineering(电气与计算机工程学院)
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.LG
AI总结 研究长视频理解中推理时最大化查询相关信息问题,提出FORGE模型无关方法,通过在预训练嵌入空间引入查询条件几何统一相关性和多样性,实验证明该方法在关键帧选择和问答上有显著提升。
Comments Under Review
深度专家注入用于带有领域特定知识的视网膜视觉语言模型的锚定
机构 * Beijing Institute of Technology, Beijing, China(北京理工大学) ; National University of Singapore, Singapore(新加坡国立大学) ; Tsinghua University, Beijing, China(清华大学) ; The Hong Kong Polytechnic University, Hong Kong(香港理工大学)
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 本文提出EyExIn框架,通过深度专家注入机制提升视网膜VLMs的领域知识嵌入能力,解决感知与推理间隙问题,实现高精度眼科视觉问答。
穿越幻象:一种双路径代理框架用于鲁棒的误导图表问答
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出ChartCynics双路径框架,通过分离感知与验证,利用诊断视觉路径和OCR驱动数据路径解决图表误导问题,提升模型鲁棒性。
Comments 10pages, 4 figures
PosterHarness:将科学海报生成转变为可审计的指令跟随基准
机构 * School of Physics, Peking University(北京大学物理学院)
专题命中 视觉问答 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 研究针对文本丰富图像模型,缺乏衡量其是否遵循科学传播规范的方法这一问题,提出PosterHarness,将海报生成变为可审计任务,介绍核心方法,展示了相关实验发现及与其他方法的对比结果。
离散扩散语言模型用于交互式放射报告草稿生成
机构 * Stanford University School of Medicine(斯坦福大学医学院) ; Ghent University(根特大学) ; Stanford University(斯坦福大学)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI、cs.LG
AI总结 提出将离散扩散语言模型用于放射报告草稿生成,利用其任意顺序填充能力实现交互式编辑,在医学VQA任务上达到或超越自回归模型,解码速度快3.5-4.4倍。
SEPS:面向细粒度跨模态对齐的语义增强补丁精简框架
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 提出SEPS框架,通过两阶段机制整合稠密与稀疏文本语义,识别显著视觉补丁,并利用相关性感知选择与均值计算突出关键补丁-词对应,提升跨模态相似度评估,在Flickr30K和MS-COCO上rSum提升23%-86%。
如何训练长上下文视觉文档模型
机构 * LightOn
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 本文研究长上下文视觉语言模型的训练方法,通过系统分析预训练、监督微调和偏好优化,实现MMLongBenchDoc上的最佳性能,并发现匹配评估上下文长度的训练效果更优。
增强工具的时空推理用于视频问答任务的优化
机构 * BNRist, Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系,北京信息科学与技术国家研究中心)
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 本文提出STAR框架和视频工具包,提升多模态大语言模型的时空推理能力,在VideoMME和LongVideoBench上分别提升8.2%和4.6%。
Comments Accepted by NeurIPS 2025 main track
通过平滑MMD对齐增强LLM中的数值预测
机构 * College of Computer Science, Sichuan University, Chengdu, China(四川大学计算机学院,成都,中国)
专题命中 视觉问答 :VLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 针对LLM在数值预测任务中精度不足的问题,提出平滑最大均值差异(SMMD)方法,通过数值令牌的距离核和图平滑对齐预测分布,在数学推理等任务中显著提升准确率。
你到底有多确定?改进医学视觉问答中的口头不确定性校准
机构 * Politecnico di Milano(米兰理工大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
AI总结 针对多模态大语言模型在医学VQA中过度自信的问题,提出基于复合损失函数的微调框架,通过校准项、锚定正则化、对比对齐和KL稳定项,将校准误差降低60%以上,判别力提升26%以上。
多模态大语言模型的置信度校准:基于医学视觉问答的实证研究
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) ; Zhihui Medical Technology (Shanghai) Co., Ltd.(智汇医疗科技(上海)有限公司)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 针对多模态大语言模型在医学任务中置信度与准确性不匹配的问题,提出结合多策略融合询问与专家大语言模型评估的方法,在三个医学VQA数据集上将期望校准误差平均降低40%,提升了模型可靠性。
Comments Accepted by MICCAI 2025
KeepLoRA++: 基于层级缩放残差梯度适应的持续学习
机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; Key Laboratory of Computer Network and Information Integration, Southeast University, Ministry of Education(东南大学计算机网络和信息集成教育部重点实验室) ; Huawei Noah’s Ark Lab(华为诺亚方舟实验室)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
AI总结 针对预训练视觉语言模型持续学习中保留预训练知识、旧任务知识和学习新知识的冲突,提出KeepLoRA++,通过层级缩放残差梯度适应方法,限制LoRA参数更新到残差子空间并采用浅到深层缩放,平衡三者,在图像分类、视觉问答和视频理解任务上优于基线。
MVEB:大规模视频嵌入基准
机构 * Harvard University(哈佛大学) ; SaluteDevices ; MIRAI ; Zendesk ; Shanghai University of Finance and Economics(上海财经大学) ; Google LLC ; Salesforce ; Cornell University(康奈尔大学) ; Astera Institute(Astera研究院) ; Independent Contributor(独立贡献者) ; Indian Institute of Technology, Kharagpur(印度理工学院,克拉格浦分校) ; Barclays(巴克莱银行) ; Aarhus University(奥胡斯大学) ; Stanford University(斯坦福大学)
专题命中 视觉问答 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.LG
AI总结 提出MVEB基准,包含23个任务评估33种视频嵌入模型,发现无单一模型占优,音频贡献取决于标注来源,并集成到MTEB生态。
ChartAgent: 一种用于复杂图表问答中视觉基础推理的多模态智能体
机构 * J.P. Morgan AI Research(摩根大通人工智能研究)
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 提出ChartAgent框架,通过迭代分解查询为视觉子任务并利用图表专用视觉工具(如绘制注释、裁剪区域)进行空间域推理,在ChartBench和ChartX上取得最先进性能,尤其对无标注图表提升显著。
Comments Accepted at ACL 2026 (Main Conference). Also presented as an oral paper at the NeurIPS 2025 Multimodal Algorithmic Reasoning Workshop (https://marworkshop.github.io/neurips25/)
AgroOmni:一个大规模多视角农业数据集用于跨尺度多模态推理
机构 * Sun Yat-sen University(中山大学) ; Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) ; HuanTian Wisdom Technology Co., Ltd.(慧天智慧科技有限公司) ; China Agricultural University(中国农业大学) ; Southwest Jiaotong University(西南交通大学) ; National Supercomputing Center in Shenzhen(深圳国家超算中心) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出AgroOmni数据集,通过288K视觉问答对覆盖56个专业任务类别,解决多视角跨尺度农业多模态推理中的尺度偏差问题,提出AgroNVILA模型在AgroMind基准上达到62.32%的SOTA成绩。
MedVision:定量医学图像分析的基准测试
机构 * University of Edinburgh(爱丁堡大学) ; Queen Mary University of London(伦敦大学玛丽女王学院)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 针对当前医学视觉语言模型缺乏定量推理能力的问题,提出MedVision数据集和基准,涵盖22个公共数据集、3080万图像-标注对,通过监督和强化微调显著提升检测、肿瘤/病变大小估计和角度/距离测量性能。
Comments 22 pages, 13 figures, 14 tables