Embodied Question Answering
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 20 pages, 13 figures, Webpage: https://embodiedqa.org/
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 20 pages, 13 figures, Webpage: https://embodiedqa.org/
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted in ICCV 2017. The arxiv version has an extra analysis on correlation with human attention
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 11 pages, 4 figures, 2 tables, webpage: http://visualdialog.org/
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Presented in AAAI-15 Workshop: Beyond the Turing Test
V2P-Bench: 通过视觉提示评估视频语言理解以提升人机交互
机构 * University of Science and Technology of China(中国科学技术大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Xi’an Jiaotong University(西安交通大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI;VLM(comments)
AI总结 V2P-Bench通过视觉提示评估视频语言理解,提升人机交互效率与体验,揭示模型在时空理解上的不足及Hack现象。
Comments Project Page: https://vlm-reasoning.github.io/V2P-Bench/
循环机制与Transformer结合的通用多模态检索模型
机构 * Department of Education and Humanities, University of Modena and Reggio Emilia(教育与人文学院, Modena and Reggio Emilia大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出结合循环机制与Transformer的统一多模态检索模型ReT-2,其支持多模态查询,在M2KR等基准上达最优性能,推理更快、内存占用更低,还可提升下游任务表现。
Comments TPAMI 2026
Quasar:一种专门用于LLM代码操作的编程语言
专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出专门用于LLM代码操作的编程语言Quasar,通过分离内部代码与外部调用实现新特性,还实现了访问控制、自动并行化、共形预测等增强代码操作的特性。
Journal ref Third Conference on Language Modeling (COLM 2026)
OVIBench:面向中断场景的在线视频问答基准测试
机构 * HIT(哈尔滨工业大学) ; CASIA(中国科学院自动化研究所) ; ZJU(浙江大学) ; UESTC(电子科技大学) ; HKUST(香港科技大学)
专题命中 视觉问答 :vision language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对现有视频问答基准未考虑用户中断的问题,提出首个面向中断场景的在线视频问答基准OVIBench,开发模拟协议与指标集,构建训练集OVI-Train,验证了其有效性。
Comments EMNLP 2026
第10届AI City挑战赛
机构 * Santa Clara University(圣克拉拉大学) ; University at Albany, SUNY(纽约州立大学奥尔巴尼分校) ; Iowa State University(爱荷华州立大学) ; Woven by Toyota(丰田编织公司) ; United Arab Emirates University(阿拉伯联合酋长国大学) ; National Yang Ming Chiao Tung University(国立阳明交通大学) ; University of Macau(澳门大学) ; North Carolina State University(北卡罗来纳州立大学) ; Columbia University(哥伦比亚大学) ; Milestone Systems(里程碑系统公司) ; Xi’an Jiaotong University(西安交通大学) ; Johns Hopkins University(约翰斯·霍普金斯大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文总结了与ECCV 2026同期举办的第10届AI City挑战赛的设置、数据集、评估结果等,该赛事规模扩大,设多类赛道,成功系统结合基础模型与多种技术。
Comments Summary of the 10th AI City Challenge Workshop in conjunction with ECCV 2026
UniTraffic-Agent:面向2026年AI城市挑战赛第3赛道的统一交通视频推理,含两项域外评估
机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences (UCAS)(中国科学院大学计算机科学与技术学院) ; Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所) ; Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) ; School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 UniTraffic-Agent是第10届AI城市挑战赛第3赛道的MR-CAS解决方案,采用观察-推理-行动-验证工作流,在TAR、FETV、PSI-VQA三项任务中取得相应排名,为交通视频推理提供了新方案。
Comments This paper has been accepted to ECCV 2026 AI City Challenge Workshop
JieZi:用于古文字训诂的大规模专家审核数据集与基准
机构 * South China University of Technology(华南理工大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文针对古文字训诂研究缺乏结构化数据与基准的问题,提出ACCE任务,构建JieZi-Dataset与JieZi-Bench,实验发现多模态大模型在古文字训诂的高阶任务上表现不佳,微调后性能显著提升。
Comments 19 pages, 13 figures. Accepted to the Dataset Track of ACM Multimedia 2026 for oral presentation
R4DSG:面向长时序自我中心视频中以对象为中心的问答的相对4D场景图记忆
机构 * Samsung R&D Institute China - Beijing(三星中国研发研究院(北京)) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出R4DSG,一种面向长时序自我中心视频的相对4D场景图记忆,在EgoLifeQA数据集的对象相关问答任务中,较EgoRAG-Text取得显著性能提升,可作为可穿戴助手等的实用记忆载体。
Comments 10 pages, 3 figures, ACM Multimedia 2026, egocentric video; 3D scene graph; temporal memory; graph retrieval; object-state reasoning; multimodal question answering
PRISM:基于结构化多模态数据合成的感知优先级的评分标准内化
专题命中 视觉问答 :MLLM(abstract_cn);分类 cs.AI、cs.LG
AI总结 该研究针对多模态指令多要求重要性不等的问题,提出PRISM四阶段数据合成框架,结合PRISM-Eval评估,提升多模态大模型的多规则优先级感知指令遵循能力。
2026年EgoVis首届EgoCross挑战赛:跨域自我中心视频问答
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文介绍2026年EgoVis研讨会举办的首届EgoCross跨域自我中心视频问答挑战赛,含两个赛道,共获1500余份提交,公布结果与获胜方案,资源公开以推进相关研究。
Comments 1st EgoCross challenge @ EgoVis workshop, CVPR26
推理前的感知:面向视频理解与问答的动态隐式推理
机构 * Rice University(莱斯大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对视频问答现有方法依赖长文本思维链的问题,提出DyLaR模型,通过动态调整感知与推理隐式变量的使用,在9个视频基准上提升准确率且缩短响应长度。
具备知识意识的视觉-语言基础模型用于胎儿超声解读
机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(国家多媒体软件工程技术研究中心,武汉大学计算机学院) ; College of Computing and Data Science, Nanyang Technological University(computing and Data Science学院,南洋理工大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 FetalMind通过Salient Epistemic Disentanglement方法,提升胎儿超声解读的准确性和效率,实现多视图图像推理和疾病诊断的高效处理。
Comments KDD 2026
3DZip:面向3D视觉问答的空间感知特征多样性引导的Token压缩方法
机构 * Pusan National University(釜山国立大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文针对3D视觉问答中Token压缩忽略空间特性的问题,提出三阶段框架3DZip,在三个基准上以128个Token保留94.7%性能、提速1.92倍,优于现有方法。
Comments Accepted to ECCV 2026. Project page: https://cvsp-lab.github.io/3DZip
Obshazard-bench:面向原始地球观测流的实时灾害情报多模态基础模型基准测试
机构 * National University of Defense Technology(国防科技大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 本研究推出Obshazard-bench基准测试,评估多模态基础模型的实时灾害情报能力,发现现有模型在将原始多通道物理观测转化为符合决策需求的灾害推理方面存在显著局限。
SAGE:面向多模态学习与幻觉分析的专家标注南亚胃肠内镜数据集
机构 * Nepal Applied Mathematics and Informatics Institute for Research(尼泊尔应用数学与信息技术研究所) ; GastroIntestinal Department, Dhulikhel Hospital(杜尔基hel医院消化内科) ; Univesity of Lausanne(洛桑大学) ; University of West Virginia(西弗吉尼亚大学) ; University of Utah(犹他大学) ; University of Aberdeen(阿伯丁大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 为解决南亚地区胃肠癌诊断数据缺乏问题,构建了包含1300张图像、标注和问答对的SAGE数据集,并评估了模型在人口偏移下的性能下降。
手语问答:手语理解的新任务、基准与基线模型
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出手语问答新任务,构建基于PHOENIX14T与CSL-Daily的SignQA基准,设计带特定模块的基线模型,实验显示其在各问题类别上优于代表性视觉-语言模型。
评估用于视频游戏QA中自主代理驱动的几何裁剪检测的视觉语言模型
机构 * Sony Interactive Entertainment(索尼互动娱乐)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究在代理驱动游戏QA中用VLMs检测几何裁剪异常,通过自定义代理收集视觉观察,自动注释提供标签,在零样本提示下对六个VLMs基准测试,分析对提示变体的敏感性,结果显示VLMs适合作多阶段QA管道的高召回候选过滤器。
视频中的思考:视频生成器真的能对现实世界进行推理吗?
机构 * Central South University(中南大学) ; Tencent(腾讯) ; Tsinghua University(清华大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 探讨视频生成器能否对现实世界推理,引入因果生成双判断(CGDJ)评估,发现开源模型无明确因果感知却有合理动态,先进闭源系统推理与生成一致性有限,还揭示了视听失调问题。
NLPCC 2026共享任务1概述:难度感知多语言多模态医学教学视频理解评估
机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与工程学院) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 NLPCC 2026的DA - MIVQA共享任务,通过区分问题难度扩展多语言多模态医学视频基准,含三个赛道。其数据集来自公共医学教学渠道,涵盖多种场景并经人工标注难度。该任务为评估医学教学视频问答系统提供实用基准。
Comments 19 pages, 6 figures, 6 tables
停止思考,开始观察:通过无推理对齐实现多模态文档问答的高效训练后优化
专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 研究多模态文档问答中高效训练后优化问题,提出感知 - RFT 框架,用组相对策略优化绕过推理令牌直接对齐视觉与基础输出,通过构建变体评估推理必要性,发现启用推理模型有优势,还识别基础差异,表明早期转换可减少训练数据并保持精度。
Comments Accepted at ICML 2026, Workshop on Efficient Multimodal Question Answering (EMM-QA)
有证据支持的视频问答
机构 * Salesforce, Palo Alto, CA, USA(Salesforce公司) ; Brown University, Providence, RI, USA(布朗大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 研究视频问答中模型缺乏可视化依据的问题,提出E-VQA任务及ST-Evidence基准,开发数据集ST-Evidence-Instruct,通过微调提高模型表现,为可解释的视频理解建立基线。
Journal ref ECCV 2026
关于CVPR 2026@AdvML研讨会挑战赛的技术报告
机构 * Beihang University(北京航空航天大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Tongji University(同济大学) ; iFLYTEK Co., Ltd.(科大讯飞股份有限公司) ; Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta(长三角安全人工智能安徽实验室) ; Wenzhou Business College(温州商学院) ; Jiangnan University(江南大学) ; Guangzhou City University of Technology(广州理工学院) ; Inceptio Technology(智元机器) ; Institute of Dataspace(数据空间研究所) ; Zhongguancun Laboratory(中关村实验室) ; Tsinghua University(清华大学) ; ETH Zürich(苏黎世联邦理工学院) ; University of Oxford(牛津大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; BAAI(北京智源人工智能研究院) ; Meta ; Johns Hopkins University(约翰·霍普金斯大学) ; University of California, Berkeley(加州大学伯克利分校) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 介绍CVPR 2026@AdvML研讨会针对自动驾驶VLAs的对抗性多模态攻击挑战赛,基于多视图视觉问答,参赛者要生成对抗图像和文本扰动。阐述任务设计等,研究领先提交作品发现后缀惩罚等模式,为多模态自动驾驶系统相关工作提供参考。
拉瓜迪亚:基于病理学基础模型的语言引导自适应蒸馏
机构 * College of Informatics, Korea University(韩国大学信息学院)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
AI总结 研究针对病理学基础模型计算成本高问题,提出拉瓜迪亚框架,通过多阶段流程,在临床语言指导下整合多模型知识,进行自适应蒸馏。实验表明其87M参数学生模型性能出色,凸显临床语言对构建高效可靠数字病理系统的作用。
更健康的语言模型:用于公共卫生问答的检索增强生成
专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大型语言模型在公共卫生问答受幻觉等限制的问题,采用检索增强生成方法,通过扩展基准并系统评估检索与生成选择,比较多种检索方式,引入评判方法,突出检索对可靠公共卫生问答的作用并提供实用指导。
Comments 19 Pages, 14 Main Text Pages, 6 Figures
哈里森.Rad 1.5技术报告:一种可根据图像、先验知识和临床背景起草报告的放射学基础模型
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对放射科报告积压问题,提出HR1.5多模态大语言模型,通过三阶段训练,用特定评分框架评估,该模型是唯一达模拟FRCR及格标准的系统,在多方面准确率最高,还研究了可解释性等以支持临床应用评估。
MedStreamBench: 面向流式与主动式医疗视频理解的时间感知基准
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出MedStreamBench基准,通过时间受限证据窗口和主动监控设置,评估模型在流式与主动式医疗视频理解中的回答时机与正确性,发现离线识别与时间感知决策间存在显著差距。
Comments 10 Pages, 5 Figures