PRISM: Priority-aware Rubric Internalization via Structured Multimodal Data Synthesis
PRISM:基于结构化多模态数据合成的感知优先级的评分标准内化
专题命中 视觉问答 :MLLM(abstract_cn);分类 cs.AI、cs.LG
AI总结 该研究针对多模态指令多要求重要性不等的问题,提出PRISM四阶段数据合成框架,结合PRISM-Eval评估,提升多模态大模型的多规则优先级感知指令遵循能力。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
PRISM:基于结构化多模态数据合成的感知优先级的评分标准内化
专题命中 视觉问答 :MLLM(abstract_cn);分类 cs.AI、cs.LG
AI总结 该研究针对多模态指令多要求重要性不等的问题,提出PRISM四阶段数据合成框架,结合PRISM-Eval评估,提升多模态大模型的多规则优先级感知指令遵循能力。
2026年EgoVis首届EgoCross挑战赛:跨域自我中心视频问答
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文介绍2026年EgoVis研讨会举办的首届EgoCross跨域自我中心视频问答挑战赛,含两个赛道,共获1500余份提交,公布结果与获胜方案,资源公开以推进相关研究。
Comments 1st EgoCross challenge @ EgoVis workshop, CVPR26
推理前的感知:面向视频理解与问答的动态隐式推理
机构 * Rice University(莱斯大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对视频问答现有方法依赖长文本思维链的问题,提出DyLaR模型,通过动态调整感知与推理隐式变量的使用,在9个视频基准上提升准确率且缩短响应长度。
具备知识意识的视觉-语言基础模型用于胎儿超声解读
机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(国家多媒体软件工程技术研究中心,武汉大学计算机学院) ; College of Computing and Data Science, Nanyang Technological University(computing and Data Science学院,南洋理工大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 FetalMind通过Salient Epistemic Disentanglement方法,提升胎儿超声解读的准确性和效率,实现多视图图像推理和疾病诊断的高效处理。
Comments KDD 2026
3DZip:面向3D视觉问答的空间感知特征多样性引导的Token压缩方法
机构 * Pusan National University(釜山国立大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文针对3D视觉问答中Token压缩忽略空间特性的问题,提出三阶段框架3DZip,在三个基准上以128个Token保留94.7%性能、提速1.92倍,优于现有方法。
Comments Accepted to ECCV 2026. Project page: https://cvsp-lab.github.io/3DZip
Obshazard-bench:面向原始地球观测流的实时灾害情报多模态基础模型基准测试
机构 * National University of Defense Technology(国防科技大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 本研究推出Obshazard-bench基准测试,评估多模态基础模型的实时灾害情报能力,发现现有模型在将原始多通道物理观测转化为符合决策需求的灾害推理方面存在显著局限。
SAGE:面向多模态学习与幻觉分析的专家标注南亚胃肠内镜数据集
机构 * Nepal Applied Mathematics and Informatics Institute for Research(尼泊尔应用数学与信息技术研究所) ; GastroIntestinal Department, Dhulikhel Hospital(杜尔基hel医院消化内科) ; Univesity of Lausanne(洛桑大学) ; University of West Virginia(西弗吉尼亚大学) ; University of Utah(犹他大学) ; University of Aberdeen(阿伯丁大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 为解决南亚地区胃肠癌诊断数据缺乏问题,构建了包含1300张图像、标注和问答对的SAGE数据集,并评估了模型在人口偏移下的性能下降。
手语问答:手语理解的新任务、基准与基线模型
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出手语问答新任务,构建基于PHOENIX14T与CSL-Daily的SignQA基准,设计带特定模块的基线模型,实验显示其在各问题类别上优于代表性视觉-语言模型。
评估用于视频游戏QA中自主代理驱动的几何裁剪检测的视觉语言模型
机构 * Sony Interactive Entertainment(索尼互动娱乐)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究在代理驱动游戏QA中用VLMs检测几何裁剪异常,通过自定义代理收集视觉观察,自动注释提供标签,在零样本提示下对六个VLMs基准测试,分析对提示变体的敏感性,结果显示VLMs适合作多阶段QA管道的高召回候选过滤器。
视频中的思考:视频生成器真的能对现实世界进行推理吗?
机构 * Central South University(中南大学) ; Tencent(腾讯) ; Tsinghua University(清华大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 探讨视频生成器能否对现实世界推理,引入因果生成双判断(CGDJ)评估,发现开源模型无明确因果感知却有合理动态,先进闭源系统推理与生成一致性有限,还揭示了视听失调问题。
NLPCC 2026共享任务1概述:难度感知多语言多模态医学教学视频理解评估
机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与工程学院) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 NLPCC 2026的DA - MIVQA共享任务,通过区分问题难度扩展多语言多模态医学视频基准,含三个赛道。其数据集来自公共医学教学渠道,涵盖多种场景并经人工标注难度。该任务为评估医学教学视频问答系统提供实用基准。
Comments 19 pages, 6 figures, 6 tables
停止思考,开始观察:通过无推理对齐实现多模态文档问答的高效训练后优化
专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 研究多模态文档问答中高效训练后优化问题,提出感知 - RFT 框架,用组相对策略优化绕过推理令牌直接对齐视觉与基础输出,通过构建变体评估推理必要性,发现启用推理模型有优势,还识别基础差异,表明早期转换可减少训练数据并保持精度。
Comments Accepted at ICML 2026, Workshop on Efficient Multimodal Question Answering (EMM-QA)
有证据支持的视频问答
机构 * Salesforce, Palo Alto, CA, USA(Salesforce公司) ; Brown University, Providence, RI, USA(布朗大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 研究视频问答中模型缺乏可视化依据的问题,提出E-VQA任务及ST-Evidence基准,开发数据集ST-Evidence-Instruct,通过微调提高模型表现,为可解释的视频理解建立基线。
Journal ref ECCV 2026
关于CVPR 2026@AdvML研讨会挑战赛的技术报告
机构 * Beihang University(北京航空航天大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Tongji University(同济大学) ; iFLYTEK Co., Ltd.(科大讯飞股份有限公司) ; Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta(长三角安全人工智能安徽实验室) ; Wenzhou Business College(温州商学院) ; Jiangnan University(江南大学) ; Guangzhou City University of Technology(广州理工学院) ; Inceptio Technology(智元机器) ; Institute of Dataspace(数据空间研究所) ; Zhongguancun Laboratory(中关村实验室) ; Tsinghua University(清华大学) ; ETH Zürich(苏黎世联邦理工学院) ; University of Oxford(牛津大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; BAAI(北京智源人工智能研究院) ; Meta ; Johns Hopkins University(约翰·霍普金斯大学) ; University of California, Berkeley(加州大学伯克利分校) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 介绍CVPR 2026@AdvML研讨会针对自动驾驶VLAs的对抗性多模态攻击挑战赛,基于多视图视觉问答,参赛者要生成对抗图像和文本扰动。阐述任务设计等,研究领先提交作品发现后缀惩罚等模式,为多模态自动驾驶系统相关工作提供参考。
拉瓜迪亚:基于病理学基础模型的语言引导自适应蒸馏
机构 * College of Informatics, Korea University(韩国大学信息学院)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
AI总结 研究针对病理学基础模型计算成本高问题,提出拉瓜迪亚框架,通过多阶段流程,在临床语言指导下整合多模型知识,进行自适应蒸馏。实验表明其87M参数学生模型性能出色,凸显临床语言对构建高效可靠数字病理系统的作用。
更健康的语言模型:用于公共卫生问答的检索增强生成
专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大型语言模型在公共卫生问答受幻觉等限制的问题,采用检索增强生成方法,通过扩展基准并系统评估检索与生成选择,比较多种检索方式,引入评判方法,突出检索对可靠公共卫生问答的作用并提供实用指导。
Comments 19 Pages, 14 Main Text Pages, 6 Figures
哈里森.Rad 1.5技术报告:一种可根据图像、先验知识和临床背景起草报告的放射学基础模型
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对放射科报告积压问题,提出HR1.5多模态大语言模型,通过三阶段训练,用特定评分框架评估,该模型是唯一达模拟FRCR及格标准的系统,在多方面准确率最高,还研究了可解释性等以支持临床应用评估。
MedStreamBench: 面向流式与主动式医疗视频理解的时间感知基准
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出MedStreamBench基准,通过时间受限证据窗口和主动监控设置,评估模型在流式与主动式医疗视频理解中的回答时机与正确性,发现离线识别与时间感知决策间存在显著差距。
Comments 10 Pages, 5 Figures
REMSA:通过约束感知代理进行遥感基础模型选择
机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) ; U AI(5U AI) ; Technische Universität Berlin & BIFOLD(柏林工业大学 & BIFOLD)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 提出REMSA,一种基于结构化数据库RS-FMD的约束感知代理,通过自然语言查询自动选择遥感基础模型,结合元数据检索与上下文学习,在专家评估基准中优于多种基线。
Comments Code and data available at https://github.com/be-chen/REMSA
基于结构化检索的长音频事件问答
机构 * Qualcomm Technologies, Inc., India(印度高通技术公司) ; Qualcomm Technologies, Inc., USA(美国高通技术公司) ; University of Turku, Finland(芬兰图尔库大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 提出LA-RAG框架,通过音频基础模型将长音频转为带时间戳的事件记录并存入SQL数据库,结合意图感知检索和LLM生成,实现低延迟高精度的长音频问答,在多个基准上提升时间定位F1达11-17%。
Comments Submitted to EMNLP 2026 Industry Track
EG-VQA: 基于接地时间证据的可验证视频问答基准
机构 * Sun Yat-sen University(中山大学) ; Peng Cheng Laboratory(鹏城实验室) ; Shenzhen University(深圳大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出EG-VQA基准,通过细粒度时间证据标注和EG-F1指标,揭示视频大模型在答案正确性与证据定位之间的差距,并引入EG-Reasoner模型弥合这一差距。
注意力谱正则化:无回放的连续多模态大语言模型
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Sun Yat-sen University(中山大学) ; Nanyang Technological University(南洋理工大学) ; Renmin University of China(中国人民大学) ; Tsinghua University(清华大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 提出注意力谱正则化(ASR),一种无回放的连续学习框架,通过存储技能级交叉注意力原型分布并施加谱正则化约束,有效缓解多模态大语言模型在连续微调中的灾难性遗忘。
看得见的链,答不出的答案:针对视频MME上强制思维链的多方面评估方案
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Northeastern University(东北大学) ; Southern Methodist University(南卫理公会大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 提出三探针评估方案检验强制思维链在视频问答中的可靠性,应用于Qwen2.5-VL发现思维链强依赖视频但未提升准确率,甚至在小模型上导致下降。
Comments 10 pages, 5 figures. To appear at The 2nd Workshop on Evaluation for Multimodal Generation @ SIGIR 2026 (EvalMG '26)
SPARC:用于电路问答的多智能体系统
机构 * University of Michigan(密歇根大学) ; Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出SPARC多智能体系统,通过可执行的物理仿真程序进行推理,在电路问答任务上实现83%准确率,较基线提升高达58%。
语义锚定证据融合用于域鲁棒的全切片生存分析
机构 * National University of Singapore(新加坡国立大学) ; Imperial College London(帝国理工学院) ; Hunan University(湖南大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
AI总结 提出SAEFS框架,通过视觉问答提取语义锚点,结合双流证据提取和狄利克雷主观逻辑建模不确定性,实现跨域零样本生存分析,平均C-index提升10.2%。
ProcessThinker: 通过基于展开的过程奖励增强多模态大语言模型推理
机构 * LMU Munich(慕尼黑大学) ; Harvard University(哈佛大学) ; University of Cambridge(剑桥大学) ; Mina AI ; Konrad Zuse School of Excellence in Reliable AI (relAI)(康拉德·楚泽可靠人工智能卓越学校(relAI))
专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG
AI总结 提出ProcessThinker,一种无需显式过程奖励模型的后训练方法,通过步骤标记格式和基于展开的过程奖励,为多步推理提供密集的步骤级奖励,提升多模态推理一致性。
Comments Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models. 7 pages, 1 figure
Brain-IT-VQA: 从脑信号到答案
机构 * Weizmann Institute of Science(魏茨曼科学研究所)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 提出 Brain-IT-VQA 框架,基于 fMRI 脑信号解码语言令牌并结合语言模型进行视觉问答,在 NSD-VQA 新基准上显著优于先前方法,并用于分析脑区对视觉信息的贡献。
Robust-U1: MLLMs能否自我恢复受损视觉内容以实现鲁棒理解?
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 提出Robust-U1框架,通过监督微调、强化学习和多模态推理,使多模态大模型具备显式视觉自恢复能力,在真实和对抗性损坏下达到最先进鲁棒性。
Comments Accepted by ICML 2026
个人AI代理用于相机胶卷VQA
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Korea University(韩国大学) ; Adobe Research(Adobe研究院)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 本文提出camroll数据集和camroll-agent代理,通过层次化记忆和工具集解决个人相机胶卷中的长程、高度个性化的视觉问答问题。
Comments Project page, code, and demo: https://thaoshibe.github.io/camroll
MAviS:一种用于鸟类物种的多模态对话助手
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出MAviS数据集和MAviS-Chat模型,通过整合图像、音频和文本信息,提升对鸟类物种的细粒度理解与多模态问答能力,并展示了在生态应用中领域适应的多模态大语言模型的重要性。
Comments EMNLP 2025