PaLM-E: An Embodied Multimodal Language Model
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.AI、cs.LG
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG
Comments Jiasen Lu and Vedanuj Goswami contributed equally to this work
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
Comments Accepted at NeurIPS 2019 workshop: ViGIL
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments ECCV 2018 + results on VisDial v1.0 dataset
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG
Comments CVPR 2016
通过结构化内联引文生成实现显式证据基础
机构 * University of the Basque Country (UPV/EHU)(巴斯克大学) ; IT University of Copenhagen(哥本哈根IT大学)
专题命中 视觉问答 :grounding(title)
AI总结 提出FullCite框架,通过提示生成、约束解码和后处理跨度对齐三种策略生成结构化内联引文,在三个QA基准上评估引文质量和忠实性,发现LLMs虽能识别相关文档但难以精确定位支持性证据跨度。
耶鲁-DM实验室参加ArchEHR-QA 2026:用于电子病历问答的确定性接地和多轮证据对齐
机构 * Yale University(耶鲁大学)
专题命中 视觉问答 :grounding(title)
AI总结 本文提出确定性接地和多轮证据对齐方法,用于电子病历问答任务,通过模型多样性与投票策略提升性能,实验结果显示对齐准确率受限于推理能力。
Comments 9 pages, 2 figures. System description for ArchEHR-QA 2026 shared task
专题命中 视觉问答 :vision-language model(title)
机构 * Computational Linguistics, Department of Linguistics, Bielefeld University(语言学计算系,语言学系,比勒菲尔德大学) ; Honda Research Institute Europe(本田欧洲研究院) ; Digital Linguistics Lab, Department of Linguistics, Bielefeld University(数字语言学实验室,语言学系,比勒菲尔德大学)
专题命中 视觉问答 :visual question answering(title)
Comments 17 pages (including Appendix). Accepted at EMNLP 2024 main
Journal ref Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, pp. 19459-19475
专题命中 视觉问答 :multimodal large language model(title)
专题命中 视觉问答 :visual question answering(title)
专题命中 视觉问答 :grounding(title)
专题命中 视觉问答 :vision-language model(title)
专题命中 视觉问答 :visual question answering(title)
SAGE:面向中国古代文献理解的从直接回答到证据导向推理
机构 * Fudan University(复旦大学) ; University of Liverpool(利物浦大学)
专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.AI
AI总结 针对现有大型视觉语言模型(LVLMs)在古代文献理解中证据支撑不足的问题,本文提出SAGE多智能体框架,通过多阶段证据导向推理实现任务规划、证据获取与验证,在AncientDoc基准上优于基线,搭载Qwen3.5-9B的SAGE性能超更大单体模型。
ENCORE:面向鲁棒视觉-语言理解的熵引导裁剪与注意力正则化方法
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 ENCORE是一个熵引导的视觉-语言理解框架,通过基于熵的裁剪策略和熵正则化训练,仅微调0.14%参数,在10个VQA基准上实现平均1.43%的准确率提升,达到2B参数VLMs的SOTA性能。
Journal ref ICASSP 2026
分析与缓解多模态医学视觉问答中的跨语言退化问题
机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI
AI总结 针对多模态医学VQA中LVLMs的跨语言退化问题,构建多语言基准并提出MedVL-XLRepE方法,可在3种LVLMs和8种语言上将退化缓解幅度提升至最高6.33%。
Comments EMNLP 2026 main
生成式嵌入基准:密集嵌入中保留了多少信息?
专题命中 视觉问答 :VLM(abstract,abstract_cn);分类 cs.CV
AI总结 该研究提出Generative Embedding Benchmark(GEB),通过仅用嵌入和问题文本的解码器评估7种嵌入模型,发现生成式读出能揭示可分性评估未捕捉的信息瓶颈,视觉语言模型嵌入表现更优。
当更好的教师不培养更好的学生:重新审视用于CLIP模型的KL知识蒸馏在视觉问答中的应用
机构 * VISTEC ; Bangkok Christian International School(巴吞普林国际学校) ; AI Singapore(AI新加坡)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
AI总结 本文重新审视了CLIP模型在视觉问答中的知识蒸馏,发现更强教师不必然产生更好学生,揭示了现有蒸馏框架的局限性,并指明了参数高效多模态模型的设计新方向。
TractoGraphVLM:用于白质纤维束成像的统一视觉-语言框架
机构 * Montreal Neurological Institute(蒙特利尔神经学研究所) ; McGill University(麦吉尔大学) ; Department of Ophthalmology, McGill University(麦吉尔大学眼科系) ; McConnell Brain Imaging Centre(麦康奈尔脑成像中心)
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV
AI总结 TractoGraphVLM是统一视觉-语言框架,可完成白质纤维束的分类、检索、描述、问答四项任务,在HCP数据集上表现良好,具跨年龄迁移鲁棒性,仅从语言学习神经解剖学知识。
Comments Accepted as a Spotlight at the ECCV 2026 Workshop on Artificial Intelligence for Medical 3D Vision (AI4M3D). Our codebase, including all training and evaluation pipelines, is publicly available at https://github.com/AS-Lab/Marthi-et-al-2026-TractoGraphVLM-Unified-Vision-Language-White-Matter-Tractography
从多分辨率细胞到千兆像素全切片图像:用于计算病理学的基础模型
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 针对现有计算病理学模型泛化性受限的问题,提出多分辨率金字塔Transformer(MRPT),经多分辨率自监督预训练后,在34个数据集的多项任务中性能优于同类模型与多模态大语言模型。
Qwen-MusicAVQA-7B:一种用于音乐音频-视觉问答的多模态模型
机构 * Inference Matter Labs(推理物质实验室)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
AI总结 该研究提出轻量级多模态模型Qwen-MusicAVQA-7B,通过连接冻结的Whisper编码器与Qwen2-VL-7B-Instruct,在MUSIC-AVQA等基准上实现高准确率,训练成本低,且发现音频时间信息保留程度影响下游问答准确率。
Comments 24 pages, 1 figure, 8 tables. Code: https://github.com/MKDehdashti/Qwen2-vl-audio Checkpoints: https://huggingface.co/MayaKD/qwen2-vl-audio
TrustRoboReward:面向多范式机器人奖励模型的偏好有序保序分数编辑方法
机构 * Peking University(北京大学) ; Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) ; University of Science and Technology of China(中国科学技术大学) ; Southeast University(东南大学) ; Southern University of Science and Technology(南方科技大学) ; Beijing University of Aeronautics and Astronautics(北京航空航天大学) ; Beijing Language and Culture University(北京语言大学) ; Sichuan University(四川大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 视觉问答 :VLM(abstract,abstract_cn);分类 cs.AI
AI总结 针对现有机器人奖励模型的跨范式偏好与分数不一致问题,本文提出 TrustRoboReward 框架,通过 POISE 方法解决反转冲突,训练的 Qwen3-VL-4B 性能接近 GPT-5-mini,优于 RoboReward 基线。
Jako Tako 还是 Fluent?推出 PoVisLE:波兰语视觉-语言评估基准
机构 * NASK National Research Institute(NASK国家研究院)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
AI总结 针对现有英语中心视觉-语言模型在文化理解上的不足,推出波兰语单文化视觉-语言基准 PoVisLE,含1117张图像与2366对标注VQA样本,可评估深层文化多模态理解。
Comments 28 pages. Preprint under review
SoftReason:一种用于高维感知数据的完全可微神经软符号演绎推理架构
机构 * Clemson University(克莱姆森大学)
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.AI
AI总结 研究针对前提需从高维输入推断且由知识图谱提供相关信息的推理问题,提出神经软符号架构SoftReason,核心是对直接后果算子可微提升,能在知识感知视觉问答中支持多种功能。
Journal ref Proceedings of Machine Learning Research vol 284:1-2, 2026 20th Conference on Neurosymbolic Learning and Reasoning
HFS: 为高效视频推理的全局查询感知帧选择
机构 * The Hong Kong Polytechnic University(香港理工大学)
专题命中 视觉问答 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 HFS提出一种端到端可训练的帧选择框架,通过任务自适应方法提升视频推理效率。
Comments Accepted to the Main Track of ACM Multimedia 2026 (ACM MM '26)
一次思考足矣:面向高分辨率视觉问答的中间层证据路由
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 本文针对高分辨率视觉问答提出无需训练的Thinking-Once证据路由方法,通过利用中间层留存的细粒度证据,在多个基准上提升性能并降低内存与推理时间。
极简RAG的模型:B1ade 335M嵌入模型与1B参数小型语言模型
机构 * Amazon(亚马逊公司)
专题命中 视觉问答 :grounding(abstract,abstract_cn);分类 cs.AI
AI总结 该研究提出含B1ade-embed嵌入模型与B1ade-1B小型语言模型的高效极简RAG架构,其在多QA基准及RAG评估中表现优异,还涌现出无明确监督的来源引用能力,验证了资源高效RAG的可行路径。
Comments 28 pages, 3 figures. Submitted to COLM 2026