arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

2602.00400 2026-05-13 cs.AI 70%

KEPO: Knowledge-Enhanced Preference Optimization for Multimodal Reasoning with Applications to Medical VQA

KEPO:基于知识的偏好优化用于多模态推理及其在医学VQA中的应用

Fan Yang, Rui Meng, Trudi Di Qi, Ali Ezzati, Yuxin Wen

机构 * Chapman University(查普曼大学) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) University of California, Irvine(加州大学伊文斯分校)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI

AI总结 KEPO通过质量门控的在线蒸馏和知识增强的探索策略,提升多模态推理任务的训练稳定性与推理一致性,优于强化学习和在线蒸馏基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27629 2026-05-12 cs.AI 70%

WaferSAGE: Large Language Model-Powered Wafer Defect Analysis via Synthetic Data Generation and Rubric-Guided Reinforcement Learning

WaferSAGE:基于大语言模型的晶圆缺陷分析:通过合成数据生成与评分引导的强化学习

Ke Xu, Zhongyuan Lian

机构 * Shanghai Huahong Grace Semiconductor Manufacturing Corporation(上海华虹格瑞半导体制造有限公司) Dept. of Automation, School of Information Science and Engineering, East China University of Science and Technology(自动化系,信息科学与工程学院,东华大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI

AI总结 本文提出WaferSAGE框架,利用小规模视觉-语言模型进行晶圆缺陷视觉问答。通过合成数据生成和评分引导强化学习,解决半导体制造中的数据稀缺问题,展示小型模型在特定工业视觉理解中的优势。

Comments 16 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09906 2026-05-12 cs.AI cs.SD 70%

Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought

先分后融:通过模态特定的推理链减轻音频视觉大语言模型中的跨模态干扰

Xuanchen Li, Yuheng Lu, Chenrui Cui, Tianrui Wang, Zikang Huang, Yu Jiang, Long Zhou, Longbiao Wang, Jianwu Dang

机构 * Tianjin Key Laboratory of Cognitive Computing(天津认知计算实验室) Tianjin University(天津大学) Huiyan Technology Company, Ltd.(慧颜科技有限公司) Chinese Academy of Sciences(中国科学院) Tencent(腾讯)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.AI

AI总结 本文提出SFFL框架,通过模态特定的推理链减少跨模态干扰,提升音频视觉问答的准确性和鲁棒性,实验显示在通用AVQA基准和跨模态幻觉基准上分别提升5.16%和11.17%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26880 2026-04-30 cs.CL cs.LG 70%

HealthNLP_Retrievers at ArchEHR-QA 2026: Cascaded LLM Pipeline for Grounded Clinical Question Answering

HealthNLP_Retrievers在ArchEHR-QA 2026中的表现:基于级联LLM管道的 grounded临床问答

Md Biplob Hosen, Md Alomgeer Hussein, Md Akmol Masud, Omar Faruque, Tera L Reynolds, Lujie Karen Chen

机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县分校) Jahangirnagar University(贾旺吉拉大学)

专题命中 视觉问答 :grounding(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出基于Gemini 2.5 Pro的级联管道,通过多阶段模块实现患者问题理解、证据检索与回答生成,提升临床问答的准确性和专业性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10026 2026-04-15 cs.CV 70%

LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA

LaV-CoT:具有多方面奖励优化的语言感知视觉CoT

Jing Huang, Zhiya Tan, Shutao Gong, Fanwei Zeng, Joey Tianyi Zhou, Changtao Miao, Huazhe Tan, Weibin Yao, Jianshu Li

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) CFAR, Agency for Science, Technology and Research(科技研究局CFAR)

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 LaV-CoT通过多阶段推理流程和多方面奖励优化,提升多语言视觉问答的准确性和泛化能力,实现在公开数据集上的9.5%准确率提升。

Comments Accepted by WWW 2026 Industry Track - Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11156 2026-04-14 cs.CV 70%

rPPG-VQA: A Video Quality Assessment Framework for Unsupervised rPPG Training

rPPG-VQA:一种用于无监督rPPG训练的视频质量评估框架

Tianyang Dai, Ming Chang, Yan Chen, Yang Hu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出rPPG-VQA框架,通过信号级和场景级分析评估视频对rPPG模型训练的适用性,结合双分支架构和两阶段自适应采样策略提升模型性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07634 2026-04-10 cs.CV 70%

VSAS-BENCH: Real-Time Evaluation of Visual Streaming Assistant Models

VSAS-BENCH:视觉流助手模型的实时评估

Pavan Kumar Anasosalu Vasu, Cem Koc, Fartash Faghri, Chun-Liang Li, Bo Feng, Zhengfeng Lai, Meng Cao, Oncel Tuzel, Hadi Pouransari

机构 * Apple(苹果公司)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出VSAS-Bench,通过时序密集标注和标准化评估协议,评估流式视觉语言模型的实时性能,揭示模型在内存缓冲长度、访问策略等关键设计因素下的精度-延迟权衡。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04838 2026-04-08 cs.CV 70%

Less Detail, Better Answers: Degradation-Driven Prompting for VQA

细节越少,答案越好:基于退化的提示方法用于视觉问答

Haoxuan Han, Weijie Wang, Zeyu Zhang, Yefei He, Bohan Zhuang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出退化驱动提示(DDP)方法,通过降低图像清晰度迫使模型关注关键结构信息,提升视觉问答性能。在物理属性和感知现象任务中,DDP通过降采样、结构辅助和提示技术实现更准确的推理。

Comments Accepted to CVPRW 2026. Project page: https://hhx-jpg.github.io/ddp/ , Code: https://github.com/ziplab/DDP

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04638 2026-04-08 cs.AI cs.CL cs.IR 70%

Advancing AI Research Assistants with Expert-Involved Learning

通过专家参与学习推进AI研究助手

Tianyu Liu, Simeng Han, Hanchen Wang, Xiao Luo, Pan Lu, Biqing Zhu, Yuge Wang, Keyi Li, Jiapeng Chen, Rihao Qu, Yufeng Liu, Xinyue Cui, Aviv Yaish, Yuhang Chen, Minsheng Hao, Chuhan Li, Kexing Li, Yinsheng Lu, Xinyu Wei, Qinzhe Xing, Antonia Panescu, Mengbo Wang, Vibha Annaswamy, Alicia Sanchez, Jack Cloherty, Arman Cohan, Hua Xu, Mark Gerstein, James Zou, Hongyu Zhao

机构 * Yale University(耶鲁大学) Broad Institute of MIT and Harvard(麻省理工学院-哈佛大学博德研究所) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学) Genentech(基因泰克) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.AI

AI总结 本文提出ARIEL框架,通过专家验证任务评估大语言模型和多模态模型在生物医学领域的表现,发现提示工程和轻量级微调能提升文本覆盖,计算扩展策略增强视觉问答能力,构建了集成文本和视觉线索的AI助手,提出可检验的机理假设。

Comments 43 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02748 2026-04-06 cs.CV 70%

Visual Instruction-Finetuned Language Model for Versatile Brain MR Image Tasks

面向多样化脑部MRI任务的视觉指令微调语言模型

Jonghun Kim, Sinyoung Ra, Hyunjin Park

机构 * Sungkyunkwan University(成均馆大学) Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Artificial Intelligence(人工智能系)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出LLaBIT模型,通过视觉指令微调提升语言模型在脑部MRI任务中的表现,通过特征图重用和文本数据生成提升性能,验证了其在报告生成、视觉问答、图像分割和图像翻译中的有效性。

Comments ICPR 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12957 2026-04-03 cs.CV 70%

Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation

通过语义引导的奖励崩溃缓解实现自适应的开放性医疗推理

Yizhou Liu, Dingkang Yang, Zizhi Chen, Minghao Han, Xukun Zhang, Keliang Liu, Jingwei Wei, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(菲斯克智能科技有限公司(菲斯克AI)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出ARMed框架,通过监督微调和强化优化提升开放性医疗VQA的推理一致性和事实准确性,实验表明其在六个医疗VQA基准上显著提升准确性和泛化能力。

Comments Accept to 2026 CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04428 2026-03-30 cs.CV 70%

A.I.R.: Enabling Adaptive, Iterative, and Reasoning-based Frame Selection For Video Question Answering

A.I.R.: 为视频问答实现适应性、迭代性和基于推理的帧选择

Yuanhao Zou, Shengji Jin, Andong Deng, Youpeng Zhao, Jun Wang, Chen Chen

机构 * University of Central Florida(中佛罗里达大学) Weill Cornell Medicine(威尔康奈尔医学院)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出A.I.R方法,通过深度语义分析和高效迭代循环提升视频问答的帧选择效果,实验表明其在性能和计算效率上均优于现有方法。

Comments ICLR 2026 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24181 2026-03-26 cs.CV 70%

Unlocking Few-Shot Capabilities in LVLMs via Prompt Conditioning and Head Selection

通过提示条件和头部选择解锁LVLMs的少样本能力

Adhemar de Senneville, Xavier Bou, Jérémy Anger, Rafael Grompone, Gabriele Facciolo

机构 * Université Paris-Saclay, CNRS, ENS Paris-Saclay, Centre Borelli(巴黎萨克雷大学、国家科学研究中心、巴黎萨克雷高等师范学院、Borelli中心) École Polytechnique, AMIAD(巴黎高等理工学院、AMIAD) Institut Universitaire de France(法国高等科学研究院)

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出Head Ensemble Classifiers (HEC)通过提示条件和头部选择提升LVLMs在少样本和零样本分类中的性能,实现与CLIP基方法的性能平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02258 2026-03-24 cs.CV 70%

Patho-AgenticRAG: Towards Multimodal Agentic Retrieval-Augmented Generation for Pathology VLMs via Reinforcement Learning

病理代理RAG:通过强化学习实现多模态代理检索增强生成用于病理学视觉语言模型

Wenchuan Zhang, Jingru Guo, Hengzhe Zhang, Penghao Zhang, Jie Chen, Shuwan Zhang, Zhang Zhang, Yuhao Yi, Hong Bu

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出Patho-AgenticRAG,通过强化学习实现多模态代理检索增强生成,解决病理学视觉语言模型在高分辨率、复杂组织结构和临床语义上的挑战,提升诊断准确性。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(35): 29921-29929, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05175 2026-03-24 cs.CV 70%

VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice

VideoAuto-R1:通过一次推理、两次回答实现视频自动推理

Shuming Liu, Mingchen Zhuge, Changsheng Zhao, Jun Chen, Lemeng Wu, Zechun Liu, Chenchen Zhu, Zhipeng Cai, Chong Zhou, Haozhe Liu, Ernie Chang, Saksham Suri, Hongyu Xu, Qi Qian, Wei Wen, Balakrishnan Varadarajan, Zhuang Liu, Hu Xu, Florian Bordes, Raghuraman Krishnamoorthi, Bernard Ghanem, Vikas Chandra, Yunyang Xiong

机构 * Meta AI King Abdullah University of Science and Technology (KAUST)(卡布斯大学) Princeton University(普林斯顿大学)

专题命中 视觉问答 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出VideoAuto-R1框架,通过一次推理两次回答策略提升视频理解效率,实现准确率和效率的双重提升。

Comments Accepted to CVPR 2026. Project page: https://ivul-kaust.github.io/projects/videoauto-r1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15030 2026-03-20 cs.AI 70%

VTC-Bench: Evaluating Agentic Multimodal Models via Compositional Visual Tool Chaining

VTC-Bench:通过组合视觉工具链评估代理多模态模型

Xuanyu Zhu, Yuhao Dong, Rundong Wang, Yang Shi, Zhipeng Wu, Yinlun Peng, YiFan Zhang, Yihang Lou, Yuanxing Zhang, Ziwei Liu, Yan Bai, Yuan Zhou

机构 * PKU(北京大学) NTU(国立台湾大学) USTC(中国科学技术大学) CQU(重庆大学) NUDT(南京理工大学) CASIA(中国科学院自动化研究所) Meituan(美团)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 VTC-Bench通过组合视觉工具链评估多模态大语言模型的工具使用能力,揭示了当前模型在复杂任务中适应性和多工具组合方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18448 2026-03-20 cs.LG 70%

Seeking Universal Shot Language Understanding Solutions

寻找通用短语语言理解解决方案

Haoxin Liu, Harshavardhan Kamarthi, Zhiyuan Zhao, Hongjie Chen, B. Aditya Prakash

机构 * Georgia Institute of Technology(佐治亚理工学院) Dolby Laboratories(杜比实验室)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.LG

AI总结 本文提出SLU-SUITE框架,通过49万人工标注数据揭示VLM在SLU任务中的瓶颈,提出UniShot和AgentShots两种通用解决方案,实验显示在领域内任务优于专用模型,在领域外任务超越商业VLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05591 2026-03-09 cs.CV 70%

Thinking with Spatial Code for Physical-World Video Reasoning

基于空间代码的物理世界视频推理

Jieneng Chen, Wenxin Ma, Ruisheng Yuan, Yunzhi Zhang, Jiajun Wu, Alan Yuille

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 基于空间代码的物理世界视频推理方法,通过空间编码器生成3D表示并提升大语言模型的推理能力。

Comments Code at https://github.com/Beckschen/spatialcode

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13251 2026-03-04 cs.CV 70%

Map the Flow: Revealing Hidden Pathways of Information in VideoLLMs

映射流:揭示视频大语言模型中的隐藏信息路径

Minji Kim, Taekyung Kim, Bohyung Han

机构 * NAVER AI Lab(NAVER人工智能实验室)

专题命中 视觉问答 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 本研究通过机理可解释性技术揭示视频大语言模型中信息流的隐藏路径,展示了时间推理机制及提升模型可解释性和泛化能力的贡献。

Comments ICLR 2026, 32 pages, 39 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14162 2026-02-27 cs.CL cs.CV cs.IR 70%

Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering

索引轻,推理深:延迟视觉摄入用于视觉密集文档问答

Tao Xu

专题命中 视觉问答 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出延迟视觉摄入框架,通过分层图号聚类构建索引,利用BM25检索和VLM分析提升视觉密集文档问答性能。

Comments 24 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07986 2026-02-26 cs.CL cs.CV 70%

VULCA-Bench: A Multicultural Vision-Language Benchmark for Evaluating Cultural Understanding

VULCA-Bench:一个多文化视觉-语言基准,用于评估文化理解

Haorui Yu, Diji Yang, Hang He, Fengrui Zhang, Qiufeng Yi

机构 * DJCAD, University of Dundee, United Kingdom(邓迪大学DJCAD部门) University of California, Santa Cruz, USA(加州大学圣克ruz分校) Analogy AI East China Normal University, China(华东师范大学) Nanjing University, China(南京大学) Department of Mechanical Engineering, School of Engineering, University of Birmingham(伯明翰大学工程学院机械工程系)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 VULCA-Bench通过多文化艺术批评基准评估视觉-语言模型在文化理解上的能力,包含7,410对图像-批评对,涵盖八个文化传统,通过五层框架评估文化理解,揭示更高阶推理更具挑战性。

Comments 8 pages, 4 figures, submitted to ACL 2026 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19091 2026-02-24 cs.CV 70%

CREM: Compression-Driven Representation Enhancement for Multimodal Retrieval and Comprehension

CREM: 为多模态检索与理解的压缩驱动表示增强

Lihao Liu, Yan Wang, Biao Yang, Da Li, Jiangxia Cao, Yuxiao Luo, Xiang Chen, Xiangyu Wu, Wei Yuan, Fan Yang, Guiguang Ding, Tingting Gao, Guorui Zhou

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 CREM通过压缩驱动的表示增强方法,在提升多模态检索性能的同时保持生成能力,实现生成与嵌入任务的统一优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13479 2026-02-17 cs.CV cs.HC 70%

GLIMPSE : Real-Time Text Recognition and Contextual Understanding for VQA in Wearables

GLIMPSE:面向可穿戴设备的实时文本识别与上下文理解的视频大语言模型

Akhil Ramachandran, Ankit Arun, Ashish Shenoy, Abhay Harpale, Srihari Jayakumar, Debojeet Chatterjee, Mohsen Moslehpour, Pierce Chuang, Yichao Lu, Vikas Bhardwaj, Peyman Heidari

机构 * Meta Reality Labs(Meta现实实验室)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

AI总结 GLIMPSE通过混合架构在可穿戴设备上实现低功耗的实时文本识别与上下文理解,提升视频大语言模型在资源受限设备上的VQA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25889 2026-02-16 cs.CV cs.CL 70%

Multimodal LLM With Hierarchical Mixture-of-Experts for VQA on 3D Brain MRI

多模态大语言模型与分层混合专家用于3D脑部MRI的视觉问答

Arvind Murari Vepa, Yannan Yu, Jingru Gan, Anthony Cuturrufo, Michael F. Romano, Weikai Li, Fabien Scalzo, Wei Wang, Yizhou Sun

机构 * UCLA Computer Science(UCLA计算机科学系) UCSF Radiology(UCSF放射学) UCLA Medicine(UCLA医学)

专题命中 视觉问答 :VLM(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本研究提出了一种多模态大语言模型mpLLM,用于3D脑部MRI的视觉问答,通过分层混合专家架构提升肿瘤描述的临床可解释性,并在多个数据集上优于现有基线模型。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13261 2026-02-10 cs.CV 70%

Building Egocentric Procedural AI Assistant: Methods, Benchmarks, and Challenges

构建第一人称程序化AI助手:方法、基准和挑战

Junlong Li, Huaiyuan Xu, Sijie Cheng, Kejun Wu, Kim-Hui Yap, Lap-Pui Chau, Yi Wang

机构 * Department of EEE(电子工程系) The Hong Kong Polytechnic University(香港理工大学) RayNeo Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出第一人称程序化AI助手,探讨其核心任务、赋能维度及挑战,通过实验评估现有方法并指明未来研究方向。

Comments Under peer-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21355 2026-02-09 cs.LG 70%

SMMILE: An Expert-Driven Benchmark for Multimodal Medical In-Context Learning

SMMILE:一个多模态医学上下文学习的专家驱动基准

Melanie Rieff, Maya Varma, Ossian Rabow, Subathra Adithan, Julie Kim, Ken Chang, Hannah Lee, Nidhi Rohatgi, Christian Bluethgen, Mohamed S. Muneer, Jean-Benoit Delbrouck, Michael Moor

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Lund University(隆德大学) Jawaharlal Institute of Postgraduate Medical Education and Research(贾瓦哈拉尔·尼赫鲁医学教育与研究学院) UCSF(加州大学旧金山分校) University of Zurich(苏黎世大学) University Hospital Zurich(苏黎世大学医院) HOPPR

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.LG

AI总结 SMMILE是一个专家驱动的多模态医学上下文学习基准,评估了15个MLLMs在医学任务中的多模态ICL能力,发现其表现有限且易受无关示例和最近性偏见影响。

Comments NeurIPS 2025 (Datasets & Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17089 2026-01-27 cs.CV 70%

GRASP: Guided Region-Aware Sparse Prompting for Adapting MLLMs to Remote Sensing

GRASP: 基于区域感知的稀疏提示引导方法用于适应遥感图像的多模态大语言模型

Qigan Sun, Chaoning Zhang, Jianwei Zhang, Xudong Wang, Jiehui Xie, Pengcheng Zheng, Haoyu Wang, Sungyoung Lee, Chi-lok Andy Tai, Yang Yang, Heng Tao Shen

机构 * School of Computing, Kyung Hee University(京畿大学计算机学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) College of Computer Science and Information Engineering, Harbin Normal University(哈尔滨师范大学计算机科学与信息工程学院) College of Professional and Continuing Education, The Hong Kong Polytechnic University(香港理工大学专业及继续教育学院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 GRASP通过引导区域感知的稀疏提示方法,提升多模态大语言模型在遥感图像任务中的适应性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21182 2026-01-22 cs.CV cs.CL 70%

KBE-DME: Dynamic Multimodal Evaluation via Knowledge Enhanced Benchmark Evolution

KBE-DME: 通过知识增强的基准进化实现动态多模态评估

Junzhe Zhang, Huixuan Zhang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology(王轩计算机技术研究所) Peking University(北京大学)

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 KBE-DME通过整合多模态知识和动态基准进化,实现对多模态大语言模型能力的更全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13919 2026-01-21 cs.CL cs.CV 70%

HyperWalker: Dynamic Hypergraph-Based Deep Diagnosis for Multi-Hop Clinical Modeling across EHR and X-Ray in Medical VLMs

HyperWalker: 基于动态超图的多跳临床建模深度诊断方法,跨EHR和X光在医学视觉语言模型中

Yuezhe Yang, Hao Wang, Yige Peng, Jinman Kim, Lei Bi

机构 * Institute of Translational Medicine, Shanghai Jiao Tong University(翻译医学研究院,上海交通大学) School of Computer Science, University of Sydney(计算机科学学院,悉尼大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 HyperWalker通过动态超图和测试时训练,实现跨EHR和X光的多跳临床建模深度诊断,提升医疗视觉语言模型的诊断性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11976 2026-01-21 cs.CV 70%

AVIR: Adaptive Visual In-Document Retrieval for Efficient Multi-Page Document Question Answering

AVIR: 为高效多页文档问答的自适应视觉在文档检索

Zongmin Li, Yachuan Li, Lei Kang, Dimosthenis Karatzas, Wenkang Ma

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Shandong Xiehe University(山东谢家大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 AVIR通过自适应视觉在文档检索框架减少多页文档问答所需的页面数,提升效率并降低计算成本。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏