Beyond Medical Diagnostics: How Medical Multimodal Large Language Models Think in Space
超越医学诊断:医学多模态大语言模型如何在空间中思考
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出SpatialMed基准,通过自主合成空间视觉问答数据评估医学MLLMs的3D空间智能,发现现有模型在医学影像空间推理能力不足。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
超越医学诊断:医学多模态大语言模型如何在空间中思考
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出SpatialMed基准,通过自主合成空间视觉问答数据评估医学MLLMs的3D空间智能,发现现有模型在医学影像空间推理能力不足。
MMEarth-Bench:通过多模态测试时训练进行全局模型适配
机构 * Harvard University, USA(哈佛大学,美国) ; University of Copenhagen, Denmark(哥本哈根大学,丹麦)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 研究针对地理空间机器学习中现有基准数据集不足,引入含多模态任务的MMEarth-Bench,通过多模态测试时训练方法提升模型性能,改善地理泛化能力。
Comments Published at ECCV 2026
一种空间-光谱-频率交互网络用于多模态遥感分类
机构 * Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) ; School of Information and Electronics, Beijing Institute of Technology(北京理工大学信息与电子学院) ; Beijing Key Laboratory of Fractional Signals and Systems, Beijing Institute of Technology(北京理工大学分数域信号与系统北京市重点实验室) ; School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) ; Key Laboratory of Collaborative Intelligent Systems of Ministry of Education, Xidian University(西安电子科技大学教育部协同智能系统重点实验室) ; Academy of Artificial Intelligence, Inner Mongolia Normal University(内蒙古师范大学人工智能研究院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出S$^2$Fin网络,通过空间、光谱和频率域的交互模块,提升多模态遥感图像分类性能,实验表明其在有限标注数据下表现优于现有方法。
Journal ref Pattern Recognition, Vol. 180, 2026, 114309
ZeroBench:当代大型多模态模型的一个不可能的视觉基准测试
机构 * University of Cambridge(剑桥大学) ; University of Alberta(阿尔伯塔大学) ; The University of Hong Kong(香港大学) ; University of Oxford(牛津大学) ; Northeastern University(东北大学) ; Astadeus ; College of Southern Maryland(马里兰州南部学院) ; University of Geneva(日内瓦大学) ; University of Oregon(俄勒冈大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 针对大型多模态模型在图像解释方面不足但在现有视觉基准测试中优势易逝的问题,引入通过对抗过滤策划的ZeroBench基准测试,评估多个模型,展现其潜力并公开测试内容,为模型视觉能力评估提供长期有效的新基准。
Comments Accepted at ICML 2026
TeachObs:多模态教学观察与模型评估的人工验证基准
机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校) ; Pai Chai University(培才大学) ; Seoul National University(首尔国立大学) ; Ewha Womans University(成均馆大学) ; University of Wolverhampton(沃尔夫汉普顿大学) ; Korea University Sejong Campus(韩国大学世宗校区)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL
AI总结 提出TeachObs基准,包含30节公开课视频的5158个15秒场景,由7名研究者标注39个二值观察码,并评估5个前沿视觉大语言模型在三种任务上的表现。
MUSON:用于城市环境中社会合规导航的面向推理的多模态数据集
机构 * Graduate School of Information Science and Technology, Hokkaido University(北海道大学信息科学研究生院) ; Graduate School of Computer Science, George Mason University(乔治·马歇尔大学计算机科学研究生院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 研究社会合规导航问题,利用视觉语言模型,引入含10110个自我中心样本的多模态数据集MUSON,采用五步注释框架,为推进该导航提供有效基准。
VKnowU:评估多模态语言模型中的视觉知识理解
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanjing University(南京大学) ; Shanghai Innovation Institute(上海创新研究院) ; City University of Hong Kong(香港城市大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 研究多模态大语言模型视觉知识理解能力,提出VKnowU基准测试。评估28个模型,发现与人类表现有差距。引入新数据集和VideoKnow+基线模型,采用结构化范式和强化学习,提升模型表现。
Comments Accepted by ECCV 2026. https://github.com/OpenGVLab/VKnowU
P$^3$数据集:用于多模态建筑物矢量化的像素、点和多边形
机构 * Université Côte d’Azur, INRIA(法国里沃利大学、INRIA) ; LuxCarta Technology(LuxCarta技术公司)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 介绍用于建筑物矢量化的多模态P$^3$数据集,由多源数据构建,含大量高精度激光雷达点等。证明激光雷达点云可用于预测建筑物多边形,融合激光雷达和图像能提高预测精度与几何质量,数据集公开。
Omni-DuplexEval: 评估实时双工全模交互
机构 * Tsinghua University(清华大学) ; Tongji University(同济大学) ; ModelBest Inc.(ModelBest公司)
专题命中 多模态评测 :omni-modal(title);multimodal(abstract);分类 cs.CV
AI总结 本文提出Omni-DuplexEval基准,用于系统评估实时双工交互能力,通过两个互补场景评估模型生成连续响应和主动提醒的能力,并揭示现有模型在平衡响应及时性和内容连贯性方面的局限性。
Comments 21 pages, 6 figures
多重性是多模态学习中不可避免且固有的挑战
机构 * Princeton University(普林斯顿大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本文论证多模态数据固有的多对多映射关系(多重性)是影响数据构建、模型训练和评估的根本瓶颈,并呼吁发展多重性感知的学习框架与评估协议。
Comments ICML 2026 Position Track
ProactiveBench: 多模态大语言模型主动性的基准测试
机构 * University of Trento(特伦托大学) ; University of Bergamo(贝拉米奥大学) ; Inria Grenoble(格勒诺布尔研究所) ; Bruno Kessler Foundation(布鲁诺·凯斯勒基金会)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 提出ProactiveBench基准,评估多模态大语言模型在遮挡识别等任务中请求用户干预的主动性,发现模型普遍缺乏主动性且与能力无关,但可通过强化学习微调习得。
Comments Accepted at ECCV 2026
DamageArbiter:一种基于街景图像进行灾害损伤评估的多模态仲裁框架
机构 * organization= Department of Geography, Texas A\&M University , city= College Station , country= USA ; organization= Department of Landscape Architecture \& Urban Planning, Texas A\&M University , city= College Station , country= USA ; organization= Department of Industrial ; Systems Engineering, University of Florida , city= Gainesville , country= USA ; organization= Spatial Sciences Institute, University of Southern California , city= Los Angeles , country= USA ; organization= Department of Geography ; Sustainability, University of Tennessee , city= Knoxville , country= USA
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 提出DamageArbiter多模态仲裁框架,通过轻量级逻辑回归元分类器仲裁单模态与多模态模型预测分歧,在2556张街景图像上将准确率提升至75.85%,MCC达0.6188,并将过度自信误差从70.58%降至16.45%。
脚手架效应:提示框架如何驱动临床VLM评估中的表面多模态增益
机构 * Technical University of Darmstadt(达姆施塔特技术大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 研究发现,在临床VLM评估中,提示中提及MRI可用性即可解释70-80%的性能提升,与图像数据是否存在无关,这种“脚手架效应”揭示了表面评估无法反映真实多模态推理能力。
Biomazon:亚马逊盆地三维森林结构与生物量建模的多模态数据集
机构 * Jülich Supercomputing Centre (JSC), Forschungszentrum Jülich(julich超级计算中心(JSC),julich研究所) ; School of Engineering and Natural Sciences (SENS), University of Iceland(工程与自然科学学院(SENS),冰岛大学) ; Global Land Monitoring Group, GFZ Helmholtz Centre for Geosciences(全球土地监测组,geofz赫尔姆霍兹研究中心)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 针对现有方法未将森林垂直结构作为有序轮廓学习的问题,提出Biomazon多模态基准数据集,结合GEDI RH和AGBD目标与多传感器预测因子,通过共享编码器-解码器框架进行消融研究,为热带森林结构一致RH轮廓预测和结构-生物量建模建立参考基准。
Comments 32 pages, 21 figures, 8 tables
FLiP:理解和解释多模态多语句子嵌入
机构 * Brno University of Technology(布拉格技术大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL
AI总结 提出因子化线性投影(FLiP)模型,从多语言、多模态句子嵌入中恢复词汇内容,揭示编码器的模态和语言偏差。
Comments Accepted to Interspeech 2026
当表格失控:评估多模态模型在法语金融文档上的表现
机构 * Inria Paris(巴黎国家信息与自动化研究所) ; Sorbonne Université(索邦大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL
AI总结 提出Scribe Finance基准,评估多模态模型在法语金融文档上的文本、表格、图表及多轮对话理解能力,发现模型在图表和多轮对话中表现脆弱。
Comments 16 pages, 13 figures
OmniMouse: 基于1500亿神经令牌的多模态多任务脑模型的可扩展性
机构 * Department of Ophthalmology, Byers Eye Institute, Stanford University(斯坦福大学眼科学系、比尔斯眼科研究所) ; Stanford Bio-X, Stanford University(斯坦福大学生物交叉学科) ; Wu Tsai Neurosciences Institute, Stanford University(斯坦福大学吴泰教授神经科学研究所) ; Institute of Computer Science and Campus Institute Data Science, University Göttingen(哥廷根大学计算机科学研究所和校园数据科学研究所)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI
AI总结 利用小鼠视觉皮层31亿神经元数据,训练多模态多任务模型OmniMouse,在神经预测、行为解码等任务上达到最优,发现性能随数据量可靠提升但模型规模收益饱和,与AI领域标准扩展规律相反。
Comments Published at ICLR2026
检测孟加拉语模因中的仇恨和煽动性内容:一个新的多模态数据集和共注意力框架
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学)
专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CL
AI总结 针对孟加拉语模因中仇恨和煽动性内容检测的研究空白,构建了首个区分煽动性内容与直接仇恨言论的数据集Bn-HIB,并提出多模态共注意力融合模型MCFM,通过联合分析视觉和文本特征实现更准确分类。
Comments Added public link to dataset and fixed typo in abstract
BioAutoML-NAS:基于大规模生物多样性数据通过神经架构搜索进行多模态昆虫分类的端到端AutoML框架
机构 * Department of Computer Science and Engineering, United International University, Dhaka, Bangladesh(乌姆国际大学计算机科学与工程系,达卡,孟加拉国) ; Applied Artificial Intelligence and Intelligent Systems (AAIINS) Laboratory, 1217, Dhaka, Bangladesh(应用人工智能与智能系统实验室(AAIINS),1217号,达卡,孟加拉国) ; Department of Computer Science and Engineering, Penn State University, University Park, PA, USA(宾夕法尼亚州立大学计算机科学与工程系,University Park,PA,美国) ; Faculty of Science and Information Technology, Charles Darwin University, Sydney, NSW, Australia(查尔斯达尔文大学科学与信息技术学院,悉尼,新南威尔士州,澳大利亚) ; Faculty of Science and Technology, Charles Darwin University, Casuarina, 0909, NT, Australia(查尔斯达尔文大学科学与技术学院,Casuarina,0909,北领地,澳大利亚)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 提出首个多模态BioAutoML模型BioAutoML-NAS,利用神经架构搜索自动学习图像操作,结合元数据融合与交替双层优化,在BIOSCAN-5M数据集上以96.81%准确率超越现有方法。
Comments Accepted in IEEE Transactions on Big Data
Journal ref IEEE Transactions on Big Data (2026)
GePBench:评估多模态大语言模型的基础几何感知能力
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL
AI总结 提出GePBench基准,系统评估多模态大语言模型的几何形状识别与空间关系感知能力,发现现有模型存在显著缺陷,而基于该基准训练可提升下游任务性能。
MVAD:多模态AI生成视频-音频检测基准数据集
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 针对现有数据集缺乏多模态真实性的问题,提出MVAD数据集,包含三种伪造模式、高质量样本及多样化的视觉风格和内容类别,用于检测AI生成的视频-音频内容。
Comments 10 pages,2 figures
利用大型多模态模型导航千兆像素病理图像
机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) ; Department of Pathology, Massachusetts General Hospital(麻省总医院病理学系) ; Department of Pathology and Laboratory Medicine, Brown University(布朗大学病理学与实验室医学系)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 提出GIANT方法,无需训练即可让通用多模态模型自主导航WSI,通过迭代选择多放大倍数裁剪并聚合证据,在MultiPathQA基准上实现SOTA。
人类引导的智能体AI用于多模态临床预测:来自AgentDS医疗基准的教训
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; Stanford University(斯坦福大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 通过人类引导智能体AI在多模态临床预测任务中取得领先性能,提炼出领域知识引导特征工程、任务特定多模态融合和临床动机模型集成三大通用经验。
Comments Presented at the Data Challenge track at the 14th IEEE International Conference on Healthcare Informatics (ICHI) 2026 on June 3, 2026
M4FC:一个多模态、多语言、多文化、多任务的真实世界事实验证数据集
机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) ; Ubiquitous Knowledge Processing Lab(ubiquitous知识处理实验室) ; Department of Computer Science, TU Darmstadt(TU Darmstadt计算机科学系) ; National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE) ; Department of Electrical Engineering, KU Leuven(KU Leuven电气工程系) ; Department of Computer Science, KU Leuven(KU Leuven计算机科学系)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL
AI总结 为解决现有事实验证数据集规模小、语言单一、任务局限等问题,提出包含4982张图片和6980条声明的多模态数据集M4FC,覆盖6个验证任务,并提供基线结果。
Comments Preprint under review. Code and data available at: https://github.com/UKPLab/M4FC
使用多模态AI代理进行可持续性评估
机构 * Paul G. Allen School of Computer Science & Engineering, University of Washington(保罗·G·艾伦计算机科学与工程学院,华盛顿大学) ; Computer Science and Engineering, University of Notre Dame(计算机科学与工程,诺丁汉大学) ; Electrical and Computer Engineering, Northeastern University(电气与计算机工程,东北大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 提出多模态多代理AI系统,模拟生命周期评估专家与利益相关者协作,自动估算电子设备碳足迹,将数据收集时间从数周缩短至一分钟,误差在19%以内。
Comments This article is published in Nature Electronics, and is available online at: https://www.nature.com/articles/s41928-026-01653-w
OmniSch:面向结构化图表视觉推理的多模态PCB原理图基准
机构 * Pennsylvania State University, USA(宾夕法尼亚州立大学) ; Independent Researcher(独立研究者) ; Binghamton University, USA(布ingham顿大学) ; Shanghai Jiao Tong University, China(上海交通大学) ; Microsoft Research(微软研究院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 提出首个多模态PCB原理图理解基准OmniSch,包含四项任务评估大模型在视觉定位、图推理和几何推理上的能力,揭示现有模型在工程图表理解上的显著差距。
OGA-AID:用于中风后康复多模态观察性步态分析的临床医生在环AI报告起草助手
机构 * Rehabilitation Research Institute of Singapore, Nanyang Technological University, Singapore(新加坡康复研究中心,南洋理工大学,新加坡) ; Lee Kong Chian School of Medicine, Nanyang Technological University, Singapore(李光前医学院,南洋理工大学,新加坡) ; The Grainger College of Engineering, University of Illinois Urbana-Champaign, United States(伊利诺伊大学厄巴纳-香槟分校格雷格学院,美国) ; Department of Rehabilitation Sciences, The Hong Kong Polytechnic University, Hong Kong(香港理工大学康复科学系,香港) ; VinUni-Illinois Smart Health Center, VinUniversity, Vietnam(Vin大学Vin-伊利诺伊智能健康中心,越南) ; Institute of Rehabilitation Excellence, Tan Tock Seng Hospital, NHG Health, Singapore(卓越康复研究所,坦托克桑格医院,NHG健康,新加坡)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 提出OGA-AID,一种临床医生在环的多智能体大语言模型系统,通过协调三个专业智能体合成患者运动记录、运动学轨迹和临床资料,生成结构化步态评估报告,在真实患者数据上优于单次多模态基线,并展示了AI辅助分析与人类临床判断的互补关系。
Comments 2026 CV4Clinic CVPR Workshop Proceedings
RefBench-PRO:面向感知与推理的指称表达理解基准
机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(国家人机混合增强智能重点实验室) ; National Engineering Research Center for Visual Information and Applications(国家视觉信息与应用工程技术研究中心) ; Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) ; Xi’an Jiaotong University(西安交通大学) ; Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI)) ; China Telecom(中国电信) ; Shanghai Jiao Tong University(上海交通大学) ; University of Science and Technology Beijing(北京科技大学)
专题命中 多模态评测 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 RefBench-PRO提出一个面向感知与推理的指称表达理解基准,通过分解指称表达为感知和推理两个维度,设计六个逐步递增的挑战任务,并引入Ref-R1强化学习方案提升定位精度,实现对多模态大语言模型的可解释评估。
MMOU:面向长且复杂真实世界视频的大规模多任务全模态理解与推理基准
机构 * NVIDIA, USA(NVIDIA美国分公司) ; University of Maryland, College Park, USA(马里兰大学帕克分校)
专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.CV、cs.CL
AI总结 提出MMOU基准,包含2万个人工标注问题与11877个长视频,覆盖13项技能,评估多模态大模型在长视频中的全模态理解与推理能力,最佳闭源模型仅64.2%准确率,开源模型46.8%。
Comments Project Page: https://huggingface.co/datasets/nvidia/MMOU
面向资源受限农村地区多模态临床筛查的云边协同系统
机构 * University of Michigan(密歇根大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Harvard Medical School(哈佛医学院)
专题命中 多模态评测 :multimodal(title,abstract)
AI总结 该研究针对资源受限农村地区的多模态临床筛查问题,提出云边协同架构,经实验验证其诊断性能优异且成本更低,可适配部署约束。
Comments 31 pages, 3 figures. In Proceedings of Machine Learning Research, Volume 340, 2026 (Machine Learning for Healthcare Conference)