Physics-Based Benchmarking Metrics for Multimodal Synthetic Images
基于物理的多模态合成图像基准度量指标
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出结合大语言模型与推理、知识映射和视觉语言模型的物理约束多模态数据评估指标,以提升多模态合成图像的语义和结构准确性。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
基于物理的多模态合成图像基准度量指标
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出结合大语言模型与推理、知识映射和视觉语言模型的物理约束多模态数据评估指标,以提升多模态合成图像的语义和结构准确性。
TableVista:在视觉和结构复杂性下多模态表格推理的基准测试
机构 * Tongji University(同济大学) ; University of Bristol(布里斯托大学) ; Tianjin University(天津大学) ; Yale University(耶鲁大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 TableVista包含3000个高质量表格推理问题,通过多风格渲染和转换流程生成30000个多模态样本,评估29种基础模型在不同复杂性下的表现,揭示结构复杂性和视觉整合对推理一致性的影响。
Comments ACL 2026 Findings
TRIP-Evaluate: 一个用于评估交通领域大模型的开放多模态基准
机构 * School of Transportation(交通学院) ; Southeast University(东南大学) ; School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) ; Jiangnan University(江南大学) ; Department of Civil and Environmental Engineering(土木与环境工程系) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 TRIP-Evaluate是首个开放多模态交通评估基准,通过837项任务覆盖车辆、交通管理、旅行者和规划设计功能,提供能力、模态和难度标签,支持跨模态诊断,揭示大模型在多步工程计算、规则约束推理和多模态场景理解方面的不足。
Comments 19 pages, 12 figures
CheXthought:一个包含临床推理链和视觉注意力的全球多模态数据集,用于胸部X光解读
机构 * Center for Artificial Intelligence in Medicine and Imaging(医学与影像人工智能中心) ; Department of Radiology(放射科) ; Department of Pediatrics(儿科) ; Department of Radiology, Weill Cornell Medicine(韦氏 Cornell 医学院放射科) ; Department of Radiology, Brigham and Women’s Hospital(布里奇妇产科医院放射科) ; University of California, Berkeley(加州大学伯克利分校) ; University of California, San Francisco(加州大学旧金山分校) ; Department of Biomedical Data Science(生物医学数据科学部)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 CheXthought数据集通过501名放射科医生的50312例多读X光片,提供了103592条推理链和6609082条同步视觉注意力标注,展示了临床推理模式,并在事实准确性、空间定位、病理分类、视觉忠实度、时间推理和不确定性沟通等方面提升了视觉语言模型性能。
Comments 51 pages, 7 figures, 10 tables
VLM评判者能排序但无法评分:多模态评估中的任务依赖性不确定性
机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校) ; AI Labs at Capital One(Capital One人工智能实验室)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 本文通过置信预测框架分析VLM作为评判者的可靠性,发现任务依赖性显著影响评估不确定性,提出排名-评分解耦问题,揭示任务难度和标注质量对区间宽度的影响。
多模态关系知识图像上的结构化与抽象推理
机构 * Zhejiang University(浙江大学) ; Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.CL
AI总结 本文提出STAR-64K数据集及两阶段增强框架,通过合成多模态指令数据提升模型在抽象推理任务中的性能,实验表明小型模型在STAR任务中超越GPT-4o。
Comments Accepted by Findings of ACL 2026
M$^3$-VQA:多模态、多实体、多跳视觉问答的基准测试
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 M$^3$-VQA引入了多实体问题,要求模型在多个文档间进行顺序和并行多跳推理,揭示了多模态大语言模型在知识获取和推理方面的挑战。
QEVA:一种基于多模态问答的无参考视频文本摘要评估指标
机构 * Department of Artificial Intelligence, Chung-Ang University(Chung-Ang大学人工智能系)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出QEVA,一种无参考视频摘要评估指标,通过多模态问答直接评估候选摘要与源视频,从覆盖性、事实性和时间顺序三个维度进行评估,引入MLVU(VS)-Eval基准数据集,实验表明QEVA与人类判断的关联性更高。
Comments Accepted to Findings of EMNLP 2025
EmoTrans:一个多模态大语言模型中情感过渡理解、推理和预测的基准测试
机构 * Shenzhen University(深圳大学) ; Guangdong Laboratory of Artificial Intelligence(广东人工智能与数字经济实验室) ; Queen Mary University of London(女王学院伦敦大学) ; Technical University of Munich(慕尼黑技术大学) ; Imperial College London(伦敦帝国学院) ; Tongji University(同济大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 EmoTrans旨在评估多模态视频中情感动态理解能力,包含1000个手工标注的视频片段和3000多个任务特定问题-答案对,通过四个任务形成从粗粒度检测到深度推理的评估框架,发现当前大语言模型在细粒度情感动态建模上仍存在挑战。
欧洲医学问答研究协议:一个多语言、多模态的医学考试数据集用于语言模型评估
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出欧洲医学问答数据集,旨在通过多语言多模态数据评估语言模型性能,评估跨语言迁移和视觉推理能力。
UNIKIE-BENCH:用于视觉文档中关键信息提取的大型多模态模型基准测试
机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) ; Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) ; Alibaba Group, Hangzhou, China(阿里巴巴集团)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 本文提出UNIKIE-BENCH基准,用于评估大型多模态模型在视觉文档关键信息提取中的性能,揭示了不同场景下模型的性能差异及挑战。
临床试验叙述中剂量错误自动检测:基于LightGBM的多模态特征工程方法
机构 * Qatar University(卡塔尔大学)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种基于LightGBM的多模态特征工程方法,用于自动检测临床试验叙述中的剂量错误,通过结合多种特征提取方法提升模型性能,克服类别不平衡问题。
Comments Accepted for CL4Health 2026, LREC26 conference
一种用于全生命周期脑年龄预测的双阶段多模态MRI框架
机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) ; Department of Biomedical Informatics, Emory University(埃默里大学生物医学信息学系)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出双阶段多模态MRI框架,通过独立处理模态并融合评估,实现对全生命周期脑成熟度的统一评估。
认知链式推理(CoCoT):关于社会情境的结构化多模态推理
机构 * Seoul National University(首尔国立大学) ; Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学) ; Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出CoCoT框架,通过感知、情境推断和规范应用三个阶段提升多模态社会推理能力,在多个任务中取得显著提升。
Comments Under review; 17 pages
基于链式思维的多模态大语言模型视觉空间推理能力退化
机构 * Microsoft Research India(微软印度研究院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 研究发现链式思维范式在视觉空间推理任务中导致性能下降,通过实验揭示多模态模型在空间基准测试中的关键缺陷,并指出需转向以视觉为中心的推理方法。
Mind's Eye:多模态大语言模型的视觉抽象、转换与组合基准
机构 * CSE Dept., IIT Hyderabad(IIT海得拉巴计算机科学与工程系) ; Microsoft Research(微软研究院) ; IIT Hyderabad(IIT海得拉巴)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出Mind's Eye基准,通过A-R-T分类评估多模态大语言模型的视觉认知能力,发现人类准确率达80%,而顶级模型低于50%,揭示模型在视觉空间推理上的不足。
KMMMU:评估韩语多学科多模态理解
机构 * Chung-Ang University(Chung-Ang 大学) ; Seoul National University(首尔国立大学) ; SK A.X ; OnelineAI ; HAE-RAE
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.MM
AI总结 KMMMU是首个针对韩语文化机构场景的多模态理解评估基准,包含3466道韩语原生考试题,涵盖九大学科和九种视觉模态,验证了多模态模型在韩语环境下的性能差异与挑战。
Comments 8 pages
MM-Telco: 电信应用的多模态大语言模型基准与工具
机构 * IIT Bhilai(比哈尔理工学院) ; IIT Kanpur(坎pur理工学院) ; INPT(伊斯兰北方技术大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出MM-Telco,为电信领域设计的多模态基准和模型,旨在解决领域特定挑战,通过基准任务和实验验证提升大语言模型在电信中的性能。
在何时不回答:评估多模态推理系统中的退避
机构 * ServiceNow Research(ServiceNow研究院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 本文提出MM-AQA基准,通过视觉模态依赖性和证据充分性变换生成不可回答实例,评估三种前沿VLM和两种MAS架构,发现VLM在标准提示下 rarely 退避,MAS提升退避但引入准确率-退避权衡,序列设计表现优异,表明退避意识训练比提示或更多代理更重要。
Comments 10 pages and 4 figures (excluding appendix)
好分数,坏数据:一种多模态一致性度量
机构 * AI Architect(人工智能架构师) ; Author, Data Engineering for Multimodal AI (O’Reilly)(多模态AI数据工程作者(O’Reilly)) ; Stanford School of Engineering, Graduate Certificate (in progress)(斯坦福工程学院,研究生证书(在读))
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出多模态一致性度量(MCS),用于评估多模态融合质量,不依赖下游模型。通过四个维度(身份、空间、语义、决策)评估,MCS在1000张视觉基因组图像和150张COCO图像上验证,比任务准确率更敏感。
Comments 9 pages, 6 figures, NeurIPS 2024 format
牙科分诊基准:用于分层牙科分诊的多模态推理基准
机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) ; Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) ; The Prince Philip Dental Hospital(菲利普王子牙科医院) ; Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学利滋医学学院) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.MM
AI总结 本文提出Dental-TriageBench,首个专家标注的多模态牙科分诊基准,通过246个脱敏案例评估19种模型在细粒度治疗层面分诊中的表现,揭示了人类与模型间的显著差距。
FORGE:面向制造场景的细粒度多模态评估
机构 * University of Waterloo(滑铁卢大学) ; University of Sydney(悉尼大学) ; Singapore Management University(新加坡管理大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Hunan University(湖南大学) ; Nanyang Technological University(南洋理工大学) ; Royal Melbourne Institute of Technology(皇家墨尔本理工大学) ; City University of Hong Kong(香港城市大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; City University of Hong Kong Shenzhen Research Institute(香港城市大学深圳研究院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出FORGE,构建高质量多模态数据集并评估18种先进MLLM在制造任务中的表现,揭示领域知识不足是主要瓶颈,展示结构化标注可提升模型精度。
Comments Project Page:https://ai4manufacturing.github.io/forge-web
VisText-Mosquito:一种统一的多模态数据集,用于蚊虫繁殖地的视觉检测、分割和文本解释
机构 * United International University, Bangladesh(孟加拉国联合国际大学) ; University of Arizona, USA(美国亚利桑那大学) ; BRAC University, Bangladesh(孟加拉国布拉卡大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 本文提出VisText-Mosquito数据集,整合视觉和文本数据以支持自动化检测、分割和解释,通过YOLOv9s和YOLOv11n-Seg模型实现高精度检测与分割,并利用大视觉语言模型生成文本解释,强调预防胜于治疗的主题。
Comments Accepted at CVPRW 2026
HM-Bench:多模态大语言模型在高光谱遥感中的综合基准
机构 * Sun Yat-sen University(中山大学) ; Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) ; China Agricultural University(中国农业大学) ; Southwest Jiaotong University(西南交通大学) ; Southwest University(西南大学) ; National Supercomputing Center in Shenzhen(国家超级计算深圳中心)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出HM-Bench,首个用于评估多模态大语言模型在高光谱图像理解中的基准,通过构建19337对问题-答案对,探索模型在处理高维高光谱数据中的挑战,揭示视觉输入在空间-光谱推理中的优势。
数字取证中的仇恨与威胁检测:基于案例的多模态方法
机构 * University of Nevada, Reno(内华达大学雷诺分校)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种基于案例的多模态方法,用于数字取证中的仇恨与威胁检测,通过区分文本证据、关联上下文文本和图像证据,提升取证的可追溯性和准确性。
Comments 8 pages, 4 figures
多模态大语言模型在离散符号理解中的认知不匹配
机构 * Tsinghua University(清华大学) ; Sun Yat-sen University(中山大学) ; Independent Researcher(独立研究员) ; The Hong Kong Polytechnic University(香港理工大学) ; Guangdong Laboratory of AI and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 研究发现多模态大语言模型在离散符号识别上表现欠佳,而在复杂推理任务上表现较好,揭示了当前系统依赖语言先验而非稳健视觉基础的问题。
MM-MoralBench: 一种多模态道德评估基准用于大型视觉-语言模型
机构 * University of Chinese Academy of Sciences(中国科学院大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 为评估大型视觉-语言模型的道德对齐性,提出MM-MoralBench基准,通过多模态场景测试模型在六个道德基础上的判断与分类能力,揭示模型存在显著的道德偏见问题。
Comments Accepted by Pattern Recognition
基于交叉注意力的多模态用户界面控制检测
机构 * AI Research Lab, Tricentis(Tricentis AI研究实验室) ; Institute of Artificial Intelligence, Center for Medical Statistics, Informatics, and Intelligent Systems, Medical University of Vienna(维也纳医科大学人工智能研究所、医学统计、信息学与智能系统中心)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种结合文本描述与视觉信息的多模态YOLOv5改进模型,通过交叉注意力模块提升UI控件检测的鲁棒性和语义理解能力,实验表明在复杂或模糊的UI场景中性能显著提升。
ProMQA-Assembly:多模态装配任务问答数据集
机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) ; National Institute of Advanced Industrial Science and Technology (AIST)(国立研究开发法人产业技术综合研究所(AIST))
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 本文提出ProMQA-Assembly数据集,包含646个多模态问答对,用于评估装配任务中的人机交互系统,通过半自动化标注方法生成问题并结合细粒度动作标签提升多样性,验证了推理模型在复杂多模态任务中的表现。
Comments LREC 2026. Code and data: https://github.com/kimihiroh/promqa-assembly
V2X-QA:面向自动驾驶多视角的多模态大语言模型综合数据集与基准测试
机构 * Department of Civil and Environmental Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校土木与环境工程系) ; Department of Civil and Architectural Engineering and Construction Management, University of Wyoming(怀俄明大学土木与建筑工程及施工管理系) ; School of Transportation, Southeast University(东南大学交通学院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出V2X-QA数据集和基准测试,用于评估多模态大语言模型在自动驾驶中的多视角推理能力,揭示视角对性能的影响,并提出V2X-MoE模型以提升多视角推理性能。