MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI
专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.AI
Comments CVPR 2024 Oral
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.AI
Comments CVPR 2024 Oral
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted by ICML2024
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 27 pages, 23 figures
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM
Comments Technical report
专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments This is the camera-ready version of the paper that will be published in the Proceedings of EMNLP 2023 (Singapore, 6-10 December 2023)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Data and results are available at: https://github.com/EternityYW/Gemini-Commonsense-Evaluation/
专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted at NeurIPS 2023 Datasets and Benchmarks Track (10 pages for main text, 4 pages for references, 39 pages for supplementary materials)
专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments The paper has been accepted by NeurIPS 2023 Datasets and Benchmarks Track. Project page: https://ntu-aiot-lab.github.io/mm-fi
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI、cs.MM
专题命中 多模态评测 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted in CVPR 2022
多轮对话式AI:从文本到多模态交互——数据、模型、评估与开放挑战
专题命中 多模态评测 :multimodal(title,abstract);omni-modal(abstract);分类 cs.CL、cs.AI
AI总结 本研究综述多轮对话式AI的发展现状,梳理其在数据、模型等方面的进展,指出多模态交互能力提升但存在记忆等短板,并提出相关研究议程。
Comments Multi-turn Conversational AI; Multimodal Dialogue; AudioLLMs; Conversational Memory; Tool-Augmented Agents; Dialogue Evaluation
机构 * Department of Electronics, Information, and Bioengineering(电子、信息与生物工程系) ; Polytechnic University of Milan(米兰理工学院) ; Department of Industrial, and Information Engineering(工业与信息工程系) ; University of Pavia(帕维亚大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
Journal ref Moglia, A., Nastasio, E.C., Mainardi, L. et al. MiniGPT-Pancreas: Multimodal Large Language Model for Pancreas Cancer Observation and Localization in CT Images. J Healthc Inform Res (2025)
专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI
Comments Code and Dataset: https://huggingface.co/datasets/sohomghosh/MiMIC_Multi-Modal_Indian_Earnings_Calls_Dataset
MultiRef-Compass:迈向多参考到音频-视频生成的综合评估
专题命中 多模态评测 :MLLM(summary_cn,abstract);audio-visual(abstract);分类 cs.CV
AI总结 研究针对多参考到音频-视频生成设置,引入MultiRef-Compass基准。通过可扩展管道构建350个样本,定义含四个维度14个子指标的评估协议,集成自动指标与MLLM评判框架,实验表明该基准对MR2AV研究有重要意义。
Comments 32 pages
超越场景先验:通过基准测试和查询引导的小目标聚焦进行细粒度交通场景推理
机构 * The University of Hong Kong(香港大学) ; Sun Yat-Sen University(中山大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV
AI总结 针对安全关键交通场景中复杂问题,提出细粒度交通推理基准FGTR - Bench和文本引导小目标推理MLLM(TSR - MLLM),解决视觉语言对齐中关键小目标被忽视问题,提升模型性能。
FlameVQA: 一个基于辐射热监督的物理基础无人机野火VQA基准
机构 * National Science Foundation(国家科学基金会) ; NASA(美国国家航空航天局)
专题命中 多模态评测 :MLLM(summary_cn,abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出FlameVQA,一个基于FLAME 3数据集的无人机野火多选视觉问答基准,利用配对的RGB和辐射热TIFF图像实现温度基础的推理,评估了多种MLLM在检测、定位、覆盖估计等任务上的表现。
ShutterMuse: 基于多模态大语言模型的拍摄时刻摄影指导
机构 * Fudan University(复旦大学) ; StepFun
专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV
AI总结 提出CaptureGuide-Bench基准测试,评估MLLM在摄影师构图与主体姿态推荐方面的能力,并构建ShutterMuse统一模型,通过监督与强化微调实现最佳综合性能。
Comments Project Page:https://lijayutnt.github.io/ShutterMuse
我们的基准测试足够吗?多模态大语言模型持续学习分析
机构 * School of Computer Science and Statistics, Trinity College Dublin(都柏林圣三一学院计算机科学与统计学院) ; Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)
专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.AI
AI总结 本文质疑MR-LoRA方法对MLLM路由器的依赖,提出无训练无重放的简单原型路由方法RePRo,并指出共享专家无益,揭示MLLM-CL基准的任务高度可分离和固定顺序导致评估偏差,从而提出新基准设计。
Comments ICML 2026 Workshop "Continual Adaptation at Scale: Towards Sustainable AI"
看见而不暴露:面向开放世界、上下文饥渴型MLLM的自适应隐私控制
机构 * City University of Hong Kong(香港城市大学) ; Hon Hai Research Institute(鸿海研究学院) ; Lingnan University(岭南大学)
专题命中 多模态评测 :MLLM(title_cn,abstract);multimodal(abstract);分类 cs.CV
AI总结 针对多模态大语言模型在开放世界中面临不可预测敏感信息泄露的隐私挑战,提出无训练方法APD,将隐私元素漂移至语义等价替代物并锚定上下文线索,结合新基准AdaptShield实现隐私保护与上下文保留的平衡提升。
T2AV-Compass:迈向文本到音频-视频生成的统一评估
机构 * NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) ; Kling Team, Kuaishou Technology(快手技术 Kling 团队) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 多模态评测 :MLLM(summary_cn,abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出T2AV-Compass基准,通过分类学驱动的500个复杂提示和双层次评估框架(客观信号指标+主观MLLM评判),系统评估文本到音频-视频生成模型,发现现有模型在跨模态对齐和指令遵循方面显著不足。
Comments 41 pages, 13 figures, 12 tables. Accepted at ICML 2026
相同模型,不同弱点:语言与模态如何重塑前沿多模态大语言模型的越狱攻击面
机构 * Appen(Appliance)
专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CL
AI总结 通过跨语言多模态红队测试,发现语言和模态通过不同机制影响越狱漏洞,导致安全排名跨语言不守恒,需重新设计评估框架。
通过现实场景合成和文档感知训练实现真实世界文档解析
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; Tencent(腾讯) ; Nankai University(南开大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Nanjing University of Science and Technology(南京理工大学)
专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV
AI总结 本文提出数据训练协同框架,通过现实场景合成和文档感知训练提升文档解析的准确性和鲁棒性,构建了Wild-OmniDocBench基准,并在1B参数MLLM中实现了跨扫描/数字和真实世界场景的优异性能。
当无关文本起作用时:多模态大语言模型中的仿射间隔偏移
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 本文研究多模态大语言模型(MLLMs)中任务无关文本对视觉判断任务的影响,发现其会使模型决策间隔发生可预测的仿射变换,为提升模型对噪声上下文的鲁棒性提供了诊断基础。
未书写基准:多模态机器学习在抽象感知推理领域的新挑战
机构 * Arizona State University(亚利桑那州立大学)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出The Unwritten Benchmark基准,针对多模态模型在抽象感知推理中的不足,开展声-运动学文字推理任务评估,发现模型性能远逊于人类且存在模态融合悖论。
Comments To be published in CVPR Findings 2026
通过代理评估和稳定性感知排名实现多模态大语言模型的鲁棒检查点选择
机构 * Meta AI
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种多阶段框架,结合了精心挑选的现实世界数据、结构化的LLM判断和多阶段排名协议,以解决多模态大语言模型检查点选择中的鲁棒决策问题,强调数据质量(特别是OCR可读性)对评估有效性的重要性。
Diagram-MMU:面向科学图表的多模态基准测试
机构 * Nanjing University of Science and Technology(南京理工大学) ; Baidu Inc(百度公司) ; AIML, Adelaide University(阿德莱德大学AIML) ; SUTD(新加坡科技设计大学) ; Southeast University(东南大学) ; East China Normal University(华东师范大学) ; University of Oxford(牛津大学)
专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文构建了多模态基准测试Diagram-MMU,评估MLLMs的科学图表解析与理解能力,发现图表转代码任务更具挑战,Claude-4.6 Opus在智能体场景下表现最优。
当提示词成为像素:面向多模态推理的提示词-区域定位
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 该研究针对多模态大语言模型在视觉化任务语义场景下的准确率下降问题,提出提示词-区域定位方法,有效提升了基准测试准确率且无需OCR或区域元数据。
SIGNPOST-Bench:评估多模态大语言模型文本-视觉冲突解决能力的基准
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL
AI总结 本研究推出SIGNPOST-Bench基准,通过包含5111个反事实组的25555个图像变体,评估20个多模态大语言模型的文本-视觉冲突解决能力,发现对抗文本会显著提升定位误差,且模型对冲突文本的鲁棒性无法由干净输入的定位性能完全预测。
Comments 27 pages, 25 figures
纽约气味:一个大规模多模态数据集用于嗅觉
机构 * Columbia University(哥伦比亚大学) ; Cornell University(康奈尔大学) ; Osmo Labs(Osmo实验室)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 New York Smells 数据集通过多模态数据提升机器对嗅觉的感知能力,展示了视觉数据在跨模态学习中的作用。
Comments Project website at https://smell.cs.columbia.edu
面向社交媒体中统一的多模态虚假信息检测:基准数据集与基线模型
机构 * School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学) ; School of Computer Science and Technology, Northwestern Polytechnical University(计算机科学与技术学院,西北工业大学)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 该研究构建了含9.8万样本的OmniFake基准数据集,提出UMFDet框架,实现对人工与AI生成两类多模态虚假内容的统一检测,性能优于专用基线。