MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(title);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(title);分类 cs.CV
专题命中 多模态评测 :multi-modal(title,abstract);MLLM(title);分类 cs.CV
Comments Accepted by ECCV 2024 Observing and Understanding Hands in Action Workshop (5 pages, 3 figures, 2 tables). arXiv admin note: substantial text overlap with arXiv:2410.01261
追踪、验证与修正:一种用于多模态大语言模型空间推理的无训练框架
机构 * East China Normal University(华东师范大学) ; Zhongguancun Academy(中关村学院) ; Stevens Institute of Technology(史蒂文斯理工学院)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL
AI总结 针对多模态大语言模型空间推理的错误传播问题,提出无训练的追踪-验证-修正框架,构建空间证据图并评估证据可靠性,在15种模型-数据集设置下平均准确率达68.94%,优于基线。
Comments 19 pages, 7 figures
MBA:面向现实世界商业创意的多模态基准与智能体
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 该研究推出首个多模态商业创意基准MBA-Bench,提出MBA-b和MBA-k两种智能体,经实验其性能显著优于相关基准,为多模态商业创意智能体研究提供了重要支撑。
Comments Project page: https://hchoi256.github.io/projects/mba/ Code: https://github.com/hchoi256/MBA
面向多模态大语言模型的统一幻觉模糊测试
专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CL、cs.AI
AI总结 针对多模态大语言模型的幻觉问题,提出含UniHall基准与SAMF自演化模糊测试的评估框架,发现SOTA模型在模糊测试下性能显著下降,存在有用性-幻觉权衡。
Comments 47 pages, 17 figures
通过封面判断书籍:调查多模态大语言模型用于多页手写文档转录
机构 * University of Oxford(牛津大学) ; QuantCo
专题命中 多模态评测 :multi-modal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 本文研究多模态大语言模型在多页手写文档转录中的应用,提出OCR+PAGE-1和OCR+PAGE-N策略,通过共享页面内容提升转录效果。
Comments 10 pages (36 including references and appendices), 11 figures, accepted at COLM 2026, earlier version accepted at AAAI 2025 Workshop on Document Understanding and Intelligence
DisasterTD:使用多模态大语言模型和跨视角地理定位的灾害地名消歧
机构 * College of Geodesy and Geomatics, Shandong University of Science and Technology(山东科技大学测绘与地理信息学院) ; School of Environmental Science and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与测绘学院) ; State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; School of Automation, Southeast University(东南大学自动化学院) ; Department of Geography, National University of Singapore(新加坡国立大学地理系)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 研究针对社交媒体图像地理参考模糊问题,提出DisasterTD框架,集成多模态大语言模型语义推理与跨视角地理定位,在飓风哈维数据集上评估,该方法优于基线,能有效进行细粒度灾害地理定位,提升不同距离下的定位准确率并减少误差。
通过能力导向的基准和MCTS驱动的数据生成推进多模态评判模型
机构 * Tsinghua University(清华大学) ; ByteDance(字节跳动)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 本文提出M-JudgeBench和Judge-MCTS框架,通过能力导向的基准和MCTS驱动的数据生成提升多模态评判模型的评估能力。
MechVQA:在综合机械图纸理解上基准测试与增强多模态大语言模型
机构 * Beijing Academy of Artificial Intelligence (BAAI), China(北京人工智能研究院) ; Institute of Information Engineering, Chinese Academy of Sciences, China(信息工程研究所) ; Beijing University of Technology, China(北京理工大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 针对多模态大语言模型在机械工程图纸理解上的不足,提出首个综合机械图纸理解数据集MechVQA,并开发MechVL模型,通过多阶段训练显著提升性能。
Comments accept by iclm2026, add github link
Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea, PMLR 306 (2026)
SONIC-O1:用于评估多模态大语言模型在音视频理解上的真实世界基准
机构 * Vector Institute for Artificial Intelligence(向量人工智能研究所) ; University of Groningen(Groningen大学) ; York University(约克大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 提出SONIC-O1基准,包含60小时人工验证的音视频数据,评估多模态大语言模型在开放摘要、多项选择问答和时序定位上的能力,发现模型在时序定位上存在显著性能差距和人口统计偏差。
FraudBench: 一个多模态基准用于检测AI生成的欺诈性退款证据
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) ; Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-NTU全球可持续性科技实验室) ; Alibaba Group(阿里巴巴集团)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 本文提出FraudBench,一个用于检测AI生成欺诈性退款证据的多模态基准。通过真实用户评价证据构建,结合图像编辑模型生成伪造证据,并评估不同模型在不同生成器下的性能。
迈向年龄相关性黄斑变性的多模态对话式人工智能
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL
AI总结 本文提出OcularChat,一种基于多模态大语言模型的系统,通过模拟患者与医生对话,利用视网膜彩色照相进行黄斑变性诊断,展现出优于现有模型的分类性能和临床解释能力。
Comments 38 pages, 4 figures
多模态大语言模型真的能理解小物体吗?
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; University of Science and Technology of China(中国科学技术大学) ; Fudan University(复旦大学) ; MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 本文提出SOUBench基准,评估现有多模态大语言模型对小物体的理解能力,发现其能力有限,并通过SOU-Train数据集提升模型表现。
Comments Under Peer Review (26 pages, 9 figures, 6 tables)
MMR-AD:一个大规模多模态数据集,用于基于多模态大语言模型的通用异常检测基准测试
机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) ; MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 本文提出MMR-AD数据集,用于评估多模态大语言模型在通用异常检测中的性能,揭示当前SOTA模型与工业需求的差距,并提出基于推理的Anomaly-R1模型,实现了异常检测与定位的显著提升。
Comments Accepted by CVPR2026
叙事编织者:迈向多模态可控的长程视觉一致性
机构 * Peking University(北京大学) ; Kuaishou Technology(快手科技)
专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 Narrative Weaver通过整合精细控制、自动叙事规划和长程一致性,解决生成AI中多模态可控、长程且一致的视觉内容生成问题,提出首个综合解决方案并构建首个电商广告视频脚本数据集。
Comments Accepted by CVPR2026
一种高质量数据集和可靠的评估方法用于交错图像-文本生成
机构 * Nankai University(南开大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanda AI Research(尚德人工智能研究院) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 多模态评测 :image-text(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 InterSyn数据集通过高质量、大规模和多样化指导设计,提升LMMs在图像-文本生成任务中的性能,并提出SynJudge评估方法,全面评估内容和跨模态交互质量。
Comments Accepted in ICLR2026
CrossCheck-Bench:多模态冲突解决中的组成性故障诊断
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
AI总结 CrossCheck-Bench通过多阶段注释流程构建的基准测试,揭示了多模态模型在处理跨模态冲突时的瓶颈,并表明融合符号推理与视觉处理的方法能提升模型的稳健性。
Comments Accepted by AAAI 2026
专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.CL
Comments The M-PACE framework uses a "mother-child" AI model system to automate and unify compliance checks for ads, reducing costs while maintaining high accuracy
机构 * National Taiwan Normal University(台湾国立正常大学)
专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI
Comments Accepted at IEEE ASRU 2025
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; University of Science and Technology of China(中国科学技术大学)
专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);audio-visual(abstract);分类 cs.MM、eess.AS
专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Technical report
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted to ICLR 2024
专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments Extension of our CVPR 2023 paper: arXiv:2304.02556 Code: https://github.com/rshaojimmy/MultiModal-DeepFake
OxyEcomBench:跨电子商务生态系统的多模态基础模型基准测试
专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title)
AI总结 本文提出OxyEcomBench,一个涵盖6300个高质量实例的多模态基准,用于评估模型在电子商务场景中的表现,通过覆盖平台运营者、商家和消费者六个能力方面和29项任务,验证模型在多模态输入下的性能。
ReMiX-MAE:从仅含RGB的临床面部视频中学习缺失通道跨模态表征以用于交感介导的疼痛评估
机构 * School of Computing, Binghamton University(宾汉姆顿大学计算学院) ; SUNY Upstate Medical University(纽约州立大学上州医科大学)
专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 本文提出ReMiX-MAE框架,构建SMP数据集,在仅用RGB的疼痛评估任务中,其性能优于仅用RGB的基线,且在数据有限的临床场景中迁移能力更优。
面向细粒度遗忘:多模态大语言模型的属性遗忘
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI
AI总结 针对多模态大语言模型(MLLMs)属性遗忘的细粒度需求,提出轻量级训练无关框架CLRP,通过激活修补定位因果层并应用保留感知投影,实现目标属性遗忘同时保留同一身份信息,在多种MLLMs上验证了有效性。
DeceptionX: 基于多模态大语言模型的可解释欺骗检测
机构 * Great Bay University(大湾区大学) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出DeceptionX框架,将欺骗检测从黑箱分类转变为可解释的观察-思考-总结推理过程,通过构建DeceptChain数据集和三阶段训练管道,在标准基准上超越现有方法,同时提供专家级可解释推理路径。
PathView-Bench:多模态大语言模型能否实现病理图像的细粒度多尺度理解?
机构 * National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康与医学数据科学国家研究院)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI
AI总结 研究针对现有病理多模态基准的不足,推出PathVU基准,评估发现主流MLLMs在多尺度病理图像细粒度视觉任务上存在显著局限,为相关模型的开发评估提供了可复现基础。
全模态感知策略优化用于多模态情感推理
机构 * University of Science and Technology of China(中国科学技术大学) ; SenseTime Research(商汤科技研究院) ; National University of Singapore(新加坡国立大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.AI
AI总结 提出OPPO强化学习框架,通过全模态感知奖励和损失优化多模态感知,提升情感推理中模态利用率和忠实度,在多个基准上达到最优。
Comments Accepted at ICML 2026. Project page: https://zjycutieee.github.io/OPPO-page/ Code: https://github.com/ZhiyuanHan-Aaron/OPPO