arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-28 至 2026-08-28 共收录 24 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 24 篇

2608.13463 2026-08-28 cs.CV cs.AI cs.CL cs.LG 版本更新 91%

MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification

用于鲁棒跨数据集图像分类的MLLM路由异质集成模型

Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck

机构 * The Bredesen Center for Interdisciplinary Research and Graduate Education(布雷德森跨学科研究与研究生教育中心) University of Tennessee Knoxville(田纳西大学诺克斯维尔分校)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究针对跨数据集图像分类泛化难题,提出ARMDIL模型,通过MLLM智能体动态路由图像到适配的视觉骨干,兼具竞争力、高适应性与可解释性,为通用视觉系统奠定基础。

Comments 15 pages (single column), 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02897 2026-08-28 cs.CR cs.AI cs.CV 版本更新 91%

PPE-Bench: A Benchmark for Evaluating MLLM Unlearning under Private-Public Entanglement

PPE-Bench:用于评估公私纠缠下MLLM遗忘能力的基准测试

Xianren Zhang, Delvin Ce Zhang, Dongwon Lee, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Sheffield(谢菲尔德大学)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对现有MLLM遗忘基准测试的局限性,提出PPE-Bench基准测试,包含公私纠缠图像,引入两种方法在遗忘中保护公共信息,实验发现现有方法能减少隐私泄露,但常损害相邻公共信息。

Comments to appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26856 2026-08-28 cs.CV cs.AI 新提交 86%

From Reasoning to Pixels: Grounded Medical Multimodal LLMs for VQA and Segmentation

从推理到像素:用于VQA和分割的接地医学多模态大语言模型

Haowen Gu, Gensheng Pei, Junzhu Mao, Qiong Wang, Mingwu Ren, Yazhou Yao

机构 * Nanjing University of Science and Technology(南京理工大学) Sungkyunkwan University(成均馆大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对现有医学多模态大语言模型缺乏像素级接地的问题,提出MedREAL框架,引入SARP与R2V机制,构建MedRAVS-13K数据集,在Med-VQA和分割任务上性能优于现有方法,为医学图像分析提供可解释框架。

Comments accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27214 2026-08-28 cs.CV 新提交 85%

CODE: Cross-Modal Calibration and Dynamic Suppression for Open World Object Detection

CODE:面向开放世界目标检测的跨模态校准与动态抑制

Hao Xu, Zhaoning Shi, Hehe Jin, Bo Ma

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文针对开放世界目标检测的语义歧义与过度抑制问题,提出含三个互补组件的CODE框架,在真实世界检测基准上超越此前最优方法。

Comments Accepted by ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22963 2026-08-28 cs.AI cs.CL 版本更新 84%

Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents

被文本债务掩埋:面向多模态大语言模型智能体的保留视觉证据的上下文剪枝

Yuchen Huang, Sijia Li, Jun Zhang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :MLLM(title,abstract_cn);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型智能体长轨迹中文本主导上下文、抑制视觉证据的问题,提出基于KL引导的SPARE框架,结合OPSD与SFT实现高效剪枝,在多步视觉工具使用基准中达到最优准确率与剪枝比例的权衡。

Comments 17 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22084 2026-08-28 cs.CV 版本更新 83%

MObyGaze: a film dataset of multimodal objectification densely annotated by experts

MObyGaze:由专家密集标注的多模态客体化电影数据集

Elisa Ancarani, Julie Tores, Lucile Sassatelli, Hui-Yin Wu, Remy Sun, Paul Mouret, Clement Bergman, Lea Andolfi, Victor Ecrement, Thierry Devars, Magali Guaresi, Virginie Julliard, Sarah Lecossais, Frederic Precioso

机构 * Université Côte d’Azur, CNRS, I3S, France(法国里沃利大学、法国国家科学研究中心、I3S研究所) Université Côte d’Azur, CNRS, Inria, I3S, France(法国里沃利大学、法国国家科学研究中心、法国国家科学研究院、I3S研究所) Institut Universitaire de France(法国大学研究院) Université Côte d’Azur, Inria, France(法国里沃利大学、法国国家科学研究院、法国) Université Côte d’Azur, CNRS, BCL, France(法国里沃利大学、法国国家科学研究中心、BCL研究所) Sorbonne Université, GRIPIC(索邦大学、GRIPIC研究所) Université Sorbonne Paris Nord, LabSIC(巴黎-索邦大学北校区、LabSIC研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究引入新AI任务以量化电影中多模态客体化模式,构建含20部电影的MObyGaze数据集并完成标注,通过基准测试证明任务可行性,公开代码与数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26317 2026-08-28 cs.CV cs.AI cs.MM 新提交 82%

Modality Maturity Index: A benchmark for assessing multimodal capabilities of omni models

模态成熟度指数:评估全模态模型多模态能力的基准

Rohit Patel, Dieuwke Hupkes, Sloan Strader

机构 * Meta Superintelligence Labs(元超级智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 该研究提出评估全模态模型多模态能力的基准MMI,测试五种模态及组合,发现前沿模型MPS得分低,LLM评分者与人工标注者判断一致性达70.8%。

Comments 26 pages, 6 figures. Code and dataset available

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10954 2026-08-28 cs.CV cs.AI 版本更新 82%

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tencent CDG(腾讯云与智慧产业事业群) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI;MLLM(comments)

AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。

Comments This submission is an iterative version of our previous work, **"AD^2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions"** ( arXiv:2506.09557 (https://arxiv.org/abs/2506.09557) ). We plan to consolidate the current submission with the earlier version into a unified manuscript. Therefore, we would like to withdraw this submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27010 2026-08-28 cs.AI 新提交 79%

A Multi-Modal AI Framework for Real-Time Queue Prediction, Management and Optimisation in Intelligent Border Control Systems

用于智能边检系统中实时队列预测、管理与优化的多模态AI框架

Varvara Mama, Eleni Veroni, Nikolaos Kapsalis, Christos D. Nikolopoulos, Anargyros T. Baklezos

机构 * Hellenic Mediterranean University(希腊地中海大学) National Technical University of Athens(雅典国立技术大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 本研究针对智能边检系统队列管理问题,提出多模态AI框架,结合LSTM、MPC等技术,经评估可降低预测误差与等待时间、提升吞吐量。

Comments 6 pages, 2 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26191 2026-08-28 cs.AI 新提交 79%

Structured Evidence Routing for Incident Risk Prediction from Multimodal Longitudinal EHRs

面向多模态纵向电子健康记录(EHR)的事件风险预测的结构化证据路由

Animesh Agarwal, Meysam Ghaffari, Nina Fatehi, Carlos Morato

机构 * Optum AI(奥普姆人工智能部门) UnitedHealth Group(联合健康集团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究针对多模态纵向EHR的事件风险预测难题,提出结构化证据路由方法,经5项1年期诊断任务验证,其AUROC达到现有基线水平、AUPRC具竞争力,还可提供患者特定证据轨迹。

Comments Accepted at the ICML 2026 Workshop on Structured Data for Health (SD4H), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21883 2026-08-28 cs.CV 版本更新 79%

VIG: Visual Information Gain as a Reward Signal for Multimodal Chain-of-Thought Compression

VIG:作为多模态思维链压缩奖励信号的视觉信息增益

Wen Luo, Xiaohan Yi, Xiaotao Huang, Liqun Huang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究提出VIG奖励机制,通过提升视觉信息密度优化多模态CoT的准确率与效率权衡,无需额外资源,在多类基准及不同规模模型上均有效。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17188 2026-08-28 cs.CV cs.CL 版本更新 73%

Not Truly Multilingual: Script Consistency as a Missing Dimension in VLM Evaluation

并非真正的多语言:脚本一致性作为VLM评估中缺失的维度

Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina, Rajvee Sheth

机构 * RediMinds Inc.(RediMinds公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Independent Researcher(独立研究员)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 提出PuMVR基准,评估10个VLM在旁遮普语三种文字上的表现,发现显著的脚本差距,并提出脚本一致性率(SCR)作为必要评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31597 2026-08-28 cs.CV 版本更新 70%

SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models

SOCO: 视觉基础模型中语义对象对应关系的基准测试

Olaf Dünkel, Basavaraj Sunagad, Haoran Wang, David T. Hoffmann, Christian Theobalt, Adam Kortylewski

机构 * Max Planck Institute for Informatics(马克斯·普朗克研究所信息学研究所) Saarland Informatics Campus(萨尔州信息学校园) CISPA Helmholtz Center for Information Security(信息安全霍夫曼中心) University of Freiburg(弗赖堡大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 提出SOCO基准,通过引入对应类型分类法和100个类别上超过100万对功能上有意义的关键点注释,系统评估视觉基础模型中的语义对应能力,并揭示模型在跨类别迁移、语言引导定位与视觉对应之间的差距。

Comments Project page: this https URL (https://genintel.github.io/SOCO/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27358 2026-08-28 cs.CL cs.AI 新提交 62%

RCMN: Understanding Misleadingness in Influential Public Discourse

RCMN:理解有影响力公共话语中的误导性

Peiling Yi

机构 * School of Computer Science and Mathematics(计算机科学与数学学院) Faculty of Engineering, Computing and the Environment(工程、计算与环境学院) Kingston University London(伦敦金斯顿大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对有影响力公共话语的误导性,提出以读者为中心的RCMN框架构建数据集,发现轻量表征可恢复读者解读但难识别误导机制,为可扩展误导性分析提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26950 2026-08-28 cs.AI cs.CL 新提交 62%

From Atomic to Agentic: Towards Interpretable Evaluation of LLMs' Agentic Mathematical Capabilities

从原子到智能体:迈向大语言模型智能体数学能力的可解释评估

Jiayi Kuang, Yinghui Li, Yunze Song, Keyu Chen, Zhifeng Shen, Yangning Li, Yidong Wang, Di Yin, Ruizhi Qiao, Xing Sun, Kai Jin, Ying Shen, Liang Lin, Philip S. Yu

机构 * Sun Yat-sen University(中山大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Pengcheng Laboratory(鹏城实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出过程级基准,对齐智能体行为与数学原子能力分类,评估LLMs智能体数学推理能力,发现相似端到端准确率的模型智能体能力轮廓差异显著,凸显过程级评估的重要性。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26921 2026-08-28 cs.CV cs.CL 新提交 62%

AraMS-28k: The Largest Publicly Released Line-Level Dataset of Historical Arabic Manuscripts with Margin and Insertion-Anchor Annotations

AraMS-28k:公开发布的最大规模带页边距和插入锚点标注的历史阿拉伯手稿行级数据集

Mohamed Guechaoui, Mohamed Diaa Zellagui, Souleyman Chaib, Sahraoui Dhelim

机构 * Higher School of Computer Science (ESI-SBA)(高等计算机科学学院(ESI-SBA))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 研究人员发布了最大规模带页边距和插入锚点标注的历史阿拉伯手稿行级数据集AraMS-28k,采用RefLAM流程构建,提供基线HTR结果,支持阿拉伯手稿相关研究。

Comments Data and code available at this https URL and this https URL. Dataset: this https URL (https://doi.org/10.5281/zenodo.22095333) Code: this https URL (https://github.com/ArchaText/AraMS-28k-Dataset)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26713 2026-08-28 cs.CV cs.AI 新提交 62%

AesCanvas: A Large-Scale Dataset and Benchmark for Aesthetic Critique and Contextual Suitability

AesCanvas:用于美学评论与情境适配性的大规模数据集和基准

Xuanwei Hu, Haoyu Dong, Kejun Wu, Tianyi Liu, Jianjun Gao

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对现有图像美学评估基准的不足,构建含两个互补组件的AesCanvas数据集与基准,评估不同类型MLLMs,发现评论生成与情境敏感判断存在差距,确立文化情境化适配性为美学建模新目标。

Comments 10 pages, 4 figures, 6 tables. Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26147 2026-08-28 cs.CL cs.CV 新提交 62%

CARE: Causally-Aligned Reasoning Exploration for Medical Large Language Models

CARE:面向医学大语言模型的因果对齐推理探索

Yucheng Zhou, Peng Luo, Qianning Wang, Chengzhong Xu, Jianbing Shen

机构 * University of Macau(澳门大学) Auckland University of Technology(奥克兰理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本研究针对医学大语言模型的推理缺陷,提出CARE框架,通过因果充分性与近端可学习性条件筛选训练经验,在医学基准上提升了推理一致性与训练稳定性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27110 2026-08-28 cs.CL 新提交 57%

DocTalkBN: A Novel Dataset of Expert Telemedicine Conversations in Bengali

DocTalkBN:孟加拉语专家远程医疗对话的新型数据集

Anik Saha, Fahmida Sultana Naznin, Sadatul Islam Sadi, Ananya Shahrin Promi, Wahid Al Azad Navid, Rifat Shahriyar

机构 * Bangladesh University of Engineering and Technology (BUET)(孟加拉工程技术大学(BUET))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 该研究针对低资源语言孟加拉语医疗对话数据稀缺问题,构建了DocTalkBN多模态数据集,含大量真实远程医疗对话数据,并设置三项下游任务进行基准测试,为医疗NLP研究提供实用资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26596 2026-08-28 cs.CL 新提交 57%

Not Just Reason, Not Just Scan: Reinforcement Learning for Proactive Scientific Error Verification over Academic Paper

不仅是推理,不仅是扫描:面向学术论文的主动科学错误验证强化学习

Rongjin Li, Yuanxin Liu, Hao Zhou, Fandong Meng, Jie Zhou, Xu Sun

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) WeChat AI, Tencent Inc.(腾讯微信人工智能部门)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 针对现有无预设问题/证据的学术论文科学错误验证研究不足的问题,提出VERA-RL强化学习框架,构建VERA-13K数据集,训练Qwen3-VL-8B后其可验证推理能力接近旗舰级多模态大语言模型。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26500 2026-08-28 cs.CV cs.LG 新提交 57%

Systematic Literature Review of Machine Learning Models and Applications for Text Recognition

面向文本识别的机器学习模型及应用的系统文献综述

Nuzhat Khan, Ab Al-Hadi Ab Rahman, Shahriyar Masud Rizvi, Ibrahim Yousef Alshareef, Muhammad Nadzir Marsono, Muhammad Paend Bakht, Mohd Shahrizal Rusli, Shahidatul Sadiah

机构 * Faculty of Electrical Engineering, Universiti Teknologi Malaysia(马来西亚工艺大学电气工程学院) Faculty of Artificial Intelligence, Universiti Teknologi Malaysia(马来西亚工艺大学人工智能学院) Department of Electrical and Electronic Engineering, American International University-Bangladesh(孟加拉国美国国际大学电气与电子工程系) Department of Electrical Engineering, Balochistan University of Information Technology, Engineering and Management Sciences(巴基斯坦俾路支省信息技术、工程与管理科学大学电气工程系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本研究基于PRISMA指南,通过分析2015-2025年97项研究,系统综述面向文本识别的机器学习模型及应用,梳理其演进、挑战并提出优化建议,为OCR领域研究提供基础。

Comments Published in IEEE Access, 2025. 24 pages, 16 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26222 2026-08-28 cs.LG cs.AI cs.CR cs.SE 新提交 57%

NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation

NeuronFuzz:面向大语言模型安全评估的安全神经元引导模糊测试

Zhiyuan Xu, Muhammad Firhard Roslan, Joseph Gardiner, Sana Belguith, Lichao Wu

机构 * University of Bristol(布里斯托尔大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 NeuronFuzz是一种安全神经元引导的LLM安全评估白盒模糊测试框架,通过利用安全神经元激活值生成反馈,在21个模型上实现了高越狱发现率和零样本迁移能力,性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26144 2026-08-28 cs.CL 新提交 57%

Why Current XAI Is Not Enough for Arabic NLP: A Critical Survey of the Explainability Gap

为何当前可解释人工智能(XAI)对于阿拉伯语自然语言处理(NLP)而言仍不足:可解释性差距的批判性综述

Salima Lamsiyah, Ruslan Mitkov

机构 * University of Luxembourg(卢森堡大学) University of Alicante(阿利坎特大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 该研究通过批判性综述指出当前阿拉伯语NLP的XAI存在方法、任务、语言学三方面差距,提出涵盖多维度的分类体系并给出基于语言学的阿拉伯语XAI研究议程。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12588 2026-08-28 cs.LG cs.CL 版本更新 57%

Plain Transformers Can be Powerful Graph Learners

原始变换器可以成为强大的图学习者

Liheng Ma, Soumyasundar Pal, Yingxue Zhang, Philip H.S. Torr, Mark Coates

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) Huawei Noah’s Ark Lab, Montreal(华为诺亚实验室,蒙特利尔) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本研究证明原始变换器可通过简单修改成为强大图学习者,提出PPGT架构在图学习任务中表现优异。

Comments TMLR - 2026/06 this https URL (https://openreview.net/pdf?id=bEmDvP0fdv)

详情

展开后加载摘要…

URL PDF HTML 收藏