arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-27 至 2026-08-27 共收录 18 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 18 篇

2608.24934 2026-08-27 cs.CV cs.AI 新提交 89%

Fusing Perceptual Vision Experts with Multimodal Large Language Models for Explainable Plant Disease Diagnosis: From Benchmark Imagery to Real-World Robotic Field Validation

融合感知视觉专家与多模态大语言模型的可解释植物病害诊断:从基准图像到真实世界机器人现场验证

Ranjan Sapkota, Konstantinos I. Roumeliotis, Pengyao Xie, Nikolaos D. Tselikas, Lirong Xiang, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of the Peloponnese(伯罗奔尼撒大学) Agricultural University of Athens(雅典农业大学)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究提出H²MAF框架,结合EfficientNet-B3、ConvNeXt-Tiny与Gemma、Qwen等MLLM,在PlantDoc及Cornell机器人田间数据集上实现高准确率可解释植物病害诊断,验证了MLLM仲裁的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03890 2026-08-27 cs.CV 版本更新 87%

OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs

OVO-S-Bench:多模态大语言模型中流式空间智能的分层基准

Yifei Li, Pengyiang Liu, Yuhang Zang, Zhongyue Shi, Qi Fu, Hongye Hao, Jiwen Lu

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 提出OVO-S-Bench,一个完全人工标注的流式空间智能基准,包含1680个问题,涵盖四个抽象层次,评估38个MLLM,发现Gemini-3.1-Pro落后人类专家27分,流式空间微调MLLM表现不如其骨干模型。

Comments Accepted to EMNLP 2026 Main Conference. 55 pages, 12 figures, 20 tables. Project page: this https URL (https://internlm.github.io/OVO-S-Bench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25490 2026-08-27 cs.CR cs.AI cs.MM 新提交 84%

MMJailBench: A Factorized Benchmark for Disentangling Multimodal Jailbreak Vulnerabilities

MMJailBench:用于解耦多模态越狱漏洞的因子化基准

Tianshi Wang, Jingsong Wang, Yafei Huang, Fengling Li, Xin Li, Lei Zhu

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 研究人员推出MMJailBench因子化基准,对16个MLLMs评估后揭示其越狱漏洞特征异质且依赖模型,明确提示框架等关键影响因素,开发出模块化多模态越狱评估套件用于高效审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25520 2026-08-27 cs.CV 新提交 83%

Asymmetric Cross-Modal Fine-Grained Visual Categorization: ACF-Net and the BirdPro Benchmark

非对称跨模态细粒度视觉分类:ACF-Net与BirdPro基准

Bohan Deng, Shuo Ye, Zitong Yu

机构 * Great Bay University(大湾区大学)

专题命中 多模态评测 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV

AI总结 针对非对称跨模态细粒度视觉分类的挑战,提出ACF-Net框架并构建BirdPro基准,实验显示其在融合与不匹配设置中均优于基线方法。

Comments Accepted by the 9th Chinese Conference on Pattern Recognition and Computer Vision (PRCV 2026). 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25367 2026-08-27 cs.CV 新提交 83%

RSFusionDet: Underwater RGB-Sonar Multimodal Object Detection

RSFusionDet:水下RGB-声呐多模态目标检测

Zhuoyan Liu, Yihan Wang, Bo Wang, Bing Wang, Ye Li

机构 * Harbin Engineering University(哈尔滨工程大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对水下单模态目标检测的传感器成像缺陷,本文构建RSFusion数据集并提出RSFusionDet模型,通过CAFusion模块与OMHead、OMLoss实现跨模态特征融合与目标匹配,在RSFusion数据集上性能优于基线模型DINO。

Comments 18 pages, 13 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22084 2026-08-27 cs.CV 版本更新 83%

MObyGaze: a film dataset of multimodal objectification densely annotated by experts

MObyGaze:由专家密集标注的多模态客体化电影数据集

Julie Tores, Elisa Ancarani, Lucile Sassatelli, Hui-Yin Wu, Clement Bergman, Lea Andolfi, Victor Ecrement, Remy Sun, Frederic Precioso, Thierry Devars, Magali Guaresi, Virginie Julliard, Sarah Lecossais

机构 * Université Côte d’Azur, CNRS, I3S, France(法国里沃利大学、法国国家科学研究中心、I3S研究所) Université Côte d’Azur, CNRS, Inria, I3S, France(法国里沃利大学、法国国家科学研究中心、法国国家科学研究院、I3S研究所) Institut Universitaire de France(法国大学研究院) Université Côte d’Azur, Inria, France(法国里沃利大学、法国国家科学研究院、法国) Université Côte d’Azur, CNRS, BCL, France(法国里沃利大学、法国国家科学研究中心、BCL研究所) Sorbonne Université, GRIPIC(索邦大学、GRIPIC研究所) Université Sorbonne Paris Nord, LabSIC(巴黎-索邦大学北校区、LabSIC研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究引入新AI任务以量化电影中多模态客体化模式,构建含20部电影的MObyGaze数据集并完成标注,通过基准测试证明任务可行性,公开代码与数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25097 2026-08-27 cs.AI cs.MM math-ph 新提交 82%

PhysElite: How Far Are LLMs from Solving Olympiad-Level Physics Problems?

PhysElite:大型语言模型在解决奥林匹克级物理问题上的表现差距有多大?

Ruoran Xu, Wending Gao, Liyunfeng Chen, Aixin Shi, Haoyu Cheng, Zixiang Fang, Yiqiang Zou, Qiufeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出PhysElite基准,含11586道奥林匹克级物理题及配套资源,测试18款MLLM发现最强者准确率仅33.7%,还开展分步流程评估诊断推理失败环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25973 2026-08-27 cs.AI cs.LG 新提交 79%

SciMIF: Understanding Multimodal Instruction Following in Scientific Domains

SciMIF:理解科学领域中的多模态指令遵循

Ye Shen, Yuting Zheng, Dun Pei, Zijian Chen, Wenlong Zhang, Qi Jia, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出用于评估多模态大语言模型科学指令遵循能力的SciMIF基准,揭示模型在科学领域性能差异及规模提升未对应改善约束遵循等问题,填补相关评估空白。

Comments 21pages, 9 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25398 2026-08-27 cs.CL 新提交 79%

OmniPhys: A Unified Multimodal Benchmark for Physics Understanding and Generation from Chinese Educational Corpora

OmniPhys:面向中文教育语料库的物理理解与生成统一多模态基准

Hao Chen, Yumin Lin, Nadila Yushanjiang, Xin Lin, Min Zhang

机构 * East China Normal University(华东师范大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 研究人员推出OmniPhys这一覆盖中文教育语料库中中学至大学物理问题的大规模多模态基准,含15246个问题与19850张图像,可评估MLLMs的物理理解、推理及结构化图表生成能力,发现当前模型存在复杂推理与视觉生成差距,将推进物理领域多模态智能发展。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24910 2026-08-27 cs.HC cs.AI 新提交 79%

From Plots to Words: Model-Aware Multimodal Explanations as a Foundation for Accessible, Non-Visual Interaction

从图表到文本:模型感知的多模态解释作为可访问非视觉交互的基础

Nur Keleşoğlu, Łukasz Sobczak, Joanna Domańska

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究提出多智能体框架,将时间序列预测的视觉输出转为模型感知文本解释,可提升非视觉交互的可访问性,其可解释配置使解释质量最高提升32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07445 2026-08-27 cs.AI 版本更新 79%

StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley

StarDojo:基于Stardew Valley的多模态大语言模型在生产-生活模拟中的开放性行为基准测试

Weihao Tan, Changjiu Jiang, Yu Duan, Mingcong Lei, Jiageng Li, Yitian Hong, Xinrun Wang, Bo An

机构 * Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China University of Science and Technology(华东理工大学) Singapore Management University(新加坡管理大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 StarDojo通过Stardew Valley模拟评估多模态大语言模型在生产与社交活动中的综合能力,包含1000个任务,发现GPT-4.1在视觉理解与多模态推理方面存在显著不足。

Comments Accepted by ECCV 2026. Project website: this https URL (https://weihaotan.github.io/StarDojo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25316 2026-08-27 cs.HC 新提交 78%

AVI-Personality: A Trait-Activated Multimodal Dataset for Personality and Competency Assessment in Asynchronous Video Interviews

AVI-Personality:用于异步视频面试中人格与能力评估的特质激活多模态数据集

Tianyi Zhang, Jinwenxi Shang, Antonis Koutsoumpis, Yuan Zong, Reinout E. de Vries, Wenming Zheng

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出AVI-Personality数据集,包含646名参与者的3876段异步视频面试,经多维度验证,可用于开发评估人格与能力的AI模型,多模态方法性能最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25126 2026-08-27 cs.LG 新提交 78%

Multimodal Injury Risk Prediction in Tennis

网球中的多模态损伤风险预测

Francisco Erramuspe Alvarez, Shobharani Polasa, Weihao Qu, Jay Wang, Ling Zheng

机构 * Monmouth University(蒙茅斯大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出多模态网球运动员准备度预测框架PART,整合多源数据,可评估网球运动员健康、损伤风险等,在大学生网球运动员数据上表现良好,也适用于业余选手。

Comments 7 pages, 2 figures, 5 tables. Published in the 2025 IEEE 5th International Conference on Human-Machine Systems (ICHMS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24903 2026-08-27 cs.HC cs.LG 新提交 78%

Evidence-Grounded Mapping of Multimodal Human Sensing Psychological Transdiagnostic Dimensions

基于证据的多模态人体感知心理跨诊断维度映射

Xiyun Hu, Xiangyuan Xue, Yuting Lyu, Hanya Shao, Jingping Nie

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本研究提出临床医生参与的基准,评估LLMs能否从多模态证据生成B-HiTOP条目画像,发现两阶段预测可提升部分证据的兼容性,但语义抽象会成为间接行为传感的信息瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24931 2026-08-27 eess.IV cs.AI cs.CV cs.LG 新提交 62%

Modality Contribution Score - A Per-Patient Framework for Quantifying the Relative Diagnostic Contribution of Structural MRI and Amyloid PET in Alzheimer's Disease

模态贡献分数——一种用于量化阿尔茨海默病中结构MRI与淀粉样PET相对诊断贡献的患者专属框架

Dawa Chyophel Lepcha, Aaliya Ali, Sophie A. Martin, Deepika Koundal, Pierrick Coupe, Shabbir Syed-Abdul

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出患者专属框架MCNet与MCS,量化AD中结构MRI与淀粉样PET的相对诊断贡献,在ADNI-3与OASIS-3队列中验证了其分期性能、单调梯度及跨队列泛化性,为痴呆护理可信AI奠定基础。

Comments 15 pages, 7 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25981 2026-08-27 cs.CV cs.AI cs.LG 新提交 62%

FRAME: separating sampling variation from representational cause in medical imaging fairness

FRAME:在医学影像公平性中分离采样变异与表征成因

Mahshad Lotfinia, Daniel Truhn, Andreas Maier, Soroosh Tayebi Arasteh

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡弗里德里希-亚历山大大学) RWTH Aachen University(亚琛工业大学) University Hospital RWTH Aachen(亚琛工业大学医院)

专题命中 多模态评测 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 FRAME是用于医学影像公平性审计的两步框架,可分离采样变异与表征成因,能解释部分性能差异,辅助区分需机制解释的差异与采样变异可解释的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01287 2026-08-27 cs.CV cs.AI 版本更新 62%

Beyond Visual Memory: Mechanistic Diagnostics of Latent Visual Reasoning

超越视觉记忆:潜在视觉推理的机制诊断

Jiawei Guo, Yu Chen, Xiang Wang, Shuai Li, Xinpei Zhao, Huaxing Liu, Shuai Dong, Feifei Zhai, Yu Zhou

机构 * Amap, Alibaba Group(阿里集团亚马通) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 通过分解潜在令牌为三个可测试组件,发现边界标记和格式而非潜在槽贡献了主要性能提升,揭示了潜在视觉推理的真正机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24940 2026-08-27 cs.LG cs.AI 新提交 57%

When Does Frequency Decomposition Benefit Physics-Informed Neural Networks? A Preliminary Ablation Study

频率分解何时有益于物理信息神经网络?一项初步消融研究

Shubham Rai

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出双分支频谱门控架构DBSG-PINN,通过消融实验发现频率分解仅在频谱复杂的物理信息神经网络基准问题上可显著降低误差,在平滑问题上益处有限。

详情

展开后加载摘要…

URL PDF HTML 收藏