arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9176 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9176 篇

2512.06589 2025-12-09 cs.CR cs.CV 79%

OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation

OmniSafeBench-MM:多模态 jailbreak 攻击-防御评估的统一基准和工具箱

Xiaojun Jia, Jie Liao, Qi Guo, Teng Ma, Simeng Qin, Ranjie Duan, Tianlin Li, Yihao Huang, Zhitao Zeng, Dongxian Wu, Yiming Li, Wenqi Ren, Xiaochun Cao, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学) BraneMatrix AI, China(BraneMatrix AI) Chongqing University, China(重庆大学) Xi’an Jiaotong University, China(西安交通大学) Northeastern University, China(东北大学) Sun Yat-sen University, China(中山大学) Alibaba, China(阿里巴巴) National University of Singapore, Singapore(新加坡国立大学) ByteDance, China(字节跳动)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 OmniSafeBench-MM提供一个多模态jailbreak攻击-防御评估的统一基准和工具箱,整合13种攻击方法、15种防御策略及广泛数据集,通过三维评估协议深入分析安全与效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05930 2025-12-08 cs.AI 79%

PRiSM: An Agentic Multimodal Benchmark for Scientific Reasoning via Python-Grounded Evaluation

PRiSM:一种基于Python基础评估的科学推理多模态基准

Shima Imani, Seungwhan Moon, Adel Ahmadyan, Lu Zhang, Kirmani Ahmed, Babak Damavandi

机构 * Meta Reality Lab(Meta现实实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 PRiSM通过基于Python代码的动态多模态基准,评估科学推理能力,揭示VLMs在科学领域中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02738 2025-12-08 cs.CV 79%

Open-PMC-18M: A High-Fidelity Large Scale Medical Dataset for Multimodal Representation Learning

Open-PMC-18M: 一种高保真大规模医学数据集用于多模态表示学习

Negin Baghbanzadeh, Mohammed Saidul Islam, Sajad Ashkezari, Elham Dolatabadi, Arash Afkanpour

机构 * Vector Institute(Vector研究所) York University(约克大学) University of Waterloo(滑铁卢大学)

专题命中 多模态评测 :multimodal(title);image-text(abstract);分类 cs.CV

AI总结 Open-PMC-18M通过高保真医学数据集提升多模态表示学习性能,实现子图提取与上下文丰富化,支持多种视觉-语言任务。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20454 2025-12-08 eess.IV cs.CV 79%

LymphAtlas- A Unified Multimodal Lymphoma Imaging Repository Delivering AI-Enhanced Diagnostic Insight

LymphAtlas- 一种统一的多模态淋巴瘤影像存储库,提供人工智能增强的诊断洞察

Jiajun Ding, Beiyao Zhu, Xiaosheng Liu, Lishen Zhang, Zhao Liu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 LymphAtlas通过整合PET与CT数据,构建高质量多模态数据集,提升淋巴瘤分割精度与临床应用价值。

Comments 12 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01424 2025-12-05 cs.CV 79%

ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language Models

ViRectify:一种用于多模态大语言模型视频推理纠错的挑战性基准

Xusen Hei, Jiali Chen, Jinyu Yang, Mengchen Zhao, Yi Cai

机构 * South China University of Technology(华南理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 ViRectify是一个用于评估多模态大语言模型视频推理纠错能力的挑战性基准,通过构建大规模数据集和提出轨迹证据驱动的纠正框架,验证了模型在纠错任务中的性能差异。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03000 2025-12-04 cs.CV 79%

DynamicVerse: A Physically-Aware Multimodal Framework for 4D World Modeling

DynamicVerse: 一种具有物理意识的多模态框架用于4D世界建模

Kairun Wen, Yuzhi Huang, Runyu Chen, Hui Zheng, Yunlong Lin, Panwang Pan, Chenxin Li, Wenyan Cong, Jian Zhang, Junbin Lu, Chenguo Lin, Dilin Wang, Zhicheng Yan, Hongyu Xu, Justin Theiss, Yue Huang, Xinghao Ding, Rakesh Ranjan, Zhiwen Fan

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 DynamicVerse提出了一种多模态框架,通过整合大规模视觉、几何和多模态模型,实现动态现实世界视频的4D世界建模,提升了对物理尺度测量的全局准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07850 2025-12-04 cs.AI 79%

GAMA: A Neural Neighborhood Search Method with Graph-aware Multi-modal Attention for Vehicle Routing Problem

GAMA:一种具有图感知多模态注意力的神经邻域搜索方法用于车辆路径问题

Xiangling Chen, Yi Mei, Mengjie Zhang

机构 * Centre for Data Science and Artificial Intelligence(数据科学与人工智能中心) School of Engineering and Computer Science(工程与计算机科学学院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 GAMA通过图感知多模态注意力机制和门控融合设计,提升车辆路径问题的神经邻域搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02699 2025-12-03 cs.AI 79%

Learning What to Attend First: Modality-Importance-Guided Reasoning for Reliable Multimodal Emotion Understanding

学习优先关注什么:模态重要性引导的推理用于可靠的多模态情感理解

Hyeongseop Rha, Jeong Hun Yeo, Junil Won, Se Jin Park, Yong Man Ro

机构 * Integrated Vision and Language Lab, KAIST, South Korea(韩国成均馆大学集成视觉与语言实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出MIGR框架,通过模态重要性引导推理,提升多模态情感理解的可靠性,实验表明能有效减少情感不一致的解释实例。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01519 2025-12-02 cs.CV cond-mat.mtrl-sci quant-ph 79%

QuantumCanvas: A Multimodal Benchmark for Visual Learning of Atomic Interactions

QuantumCanvas:一种用于原子相互作用视觉学习的多模态基准

Can Polat, Erchin Serpedin, Mustafa Kurban, Hasan Kurban

机构 * Texas A&M University(德克萨斯大学) Ankara University(安卡拉大学) Texas A&M University at Qatar(德克萨斯大学(卡塔尔)) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 QuantumCanvas通过多模态基准统一轨道物理与视觉表示学习,为学习可转移的量子相互作用提供了系统且可解释的基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23269 2025-12-01 cs.AI 79%

OctoMed: Data Recipes for State-of-the-Art Multimodal Medical Reasoning

OctoMed:面向尖端多模态医疗推理的数据配方

Timothy Ossowski, Sheng Zhang, Qianchu Liu, Guanghui Qin, Reuben Tan, Tristan Naumann, Junjie Hu, Hoifung Poon

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 OctoMed通过结构化推理轨迹的数据配方,提升医疗多模态推理模型的性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08303 2025-12-01 cs.CV 79%

Advancing Semantic Future Prediction through Multimodal Visual Sequence Transformers

通过多模态视觉序列变压器推进语义未来预测

Efstathios Karypidis, Ioannis Kakogeorgiou, Spyros Gidaris, Nikos Komodakis

机构 * Archimedes, Athena Research Center(阿基米德研究中心) National Technical University of Athens(希腊国家技术大学) University of Crete(克里特大学) IACM-Forth(第四研究机构(IACM-Forth))

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 FUTURIST通过多模态视觉序列变压器架构实现高效的多模态未来语义预测,提升预测精度并简化训练流程。

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11414 2025-12-01 cs.CL 79%

Fine-grained and Explainable Factuality Evaluation for Multimodal Summarization

细粒度且可解释的事实性评估用于多模态摘要

Yue Zhang, Jingxuan Zuo, Ke Su, Liqiang Jing

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出两种细粒度且可解释的评估框架,用于评估多模态摘要模型的事实性,适用于不同应用场景,并通过实验验证了其有效性。

Comments project link: https://github.com/for4WARD/FaithfulnessEvaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21422 2025-11-27 cs.CV 79%

E-M3RF: An Equivariant Multimodal 3D Re-assembly Framework

E-M3RF:一个等价多模态3D重装配框架

Adeela Islam, Stefano Fiorini, Manuel Lecha, Theodore Tsesmelis, Stuart James, Pietro Morerio, Alessio Del Bue

机构 * Fondazione Istituto Italiano di Tecnologia(意大利技术研究院) University of Genova(热那亚大学) Durham University(杜伦大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 E-M3RF通过多模态特征融合和SE(3)流匹配,有效提升3D碎片重装配的精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20701 2025-11-27 cs.AI cs.LG 79%

Cross Domain Evaluation of Multimodal Chain-of-Thought Reasoning of different datasets into the Amazon CoT Framework

跨领域评估不同数据集的多模态链式推理在Amazon CoT框架中的表现

Nitya Tiwari, Parv Maheshwari, Vidisha Agarwal

机构 * Indian Institute of Technology Bombay(印度理工学院孟买学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文评估了多模态链式推理在不同数据集上的表现,发现视觉整合减少幻觉但不同问题类型对推理有效性影响显著,为多模态推理系统改进提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19830 2025-11-26 cs.DB cs.AI 79%

Beyond Relational: Semantic-Aware Multi-Modal Analytics with LLM-Native Query Optimization

超越关系:基于语义的多模态分析与LLM原生查询优化

Junhao Zhu, Lu Chen, Xiangyu Ke, Ziquan Fang, Tianyi Li, Yunjun Gao, Christian S. Jensen

机构 * Zhejiang University(浙江大学) Aalborg University(奥胡斯大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 Nirvana通过结合可编程语义运算符和LLM原生查询优化,实现多模态数据分析,显著提升效率和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19667 2025-11-26 cs.CV 79%

OncoVision: Integrating Mammography and Clinical Data through Attention-Driven Multimodal AI for Enhanced Breast Cancer Diagnosis

OncoVision:通过注意力驱动的多模态AI整合乳腺X线和临床数据以提升乳腺癌诊断

Istiak Ahmed, Galib Ahmed, K. Shahriar Sanjid, Md. Tanzim Hossain, Md. Nishan Khan, Md. Misbah Khan, Md. Arifur Rahman, Sheikh Anisul Haque, Sharmin Akhtar Rupa, Mohammed Mejbahuddin Mia, Mahmud Hasan Mostofa Kamal, Md. Mostafa Kamal Sarker, M. Monir Uddin

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 OncoVision通过注意力驱动的多模态AI整合乳腺X线和临床数据,提升乳腺癌诊断的准确性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10068 2025-11-26 cs.CV 79%

Probabilistic Hyper-Graphs using Multiple Randomly Masked Autoencoders for Semi-supervised Multi-modal Multi-task Learning

基于多随机掩码自编码器的概率超图用于半监督多模态多任务学习

Pîrvu Mihai-Cristian, Marius Leordeanu

机构 * Faculty of Automatic Control and Computer Science, Politehnica University of Bucharest(自动化控制与计算机科学系,布加勒斯特理工大学) Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出PHG-MAE模型,结合神经图和掩码自编码器,通过随机掩码多模态数据提升多任务学习性能,并公开了相关工具和数据集。

Comments Submitted to Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18902 2025-11-25 cs.LG cs.AI 79%

VADE: Variance-Aware Dynamic Sampling via Online Sample-Level Difficulty Estimation for Multimodal RL

VADE:基于在线样本级难度估计的方差感知动态采样用于多模态强化学习

Zengjie Hu, Jiantao Qiu, Tianyi Bai, Haojin Yang, Binhang Yuan, Qi Jing, Conghui He, Wentao Zhang

机构 * Peking University(北京大学) Shanghai AI Lab(上海人工智能实验室) HKUST(香港科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 VADE通过在线样本级难度估计实现方差感知动态采样,提升多模态强化学习的性能与样本效率,减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18450 2025-11-25 cs.AI 79%

ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints

ORIGAMISPACE:基于数学约束的多模态大语言模型多步空间推理基准测试

Rui Xu, Dakuan Lu, Zicheng Zhao, Xiaoyu Tan, Xintao Wang, Siyu Yuan, Jiangjie Chen, Yinghui Xu

机构 * Fudan University(复旦大学) SII INF Technology(INF技术)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 ORIGAMISPACE通过折纸任务评估多模态大语言模型在多步空间推理和数学约束处理中的能力,提出四个评估任务并探索强化学习训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18399 2025-11-25 cs.CV 79%

ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering

ChineseVideoBench: 多模态大模型在中文视频问答中的基准测试

Yuxiang Nie, Han Wang, Yongjie Ye, Haiyang Yu, Weitao Jia, Tao Zeng, Hao Feng, Xiang Fei, Yang Li, Xiaohui Lv, Guozhi Tang, Jingqun Tang, Jinghui Lu, Zehui Dai, Jiacong Wang, Dingkang Yang, An-Lan Wang, Can Huang

机构 * Bytedance Inc.(字节跳动公司)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 ChineseVideoBench通过提供中文视频问答的基准测试,评估多模态大语言模型的性能,揭示了当前模型在复杂中文视频内容上的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18208 2025-11-25 cs.CV 79%

Large-Scale Pre-training Enables Multimodal AI Differentiation of Radiation Necrosis from Brain Metastasis Progression on Routine MRI

大规模预训练使多模态AI能够区分放射性坏死与脑转移瘤进展的常规MRI

Ahmed Gomaa, Annette Schwarz, Ludwig Singer, Arnd Dörfler, Matthias Stefan May, Pluvio Stephan, Ishita Sheth, Juliane Szkitsak, Katharina Breininger, Yixing Huang, Benjamin Frey, Oliver Schnell, Daniel Delev, Roland Coras, Daniel Höfler, Philipp Schubert, Jenny Stritzelberger, Sabine Semrau, Andreas Maier, Dieter H Heiland, Udo S. Gaipl, Andrea Wittig, Rainer Fietkau, Christoph Bert, Stefanie Corradini, Florian Putz

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究通过大规模预训练和多模态深度学习策略,利用常规MRI区分放射性坏死与肿瘤进展,实现高准确率的可解释AI解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17635 2025-11-25 cs.CV cs.LG 79%

Upstream Probabilistic Meta-Imputation for Multimodal Pediatric Pancreatitis Classification

上游概率元填补用于多模态儿童胰腺炎分类

Max A. Nelson, Elif Keles, Eminenur Sen Tasci, Merve Yazol, Halil Ertugrul Aktas, Ziliang Hong, Andrea Mia Bejar, Gorkem Durak, Oznur Leman Boyunaga, Ulas Bagci

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出UPMI方法,通过元特征空间中的概率元填补提升多模态儿童胰腺炎分类性能,实现AUC提升5%。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07852 2025-11-25 cs.AI 79%

FinMR: A Knowledge-Intensive Multimodal Benchmark for Advanced Financial Reasoning

FinMR:面向高级金融推理的知识密集型多模态基准

Shuangyan Deng, Haizhou Peng, Jiachen Xu, Rui Mao, Ciprian Doru Giurcăneanu, Jiamou Liu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 FinMR是一个面向高级金融推理的知识密集型多模态基准,通过精心设计的问题-答案对和多样化的金融主题,评估专业分析师级别的金融推理能力。

Comments The methodology section contains inaccuracies that may lead to misleading interpretations. The authors have withdrawn this version for correction

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17477 2025-11-24 cs.SD cs.AI 79%

Enhancing Quranic Learning: A Multimodal Deep Learning Approach for Arabic Phoneme Recognition

增强《古兰经》学习:一种多模态深度学习方法用于阿拉伯语音素识别

Ayhan Kucukmanisa, Derya Gelmez, Sukru Selim Calik, Zeynep Hilal Kilimci

机构 * Department of Electronics and Communication Engineering, Kocaeli University, 41001, Kocaeli, Turkey(电子与通信工程系,科拉尔大学) Department of Information Systems Engineering, Kocaeli University, 41001, Kocaeli, Turkey(信息系统工程系,科拉尔大学) Maviay Consultancy Company, Kocaeli University Technopark, 41275, Kocaeli, Turkey(Maviay咨询公司,科拉尔大学技术园区)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种基于变压器的多模态框架,结合声学和文本表示,用于阿拉伯语音素误发音检测,通过融合策略提升精度与鲁棒性。

Comments 11 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17106 2025-11-24 cs.CV 79%

ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better

ChainV: 原子视觉提示使多模态推理更短更优

Yuan Zhang, Ming Lu, Junwen Pan, Tao Huang, Kuan Cheng, Qi She, Shanghang Zhang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ByteDance Inc.(字节跳动公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 ChainV通过动态整合视觉提示,提升多模态推理的效率和准确性,尤其在数学密集型基准测试中表现突出。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15085 2025-11-20 cs.CV 79%

TiCAL:Typicality-Based Consistency-Aware Learning for Multimodal Emotion Recognition

Wen Yin, Siyu Zhan, Cencen Liu, Xin Hu, Guiduo Duan, Xiurui Xie, Yuan-Fang Li, Tao He

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07573 2025-11-20 cs.IR cs.CV 79%

A Hybrid Multimodal Deep Learning Framework for Intelligent Fashion Recommendation

Kamand Kalashi, Babak Teimourpour

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13530 2025-11-18 cs.RO cs.AI 79%

Towards Affect-Adaptive Human-Robot Interaction: A Protocol for Multimodal Dataset Collection on Social Anxiety

Vesna Poprcova, Iulia Lefter, Matthias Wieser, Martijn Warnier, Frances Brazier

机构 * Delft University of Technology(代尔夫特理工大学) Erasmus University Rotterdam(埃因霍温大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

Comments Accepted at the Workshop on Benefits of pErsonalization and behAvioral adaptation in assistive Robots (BEAR 2025), held at the IEEE RO-MAN Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13351 2025-11-18 cs.LG cs.AI 79%

Dual-LoRA and Quality-Enhanced Pseudo Replay for Multimodal Continual Food Learning

Xinlan Wu, Bin Zhu, Feng Han, Pengkun Jiao, Jingjing Chen

机构 * College of Computer Science and Artificial Intelligence, Fudan University, China(复旦大学计算机科学与人工智能学院) Singapore Management University, Singapore(新加坡国立管理学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05966 2025-11-18 cs.CV 79%

Commonality in Few: Few-Shot Multimodal Anomaly Detection via Hypergraph-Enhanced Memory

Yuxuan Lin, Hanjing Yan, Xuan Tong, Yang Chang, Huanzhen Wang, Ziheng Zhou, Shuyong Gao, Yan Wang, Wenqiang Zhang

机构 * AAAI Press(AAAI 压力)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏