arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-08 至 2026-01-08 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9 篇

2601.03515 2026-01-08 cs.CL cs.AI 88%

Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents

Mem-Gallery: 多模态长时对话记忆的基准测试用于 MLLM 代理

Yuanchen Bei, Tianxin Wei, Xuying Ning, Yanjun Zhao, Zhining Liu, Xiao Lin, Yada Zhu, Hendrik Hamann, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM沃森人工智能实验室,IBM研究) Stony Brook University(石溪大学) Brookhaven National Laboratory(布鲁赫斯国家实验室)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(title,abstract);分类 cs.CL、cs.AI

AI总结 Mem-Gallery 是一个用于评估多模态长时对话记忆的基准测试,通过多会话对话数据集和系统评估框架,揭示了记忆提取、推理和知识管理的关键发现。

Comments 34 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03434 2026-01-08 cs.LG 78%

VNU-Bench: A Benchmarking Dataset for Multi-Source Multimodal News Video Understanding

VNU-Bench:多源多模态新闻视频理解的基准数据集

Zibo Liu, Muyang Li, Zhe Jiang, Shigang Chen

机构 * University of Florida(佛罗里达大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 VNU-Bench是首个多源多模态新闻视频理解基准数据集,通过设计新颖问题类型和混合生成方法,评估模型跨源信息整合能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03587 2026-01-08 cs.CR cs.AI cs.DB 74%

Deontic Knowledge Graphs for Privacy Compliance in Multimodal Disaster Data Sharing

德性知识图谱用于多模态灾难数据共享中的隐私合规

Kelvin Uzoma Echenim, Karuna Pande Joshi

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 本文提出基于德性知识图谱的框架,用于多模态灾难数据共享中的隐私合规,通过整合灾难管理知识图谱和政策知识图谱,实现更灵活的访问控制和合规验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03733 2026-01-08 cs.CV cs.AI cs.CL cs.CY cs.LG 67%

RadDiff: Describing Differences in Radiology Image Sets with Natural Language

RadDiff:用自然语言描述放射学图像集的差异

Xiaoxian Shen, Yuhui Zhang, Sahithi Ankireddy, Xiaohan Wang, Maya Varma, Henry Guo, Curtis Langlotz, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 RadDiff通过多模态代理系统实现放射学图像集差异的自然语言描述,结合医学知识和多模态推理,在放射学研究配对中取得高准确率,推动临床影像分析的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03594 2026-01-08 cs.CR 67%

Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense

突破大语言模型与视觉语言模型:机制、评估与统一防御

Zejian Chen, Chaozhuo Li, Chao Li, Xi Zhang, Litian Zhang, Yiming He

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 本文提出三维框架系统回顾大语言模型和视觉语言模型的突破攻击与防御机制,提出统一防御原则并讨论未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17394 2026-01-08 cs.CL cs.CV cs.CY 62%

Are Vision Language Models Cross-Cultural Theory of Mind Reasoners?

视觉语言模型是否是跨文化理论思维推理者?

Zabir Al Nazi, GM Shahariar, Md. Abrar Hossain, Wei Peng

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV、cs.CL

AI总结 本文提出CulturalToM-VQA基准测试集,评估视觉语言模型在跨文化理论思维推理中的表现,发现前沿模型在准确性上显著提升,但存在假信念推理和区域差异等局限,揭示模型的社会可取性偏差问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00947 2026-01-08 cs.CL cs.AI 62%

Table as a Modality for Large Language Models

表格作为大语言模型的一种模态

Liyao Li, Chao Ye, Wentao Ye, Yifei Sun, Zhe Jiang, Haobo Wang, Jiaming Tian, Yiming Zhang, Ningtao Wang, Xing Fu, Gang Chen, Junbo Zhao

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) University of Michigan(密歇根大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 TAMO通过将表格视为独立模态,结合文本令牌,提升大语言模型对表格数据的推理能力。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20617 2026-01-08 cs.CV 57%

SpatialTree: How Spatial Abilities Branch Out in MLLMs

SpatialTree: MLLMs中空间能力如何分支扩展

Yuxi Xiao, Longfei Li, Shen Yan, Xinhang Liu, Sida Peng, Yunchao Wei, Xiaowei Zhou, Bingyi Kang

机构 * Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 SpatialTree提出了一种受认知科学启发的分层结构,用于评估和提升多模态大语言模型中的空间能力。

Comments webpage: https://spatialtree.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01217 2026-01-08 eess.IV cs.CV 57%

Learn2Reg 2024: New Benchmark Datasets Driving Progress on New Challenges

Learn2Reg 2024:新基准数据集推动新挑战的进步

Lasse Hansen, Wiebke Heyer, Christoph Großbröhmer, Frederic Madesta, Thilo Sentker, Wang Jiazheng, Yuxi Zhang, Hang Zhang, Min Liu, Junyi Wang, Xi Zhu, Yuhua Li, Liwen Wang, Daniil Morozov, Nazim Haouchine, Joel Honkamaa, Pekka Marttinen, Yichao Zhou, Zuopeng Tan, Zhuoyuan Wang, Yi Wang, Hongchao Zhou, Shunbo Hu, Yi Zhang, Qian Tao, Lukas Förner, Thomas Wendler, Bailiang Jian, Christian Wachinger, Jin Kim, Dan Ruan, Marek Wodzinski, Henning Müller, Tony C. W. Mok, Xi Jia, Jinming Duan, Mikael Brudfors, Seyed-Ahmad Ahmadi, Yunzheng Zhu, William Hsu, Tina Kapur, William M. Wells, Alexandra Golby, Aaron Carass, Harrison Bai, Yihao Liu, Perrine Paul-Gilloteaux, Joakim Lindblad, Nataša Sladoje, Andreas Walter, Junyu Chen, Reuben Dorent, Alessa Hering, Mattias P. Heinrich

机构 * EchoScout GmbH Institute of Medical Informatics(医学信息学研究所) Institute of Applied Medical Informatics(应用医学信息学研究所) Institute of Computational Neuroscience(计算神经科学研究所) School of Artificial Intelligence and Robotics(人工智能与机器人学院) Cornell University(康奈尔大学) University of Electronic Science and Technology of China(电子科技大学) Mechanical Engineering Department(机械工程系) Harvard Medical School(哈佛医学院) Technical University of Munich(慕尼黑技术大学) Aalto University(阿德莱德大学) Canon Medical Systems (China) Co., Ltd.(佳能医疗系统(中国)有限公司) Smart Medical Imaging, Learning and Engineering (SMLE) Lab(智能医学影像、学习和工程实验室) School of Information Science and Engineering(信息科学与工程学院) Department of Imaging Physics(影像物理系) Clinical Computational Medical Imaging Research(临床计算医学成像研究) TUM Klinikum Rechts der Isar(慕尼黑工业大学医院) University of California(加州大学) AGH University of Krakow(克拉科夫应用科学大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 Learn2Reg 2024通过引入新任务和数据集,推动医学图像配准领域在模态多样性和任务复杂性方面的进展。

Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2025:034

Journal ref Machine.Learning.for.Biomedical.Imaging. 3 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏