arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-13 至 2026-02-13 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 11 篇

2510.23276 2026-02-13 cs.CL 83%

A Cocktail-Party Benchmark: Multi-Modal dataset and Comparative Evaluation Results

宴会派对基准:多模态数据集和比较评估结果

Thai-Binh Nguyen, Katerina Zmolikova, Pingchuan Ma, Ngoc Quan Pham, Christian Fuegen, Alexander Waibel

机构 * Karlsruhe Institute of Technology, Germany(卡尔斯鲁厄理工学院) Carnegie Mellon University, USA(卡内基梅隆大学) Interactive-AI LLC(Interactive-AI公司) Meta AI, UK(Meta AI)

专题命中 多模态评测 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.CL

AI总结 本文提出多模态上下文感知识别任务,通过结合音频和视觉线索提升重叠对话识别性能,展示多模态在解决宴会派对问题中的关键作用。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12196 2026-02-13 cs.CL cs.AI 81%

Visual Reasoning Benchmark: Evaluating Multimodal LLMs on Classroom-Authentic Visual Problems from Primary Education

视觉推理基准:评估多模态大语言模型在小学课堂真实视觉问题上的能力

Mohamed Huti, Alasdair Mackintosh, Amy Waldock, Dominic Andrews, Maxime Lelièvre, Moritz Boos, Tobias Murray, Paul Atherton, Robin A. A. Ince, Oliver G. B. Garrod

机构 * Fab AI

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出视觉推理基准,用于评估多模态大语言模型在小学课堂真实视觉问题上的能力,揭示模型在静态与动态任务上的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11340 2026-02-13 cs.AI 79%

Bi-Level Prompt Optimization for Multimodal LLM-as-a-Judge

双层提示优化用于多模态LLM作为裁判

Bo Pan, Xuan Kan, Kaitai Zhang, Yan Yan, Shunwen Tan, Zihao He, Zixin Ding, Junjie Wu, Liang Zhao

机构 * Meta AI Emory University(埃默里大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出BLPO框架,通过双层优化提升多模态LLM在评估AI生成图像时的提示效果,解决上下文限制导致的优化瓶颈问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12087 2026-02-13 cs.LG 78%

Geometry of Uncertainty: Learning Metric Spaces for Multimodal State Estimation in RL

不确定性几何:用于强化学习中多模态状态估计的度量空间学习

Alfredo Reichlin, Adriano Pacciarelli, Danica Kragic, Miguel Vasco

机构 * Division of Robotics, Perception, and Learning(机器人、感知与学习系) KTH Royal Institute of Technology(皇家理工学院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出了一种学习多模态状态估计的度量空间方法,通过自适应整合多种传感器模态,提升了RL任务中的鲁棒性和状态估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09523 2026-02-13 cs.CV 70%

Singpath-VL Technical Report

Singpath-VL 技术报告

Zhen Qiu, Kaiwen Xiao, Zhengwei Lu, Xiangyu Liu, Lei Zhao, Hao Zhang

机构 * LBP Singpath AI Lab(LBP Singpath人工智能实验室)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 Singpath-VL通过合成数据集和多阶段微调,提升宫颈细胞学中的细粒度形态感知与诊断分类能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12092 2026-02-13 cs.CL cs.AI cs.CR cs.CV 67%

DeepSight: An All-in-One LM Safety Toolkit

DeepSight: 一个全方位的大型模型安全工具包

Bo Zhang, Jiaxuan Guo, Lijun Li, Dongrui Liu, Sujin Chen, Guanxu Chen, Zhijie Zheng, Qihao Lin, Lewen Yan, Chen Qian, Yijin Zhou, Yuyao Wu, Shaoxiong Guo, Tianyi Du, Jingyi Yang, Xuhao Hu, Ziqi Miao, Xiaoya Lu, Jing Shao, Xia Hu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 DeepSight是一个开源工具包,旨在通过整合安全评估与诊断,提升大型模型的安全性与可解释性。

Comments Technical report, 29 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11678 2026-02-13 cs.AI cs.CV 62%

Beyond Pixels: Vector-to-Graph Transformation for Reliable Schematic Auditing

超越像素:用于可靠图示审计的向量到图转换

Chengwei Ma, Zhen Tian, Zhou Zhou, Zhixian Xu, Xiaowei Zhu, Xia Hua, Si Shi, F. Richard Yu

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(人工智能与数字经济广东实验室) Guangdong Power Grid Co., Ltd.(广东电网公司) Shanghai University(上海大学) Carleton University(卡尔顿大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出向量到图转换方法,通过将CAD图转换为属性图,提升工程图示审计的准确性,克服基于像素方法的局限性。

Comments 4 pages, 3 figures. Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10081 2026-02-13 cs.CL cs.AI 62%

Anagent For Enhancing Scientific Table & Figure Analysis

一个增强科学表格及图表分析的代理

Xuehang Guo, Zhiyong Lu, Tom Hope, Qingyun Wang

机构 * College of William \& Mary The Allen Institute for AI (AI2)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 Anagent通过多代理框架提升科学表格及图表分析的准确性和效率,实现显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07011 2026-02-13 cs.CV cs.AI eess.IV 62%

MAU-GPT: Enhancing Multi-type Industrial Anomaly Understanding via Anomaly-aware and Generalist Experts Adaptation

MAU-GPT:通过异常感知和通用专家适应增强多类型工业异常理解

Zhuonan Wang, Zhenxuan Fan, Siwen Tan, Yu Zhong, Yuqian Yuan, Haoyuan Li, Hao Jiang, Wenqiao Zhang, Feifei Shao, Hongwei Wang, Jun Xiao

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MAU-GPT通过异常感知和通用专家适应机制,提升多类型工业异常理解的性能,实现更高效的质量控制。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06352 2026-02-13 cs.AI cs.HC 57%

Leveraging Generative AI for Human Understanding: Meta-Requirements and Design Principles for Explanatory AI as a new Paradigm

利用生成式AI实现人类理解:解释性AI作为新范式的核心要求与设计原则

Christian Meske, Justin Brenne, Erdi Uenal, Sabahat Oelcer, Ayseguel Doganguen

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出解释性AI作为新范式,通过生成式AI能力帮助人类理解和决策,定义五个核心维度和十条设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11018 2026-02-13 cs.NI eess.SP 50%

QoE-Driven Multi-Task Offloading for Semantic-Aware Edge Computing Systems

面向语义的多任务卸载:用于语义感知边缘计算系统的QoE驱动方法

Xuyang Chen, Daquan Feng, Wei Jiang, Qu Luo, Gaojie Chen, Yao Sun

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出语义感知的多任务卸载框架,通过优化资源分配提升边缘计算系统的用户体验。

Comments 18 pages, accepted by IEEE TNSE

详情

展开后加载摘要…

URL PDF HTML 收藏