arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-26 至 2026-02-26 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 10 篇

2602.21854 2026-02-26 cs.CL 83%

FewMMBench: A Benchmark for Multimodal Few-Shot Learning

FewMMBench: 一种多模态少样本学习的基准测试

Mustafa Dogan, Ilker Kesen, Iacer Calixto, Aykut Erdem, Erkut Erdem

机构 * Aselsan Research(阿塞利桑研究)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CL

AI总结 FewMMBench是一个用于评估多模态少样本学习能力的基准测试,通过系统分析不同任务类型、模型家族和提示策略,揭示指令调优模型在零样本性能上的优势及CoT推理的局限性。

Comments Preprint. 49 pages, 38 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21225 2026-02-26 cs.CL cs.AI cs.LG 81%

Architecture-Agnostic Curriculum Learning for Document Understanding: Empirical Evidence from Text-Only and Multimodal

文档理解的架构无关课程学习:来自纯文本和多模态的实证证据

Mohammed Hamdan, Vincenzo Dentamaro, Giuseppe Pirlo, Mohamed Cheriet

机构 * 1 Synchromedia Laboratory, \' E cole de Technologie Sup\' e rieure (\' E TS), 1100 Notre-Dame St W, Montreal, QC H3C 1K3, Canada 2 Department of Computer Science, University of Bari Aldo Moro, Via Orabona 4, 70125 Bari, Italy

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究通过实验证明,渐进式数据调度在文档理解任务中能有效提升效率,尤其在容量受限模型中表现显著,但多模态模型因具备充足归纳偏置而未获明显收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06899 2026-02-26 cs.CL cs.AI 81%

RPTS: Tree-Structured Reasoning Process Scoring for Faithful Multimodal Evaluation

RPTS: 基于树结构的推理过程评分用于忠实多模态评估

Haofeng Wang, Yu Zhang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 RPTS提出了一种基于树结构的评分方法,用于评估多模态推理过程的忠实度,通过构建推理树和动态权重调整,揭示模型推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21941 2026-02-26 cs.CL 79%

MERRY: Semantically Decoupled Evaluation of Multimodal Emotional and Role Consistencies of Role-Playing Agents

MERRY: 多模态情感与角色一致性评估的语义解耦框架

Zhenyu Wang, Xiaofen Xing, Yirong Chen, Xiangmin Xu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 MERRY提出一种语义解耦的评估框架,用于评估多模态角色扮演代理的情感与角色一致性,通过改进的指标和双向证据寻找任务提升评估效果。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21686 2026-02-26 stat.ML cs.LG 78%

Multimodal Datasets with Controllable Mutual Information

具有可控互信息的多模态数据集

Raheem Karim Hashmani, Garrett W. Merz, Helen Qu, Mariel Pettee, Kyle Cranmer

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Flatiron Institute(Flatiron研究所)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出了一种生成具有可控互信息的多模态数据集的框架,用于评估互信息估计器和多模态自监督学习技术。

Comments 16 pages, 7 figures, 2 tables. Our code is publicly available at https://github.com/RKHashmani/MmMi-Datasets. Datasets generated based on Figure 1 can be found at https://huggingface.co/datasets/RKHashmani/mmmi-dag1-2modalities-cifar10

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22033 2026-02-26 cs.CV 70%

RT-RMOT: A Dataset and Framework for RGB-Thermal Referring Multi-Object Tracking

RT-RMOT:一种用于RGB-热成像参照多目标跟踪的数据集和框架

Yanqiu Yu, Zhifan Jin, Sijia Chen, Tongfei Chu, En Yu, Liman Liu, Wenbing Tao

机构 * Huazhong University of Science and Technology(华中科技大学) South-Central Minzu University(西南民族大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 RT-RMOT提出一种融合RGB和热成像特征的多目标跟踪框架,通过改进的RL策略优化提升全天候跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00043 2026-02-26 cs.CV cs.AI cs.CL 67%

VOILA: Evaluation of MLLMs For Perceptual Understanding and Analogical Reasoning

VOILA:对多模态大语言模型的感知理解与类比推理能力评估

Nilay Yilmaz, Maitreya Patel, Yiran Lawrence Luo, Tejas Gokhale, Chitta Baral, Suren Jayasuriya, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 VOILA通过类比映射方法评估多模态大语言模型的感知理解和抽象推理能力,发现其在图像间关系理解上存在不足,但通过多步提示策略可提升性能。

Comments Accepted at ICLR 2025. Code and data: https://github.com/nlylmz/Voila

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17115 2026-02-26 cs.CV cs.AI 62%

Measuring the Measurers: Quality Evaluation of Hallucination Benchmarks for Large Vision-Language Models

测量测量者:大型视觉-语言模型幻觉基准的品质评估

Bei Yan, Jie Zhang, Zheng Yuan, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, and also with University of Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院,以及中国科学院大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HQM框架评估幻觉基准质量,发现现有基准存在可靠性与有效性不足问题,并提出HQQ基准以提升评估效果,揭示LVLMs在幻觉问题上的严重缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21464 2026-02-26 eess.AS cs.CL 62%

iMiGUE-Speech: A Spontaneous Speech Dataset for Affective Analysis

iMiGUE-Speech:一种用于情感分析的自发语音数据集

Sofoklis Kakouros, Fang Kang, Haoyu Chen

机构 * Center for Machine Vision and Signal Analysis, University of Oulu, Finland(机器视觉与信号分析中心,奥卢大学,芬兰) Center for Machine Vision(机器视觉中心) Signal Analysis, University of Oulu, Finland(信号分析,奥卢大学,芬兰)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 iMiGUE-Speech是一种用于情感分析的自发语音数据集,通过增加语音转录和元数据,提供多模态资源以研究情绪和情感状态。

Comments Accepted to Speech Prosody 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21272 2026-02-26 stat.ML cs.LG stat.CO 50%

Counterdiabatic Hamiltonian Monte Carlo

反 diagonal 霍尔顿采样

Reuben Cohn-Gordon, Uroš Seljak, Dries Sels

机构 * University of California, Berkeley(加州大学伯克利分校) New York University(纽约大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 反 diagonal 霍尔顿采样通过引入学习的反 diagonal 项,提高多模问题的采样效率,适用于复杂分布的高效采样。

详情

展开后加载摘要…

URL PDF HTML 收藏