arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-06 至 2026-02-06 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 10 篇

2602.05576 2026-02-06 cs.LG 82%

OpenMAG: A Comprehensive Benchmark for Multimodal-Attributed Graph

OpenMAG: 多模态属性图的综合基准

Chenxi Wan, Xunkai Li, Yilong Zuo, Haokun Deng, Sihan Li, Bowen Fan, Hongchao Qin, Ronghua Li, Guoren Wang

机构 * Department of Computer Science, Beijing Institute of Technology, Beijing, China(计算机科学系,北京理工大学,北京,中国)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

AI总结 OpenMAG是一个综合基准,通过整合多领域数据集和多种编码器,提供统一框架以评估多模态属性图学习的公平比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05496 2026-02-06 cs.MM cs.AI cs.CV 82%

XEmoGPT: An Explainable Multimodal Emotion Recognition Framework with Cue-Level Perception and Reasoning

XEmoGPT:一种具有线索级感知与推理的可解释多模态情感识别框架

Hanwen Zhang, Yao Liu, Peiyuan Jiang, Lang Junjie, Xie Jun, Yihui He, Yajiao Deng, Siyu Du, Qiao Liu

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) th Research Institute, China Electronics Technology Group Corporation(中国电子科技集团第五十四研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 XEmoGPT通过专门模块和大规模数据集提升多模态情感识别的可解释性和线索级推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05515 2026-02-06 cs.AI cs.CL 81%

A Unified Multimodal Framework for Dataset Construction and Model-Based Diagnosis of Ameloblastoma

一种统一的多模态框架用于数据集构建和基于模型的ameloblastoma诊断

Ajo Babu George, Anna Mariam John, Athul Anoop, Balu Bhasuran

机构 * DiceMed School of Sciences (SOS), Indira Gandhi National Open University(印度甘地国家开放大学科学学院) School of Information, Florida State University(佛罗里达州立大学信息学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种统一的多模态框架,用于构建ameloblastoma数据集并开发基于模型的诊断方法,通过多模态深度学习模型提高分类和手术规划的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19755 2026-02-06 cs.AI 79%

Can MLLMs generate human-like feedback in grading multimodal short answers?

大型语言模型能否在评估多模态简答时生成类人反馈?

Pritam Sil, Pushpak Bhattacharyya, Pawan Goyal, Ganesh Ramakrishnan

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文研究了多模态简答评分与反馈问题,通过生成数据集评估了四种多模态大语言模型,展示了其在正确性预测和图像相关性评估中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03208 2026-02-06 cs.LG 78%

HiMAL: A Multimodal Hierarchical Multi-task Auxiliary Learning framework for predicting and explaining Alzheimer disease progression

HiMAL:一种用于预测和解释阿尔茨海默病进展的多模态分层多任务辅助学习框架

Sayantan Kumar, Sean Yu, Andrew Michelson, Thomas Kannampallil, Philip Payne

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 HiMAL通过多模态分层多任务学习框架,预测和解释MCI患者向AD进展的风险,展现高预测性能和临床应用潜力。

Comments Currently under review in Journal of Medical Informatics Association (JAMIA). 6 figures, 3 tables

Journal ref JAMIA Open, Volume 7, Issue 3, October 2024, ooae087

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05590 2026-02-06 cs.CV cs.ET cs.GR 74%

EgoPoseVR: Spatiotemporal Multi-Modal Reasoning for Egocentric Full-Body Pose in Virtual Reality

EgoPoseVR:用于虚拟现实中的自体空间时间多模态推理以实现中心全身体姿

Haojie Cheng, Shaun Jing Heng Ong, Shaoyu Cai, Aiden Tat Yang Koh, Fuxi Ouyang, Eng Tat Khoo

机构 * National University of Singapore(新加坡国立大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

AI总结 EgoPoseVR通过融合头戴设备运动信息与中心RGB-D观测,实现了在虚拟现实中的准确全身姿态跟踪,提高了姿态估计的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05480 2026-02-06 cs.CV 70%

SOMA-1M: A Large-Scale SAR-Optical Multi-resolution Alignment Dataset for Multi-Task Remote Sensing

SOMA-1M: 一种大规模SAR-光学多分辨率对齐数据集用于多任务遥感

Peihao Wu, Yongxiang Yao, Yi Wan, Wenfei Zhang, Ruipeng Zhao, Jiayuan Li, Yongjun Zhang

机构 * School of Remote Sensing Information Engineering, Wuhan University(遥感信息工程学院,武汉大学) Hubei LuoJia Laboratory(湖北珞珈实验室) Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, Ministry of Natural Resources(粤港澳大湾区自然资源数据协同应用技术创新中心,自然资源部)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 SOMA-1M是首个大规模SAR-光学多分辨率对齐数据集,用于提升多任务遥感图像处理的性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05650 2026-02-06 cs.CV cs.AI cs.LG 62%

Enhancing Personality Recognition by Comparing the Predictive Power of Traits, Facets, and Nuances

通过比较特质、维度和细微差别预测能力来增强人格识别

Amir Ansari, Jana Subirana, Bruna Silva, Sergio Escalera, David Gallardo-Pujol, Cristina Palmero

机构 * King's College London(伦敦大学国王学院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过比较大五人格模型中更细粒度的维度和细微差别,利用Transformer模型提升音频视觉交互数据中的人格识别性能,显著降低预测误差。

Comments Accepted to the 2025 13th International Conference on Affective Computing and Intelligent Interaction (Late Breaking Results)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05382 2026-02-06 cs.CV cs.LG 57%

VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs

VRIQ:评估和分析视觉推理IQ的VLMs基准测试

Tina Khezresmaeilzadeh, Jike Zhong, Konstantinos Psounis

机构 * University of Southern California, Los Angeles, USA(美国南加州大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 VRIQ基准测试评估了VLMs的视觉推理能力,发现其在抽象推理任务中表现薄弱,主要源于感知限制,提出细粒度诊断方法以改进多模态系统中的视觉推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05051 2026-02-06 cs.LG cs.AI cs.RO 57%

ReFORM: Reflected Flows for On-support Offline RL via Noise Manipulation

ReFORM:通过噪声操控实现支持下的离线强化学习

Songyuan Zhang, Oswin So, H. M. Sabbir Ahmad, Eric Yang Yu, Matthew Cleaveland, Mitchell Black, Chuchu Fan

机构 * MIT(麻省理工学院) Boston University(波士顿大学) MIT Lincoln Laboratory(麻省理工学院林伍德实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 ReFORM通过反射流策略和噪声操控,在离线强化学习中实现更宽松的支持约束,从而在多模态分布下提升策略性能。

Comments 24 pages, 17 figures; Accepted by the fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏