arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-14 至 2026-01-14 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 10 篇

2601.08509 2026-01-14 cs.AI cs.CL 81%

What If TSF: A Benchmark for Reframing Forecasting as Scenario-Guided Multimodal Forecasting

如果TSF:一个用于将预测重新框架化为基于场景的多模态预测的基准

Jinkwan Jang, Hyunbin Jin, Hyungjin Park, Kyubyung Chae, Taesup Kim

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 What If TSF是一个用于评估模型是否能根据上下文文本,特别是未来场景,进行多模态预测的基准。

Comments 30 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21503 2026-01-14 cs.AI cs.CV 81%

MoHoBench: Assessing Honesty of Multimodal Large Language Models via Unanswerable Visual Questions

MoHoBench: 通过无法回答的视觉问题评估多模态大语言模型的诚实性

Yanxu Zhu, Shitong Duan, Xiangxu Zhang, Jitao Sang, Peng Zhang, Tun Lu, Xiao Zhou, Jing Yao, Xiaoyuan Yi, Xing Xie

机构 * Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Renmin University of China(中国人民大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MoHoBench通过评估多模态大语言模型在面对无法回答的视觉问题时的诚实行为,揭示其诚实性受视觉信息影响,提出改进方法以提升模型可信度。

Comments AAAI2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08292 2026-01-14 cs.CV 79%

KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?

KidVis: 多模态大语言模型是否具备六岁儿童的视觉感知能力?

Xianfeng Wang, Kaiwei Zhang, Qi Jia, Zijian Chen, Guangtao Zhai, Xiongkuo Min

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 KidVis研究通过对比人类儿童与多模态大语言模型在视觉能力上的表现,揭示了当前模型在基础视觉感知上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21495 2026-01-14 cs.RO 78%

CLAMP: Crowdsourcing a LArge-scale in-the-wild haptic dataset with an open-source device for Multimodal robot Perception

CLAMP:通过开源设备收集大规模真实场景触觉数据集以实现多模态机器人感知

Pranav N. Thakkar, Shubhangi Sinha, Karan Baijal, Yuhan, Bian, Leah Lackey, Ben Dodson, Heisen Kong, Jueun Kwon, Amber Li, Yifei Hu, Alexios Rekoutis, Tom Silver, Tapomayukh Bhattacharjee

机构 * Cornell University(康奈尔大学) Horace Mann School(霍拉曼学校)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 CLAMP通过开源设备收集大规模真实场景触觉数据集,训练多模态触觉编码器,实现材料识别和机器人操作任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08440 2026-01-14 cs.CV 70%

Incentivizing Cardiologist-Like Reasoning in MLLMs for Interpretable Echocardiographic Diagnosis

激励MLLMs实现类似心内科医生的推理以实现可解释的超声心动图诊断

Yi Qin, Lehan Wang, Chenxu Zhao, Alex P. W. Lee, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出CRT和CardiacMind,通过引入心内科医生的思维模式,提升MLLMs在超声心动图诊断中的推理能力,实现48%的诊断性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08748 2026-01-14 cs.CV cs.AI 62%

UR-Bench: A Benchmark for Multi-Hop Reasoning over Ultra-High-Resolution Images

UR-Bench:面向超高清图像的多跳推理基准

Siqi Li, Xinyu Cai, Jianbiao Mei, Nianchen Deng, Pinlong Cai, Licheng Wen, Yufan Shen, Xuemeng Yang, Botian Shi, Yong Liu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 UR-Bench是一个针对超高清图像多跳推理的基准,通过引入代理框架和语义工具,评估大语言模型在极端视觉信息下的推理能力。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02333 2026-01-14 cs.CL cs.AI cs.SI 62%

Human Mobility Datasets Enriched With Contextual and Social Dimensions

具有上下文和社会维度的人类移动数据集

Chiara Pugliese, Francesco Lettich, Guido Rocchietti, Chiara Renso, Fabio Pinelli

机构 * IIT-CNR(意大利理工学院-克雷莫纳国家研究委员会) ISTI-CNR(意大利信息科学研究所-克雷莫纳国家研究委员会) IMT Lucca(利卡大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出两个结合语义丰富和社交媒体数据的人类移动数据集,用于多模态移动分析与知识图谱构建。

Comments 5 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24253 2026-01-14 cs.CL 57%

MRAG-Suite: A Diagnostic Evaluation Platform for Visual Retrieval-Augmented Generation

MRAG-Suite:一个用于视觉检索增强生成的诊断评估平台

Yuelyu Ji, Wuwei Lan, Patrick NG

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 MRAG-Suite通过引入难度和歧义过滤策略及诊断工具MM-RAGChecker,系统评估视觉检索增强生成的性能与常见幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12180 2026-01-14 eess.SP cs.LG 50%

A Sensing Dataset Protocol for Benchmarking and Multi-Task Wireless Sensing

用于基准测试和多任务无线传感的传感数据集协议

Jiawei Huang, Di Zhang, Yuanhao Cui, Xiaowen Cao, Tony Xiao Han, Xiaojun Jing, Christos Masouros

机构 * School of Information and Communication Engineering, Beijing University of Posts and Telecommunications(信息与通信工程学院,北京邮电大学) College of Electronics and Information Engineering, Shenzhen University(电子与信息工程学院,深圳大学) Huawei Technology Co. Ltd.(华为技术有限公司) Department of Electronic and Electrical Engineering, University College London(电子与电气工程系,伦敦大学学院)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出SDP协议,通过统一数据块模式和任务无关表示,提升无线传感的基准测试和多任务处理能力。

Comments 6 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20862 2026-01-14 cs.LG 50%

Bi-cephalic self-attended model to classify Parkinson's disease patients with freezing of gait

双头自注意力模型用于分类帕金森病患者冻结步态

Shomoita Jahid Mitin, Rodrigue Rizk, Maximilian Scherer, Thomas Koeglsperger, Daniel Lench, KC Santosh, Arun Singh

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本研究提出双头自注意力模型,通过结合EEG信号与描述性特征,实现对帕金森病患者冻结步态的高效分类。

Comments 39 pages, 9254 words, 4 figures, 4 tables, European Journal of Neuroscience: Special edition FOG

详情

展开后加载摘要…

URL PDF HTML 收藏