arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-12 至 2026-02-12 共收录 17 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 17 篇

2602.10886 2026-02-12 cs.CL cs.AI cs.CE 81%

The CLEF-2026 FinMMEval Lab: Multilingual and Multimodal Evaluation of Financial AI Systems

CLEF-2026金融多语言多模态评估实验室:金融AI系统的多语言多模态评估框架

Zhuohan Xie, Rania Elbadry, Fan Zhang, Georgi Georgiev, Xueqing Peng, Lingfei Qian, Jimin Huang, Dimitar Dimitrov, Vanshikaa Jani, Yuyang Dai, Jiahui Geng, Yuxia Wang, Ivan Koychev, Veselin Stoyanov, Preslav Nakov

机构 * MBZUAI The University of Tokyo(东京大学) The Fin AI(Fin AI) University of Arizona(亚利桑那大学) INSAIT

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 CLEF-2026金融多语言多模态评估实验室提出首个多语言多模态金融AI评估框架,涵盖金融理解、推理和决策三个任务,旨在推动全球包容的金融AI发展。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10799 2026-02-12 cs.CV cs.AI 81%

RSHallu: Dual-Mode Hallucination Evaluation for Remote-Sensing Multimodal Large Language Models with Domain-Tailored Mitigation

RSHallu: 远程传感多模态大语言模型的双模式幻觉评估与领域定制缓解

Zihui Zhou, Yong Feng, Yanying Chen, Guofan Duan, Zhenxi Song, Mingliang Zhou, Weijia Jia

机构 * College of Computer Science, Chongqing University(重庆大学计算机科学学院) Heavy Rainfall Research Center of China(中国强降水研究中心) CMA Key Open Laboratory of Transforming Climate Resources to Economy, Chongqing Institute of Meteorological Sciences(中国气象局气候资源转化经济重点开放实验室、重庆气象科学研究院) Chongqing Metropolitan College of Science(重庆科学理工学院) School of Intelligence Science(智能科学学院) College of Artificial Intelligence, Harbin Institute of Technology(人工智能学院、哈尔滨工业大学) BNU-UIC Institute of Artificial Intelligence(北京师范大学-国际学院人工智能与未来网络研究院) Future Networks, Beijing Normal University at Zhuhai(未来网络、北京师范大学珠海分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 RSHallu通过双模式检查和领域定制数据集,提升遥感多模态大语言模型的幻觉缓解效果,提高无幻觉率21.63个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09210 2026-02-12 cs.CV cs.AI 81%

MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models

MME-Emotion:多模态大语言模型情感智能的综合评估基准

Fan Zhang, Zebang Cheng, Chong Deng, Haoxuan Li, Zheng Lian, Qian Chen, Huadai Liu, Wen Wang, Yi-Fan Zhang, Renrui Zhang, Ziyu Guo, Zhihong Zhu, Hao Wu, Haixin Wang, Yefeng Zheng, Xiaojiang Peng, Xian Wu, Kun Wang, Xiangang Li, Jieping Ye, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Tongyi Lab(通义实验室) SZTU(深圳技术大学) Peking University(北京大学) Tongji University(同济大学) CASIA(中国科学院自动化所) Tencent(腾讯) UCLA(加州大学洛杉矶分校) Westlake University(西湖大学) NTU(国立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MME-Emotion是首个评估多模态大语言模型情感智能的综合基准,揭示当前模型在情感识别和推理上的不足,并通过多智能体框架提供混合指标分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11124 2026-02-12 cs.CV 79%

PhyCritic: Multimodal Critic Models for Physical AI

PhyCritic:面向物理AI的多模态批评模型

Tianyi Xiong, Shihao Wang, Guilin Liu, Yi Dong, Ming Li, Heng Huang, Jan Kautz, Zhiding Yu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 PhyCritic通过双阶段RLVR流程优化,提升物理AI任务中的感知和推理能力,实现对物理任务的高效评估和改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11847 2026-02-12 cs.IR cs.AI cs.CY 79%

A Multimodal Manufacturing Safety Chatbot: Knowledge Base Design, Benchmark Development, and Evaluation of Multiple RAG Approaches

多模态制造安全聊天机器人:知识库设计、基准开发及多种RAG方法的评估

Ryan Singh, Austin Hamilton, Amanda White, Michael Wise, Ibrahim Yousif, Arthur Carvalho, Zhe Shan, Reza Abrisham Baf, Mohammad Mayyas, Lora A. Cavuoto, Fadel M. Megahed

机构 * Farmer School of Business, Miami University(Miami大学农业商学院) Department of Computer Science and Software Engineering, Miami University(Miami大学计算机科学与软件工程系) Department of Engineering Technology, Miami University(Miami大学工程技术系) Department of Mechanical and Manufacturing Engineering, Miami University(Miami大学机械与制造工程系) Department of Industrial and Systems Engineering, University at Buffalo(University at Buffalo工业与系统工程系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种多模态制造安全聊天机器人,通过RAG方法实现高准确率、低延迟和低成本的安全培训,展示了其在工业5.0环境中的应用价值。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17667 2026-02-12 cs.AI 79%

PhysUniBench: A Multi-Modal Physics Reasoning Benchmark at Undergraduate Level

PhysUniBench: 一个面向本科生层面的多模态物理推理基准测试

Lintao Wang, Encheng Su, Jiaqi Liu, Pengze Li, Jiabei Xiao, Wenlong Zhang, Xinnan Dai, Xi Chen, Yuan Meng, Lei Bai, Wanli Ouyang, Shixiang Tang, Aoran Wang, Xinzhu Ma

机构 * The University of Sydney(悉尼大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Michigan State University(密歇根州立大学) Tsinghua University(清华大学) Beihang University(北航大学)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 PhysUniBench是一个面向本科生层面的多模态物理推理基准测试,旨在评估和提升多模态大语言模型在物理问题上的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03220 2026-02-12 eess.SP 78%

Multimodal-Wireless: A Large-Scale Dataset for Sensing and Communication

多模态无线:一种大规模数据集用于传感与通信

Tianhao Mao, Le Liang, Jie Yang, Hao Ye, Shi Jin, Geoffrey Ye Li

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出多模态无线数据集,用于多模态传感与通信研究,包含高分辨率CSI与多种传感器数据,支持通信与协同感知应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16471 2026-02-12 cs.CV 70%

Order from Chaos: Physical World Understanding from Glitchy Gameplay Videos

秩序从混沌:从 glitchy 游戏视频中理解物理世界

Meng Cao, Haoran Tang, Haoze Zhao, Mingfei Han, Ruyang Liu, Qiang Sun, Xiaojun Chang, Ian Reid, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Peking University(北京大学) University of Toronto(多伦多大学) Sun Yat-sen University(孙中山大学)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文提出 PhysGame 数据集和 GameBench 基准,通过利用游戏视频中的 glitch 异常,提升物理推理能力,实验显示在多个基准上取得显著提升。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15933 2026-02-12 cs.CV 70%

City Navigation in the Wild: Exploring Emergent Navigation from Web-Scale Knowledge in MLLMs

城市真实环境中的导航:探索从大规模知识中涌现的导航

Dwip Dalal, Utkarsh Mishra, Narendra Ahuja, Nebojsa Jojic

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出稀疏关联视觉导航任务,通过CityNav基准评估MLLMs在真实城市环境中的导航能力,并提出VoP方法提升导航性能。

Comments Accepted at EACL 2026 (ORAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11144 2026-02-12 cs.LG cs.AI cs.CV 62%

GENIUS: Generative Fluid Intelligence Evaluation Suite

GENIUS:生成性流体智能评估套件

Ruichuan An, Sihan Yang, Ziyu Guo, Wei Dai, Zijun Shen, Haodong Li, Renrui Zhang, Xinyu Wei, Guopeng Li, Wenshan Wu, Wentao Zhang

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 GENIUS通过评估生成性流体智能,揭示模型在动态推理和上下文适应上的不足,并提出无需训练的注意力干预策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10675 2026-02-12 cs.CV cs.AI 62%

TwiFF (Think With Future Frames): A Large-Scale Dataset for Dynamic Visual Reasoning

TwiFF (Think With Future Frames): 一个大规模动态视觉推理数据集

Junhua Liu, Zhangcheng Wang, Zhike Han, Ningli Wang, Guotao Liang, Kun Kuang

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院) School of Computer and Computing Science, Hangzhou City University, Hangzhou, China(杭州市城市大学计算机与计算科学学院) Henan Academy of Innovations in Medical Science (AIMS), Zhengzhou, China(河南省医学创新研究院) School of Software, Beihang University, Beijing, China(北京航空航天大学软件学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 TwiFF提出一个大规模动态视觉推理数据集及模型,通过整合视频生成与图像理解能力,提升动态场景下的视觉问答性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10575 2026-02-12 cs.CV cs.AI cs.CY 62%

MetaphorStar: Image Metaphor Understanding and Reasoning with End-to-End Visual Reinforcement Learning

MetaphorStar: 基于端到端视觉强化学习的图像隐喻理解与推理

Chenhao Zhang, Yazhe Niu, Hongsheng Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong MMLab(香港中文大学MMLab)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MetaphorStar通过端到端视觉强化学习框架提升图像隐喻理解与推理能力,显著优于现有模型。

Comments 14 pages, 4 figures, 11 tables; Code: https://github.com/MING-ZCH/MetaphorStar, Model & Dataset: https://huggingface.co/collections/MING-ZCH/metaphorstar

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.11496 2026-02-12 eess.IV cs.CV 57%

MITI: SLAM Benchmark for Laparoscopic Surgery

MITI:腹腔手术的SLAM基准测试

Regine Hartwig, Daniel Ostler, Jean-Claude Rosenthal, Hubertus Feußner, Dirk Wilhelm, Dirk Wollherr

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 MITI基准测试提供了一套用于评估微创手术中SLAM算法性能的高质量数据集,包含多模态传感器信息和校准数据,旨在推动视觉-惯性算法的发展。

Comments This submission is withdrawn because it is a duplicate of "Constrained Visual-Inertial Localization With Application And Benchmark in Laparoscopic Surgery" (arXiv:2202.11075). The withdrawn version contains less complete information. Readers are directed to the full version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10518 2026-02-12 cs.CV 57%

MapVerse: A Benchmark for Geospatial Question Answering on Diverse Real-World Maps

MapVerse:一个用于在多样化真实世界地图上进行地理问答的基准测试

Sharat Bhat, Harshita Khandelwal, Tushar Kataria, Vivek Gupta

机构 * University of Southern California(南加州大学) University of California Los Angeles(加州大学洛杉矶分校) University of Utah(犹他大学) Arizona State University(亚利桑那州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 MapVerse是一个基于真实世界地图的大规模基准测试,用于评估地理问答任务中的多模态推理能力,揭示了当前VLMs在复杂空间推理任务上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19899 2026-02-12 cs.CV 57%

VeriSciQA: An Auto-Verified Dataset for Scientific Visual Question Answering

VeriSciQA:一个用于科学视觉问答的自动验证数据集

Yuyi Li, Daoyuan Chen, Zhen Wang, Yutong Lu, Yaliang Li

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 VeriSciQA通过跨模态验证框架生成并验证高质量科学视觉问答数据集,显著提升开源模型在科学图表问答任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10529 2026-02-12 cs.CY 50%

Drawing Your Programs: Exploring the Applications of Visual-Prompting with GenAI for Teaching and Assessment

绘制你的程序:探索视觉提示与生成式AI在教学与评估中的应用

David H. Smith, S. Moonwara A. Monisha, Annapurna Vadaparty, Leo Porter, Daniel Zingaro

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文探讨利用视觉提示与生成式AI在编程教学与评估中的应用,通过学生构建的分解图提示GPT-4.1生成代码,展示多模态提示在编程教育中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10407 2026-02-12 cs.HC cs.LG 50%

Towards Affordable, Non-Invasive Real-Time Hypoglycemia Detection Using Wearable Sensor Signals

迈向低成本、非侵入式实时低血糖检测的可穿戴传感器信号

Lawrence Obiuwevwi, Krzysztof J. Rechowicz, Vikas Ashok, Sampath Jayarathna

机构 * Department of Computer Science, Old Dominion University, Norfolk, VA, USA(计算机科学系,旧 Dominion 大学) Virginia Digital Maritime Center (VDMC), Old Dominion University, Norfolk, VA, USA(弗吉尼亚数字水路中心(VDMC),旧 Dominion 大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究提出了一种多模态深度学习方法,利用可穿戴传感器信号实现低成本、非侵入式实时低血糖检测,通过融合皮肤电反应和心率信号提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏