arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-15 至 2026-01-15 共收录 44 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 11 篇

2510.21518 2026-01-15 cs.CV cs.CL cs.LG 81%

Head Pursuit: Probing Attention Specialization in Multimodal Transformers

头部追踪:探究多模态转换器中的注意力专业化

Lorenzo Basile, Valentino Maiorca, Diego Doimo, Francesco Locatello, Alberto Cazzaniga

机构 * Area Science Park(面积科学公园) Sapienza University of Rome(罗马萨皮恩扎大学) Institute of Science and Technology(科学与技术研究所)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本研究通过分析多模态转换器中注意力头的专业化,揭示了模型内部可控的结构,并展示了通过编辑少量头部以增强或抑制特定概念的可行性。

Comments Accepted at NeurIPS 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09116 2026-01-15 cs.CV cs.AI 81%

LP-LLM: End-to-End Real-World Degraded License Plate Text Recognition via Large Multimodal Models

LP-LLM:基于大多模态模型的端到端真实世界退化车牌文本识别

Haoyan Gong, Hongbin Liu

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 LP-LLM通过端到端结构感知多模态推理框架,结合字符感知模块和LoRA微调策略,提升真实世界退化车牌文本识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06475 2026-01-15 cs.CL 79%

HapticLLaMA: A Multimodal Sensory Language Model for Haptic Captioning

HapticLLaMA:一种多模态感官语言模型用于触觉描述

Guimin Hu, Daniel Hershcovich, Hasti Seifi

机构 * University of Copenhagen(哥本哈根大学) Arizona State University(亚利桑那州立大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 HapticLLaMA是一种多模态感官语言模型,通过触觉信号生成描述,利用两种分词器和强化学习提升触觉感知描述能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08959 2026-01-15 cs.CR cs.SE 78%

Integrating APK Image and Text Data for Enhanced Threat Detection: A Multimodal Deep Learning Approach to Android Malware

整合APK图像和文本数据以增强威胁检测:一种多模态深度学习方法用于Android恶意软件

Md Mashrur Arifin, Maqsudur Rahman, Nasir U. Eisty

专题命中 图文多模态 :multimodal(title,abstract)

AI总结 本文提出一种多模态深度学习方法,通过整合APK图像和文本数据提升Android恶意软件检测效果,系统评估不同图像类型和分辨率,并利用CLIP模型增强分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04184 2026-01-15 cs.CV 70%

MedicalNarratives: Connecting Medical Vision and Language with Localized Narratives

MedicalNarratives: 通过局部化叙述连接医学视觉与语言

Wisdom O. Ikezogwo, Kevin Zhang, Mehmet Saygin Seyfioglu, Fatemeh Ghezloo, Linda Shapiro, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院) Amazon(亚马逊)

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 MedicalNarratives通过局部化鼠标轨迹连接医学视觉与语言,训练出的GenMedClip在12个医学领域均优于现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23311 2026-01-15 cs.CV cs.AI cs.CL 67%

Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning

识别符号,缺失文化:探究视觉-语言模型在火 imagery 和文化意义上的推理

Haorui Yu, Yang Zhao, Yijia Chu, Qiufeng Yi

机构 * Duncan of Jordanstone College of Art & Design (DJCAD), University of Dundee(邓迪大学邓迪艺术与设计学院(DJCAD)) Guangzhou Institute of Science and Technology (GZIST)(广州科学技术研究院) Faculty of Arts, Xiamen University(厦门大学艺术学院) University of Birmingham(伯明翰大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究发现视觉-语言模型在处理火主题文化图像时存在系统性偏见,需通过文化评估确保公平性和可解释性。

Comments 8 pages, 5 figures, 4 tables. Submitted to WiNLP 2025 Workshop at COLING 2025

Journal ref Proceedings of the 9th Widening NLP Workshop (WiNLP 2025), pages 1-8, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00040 2026-01-15 cs.CV cs.AI 62%

Uncovering Intrinsic Capabilities: A Paradigm for Data Curation in Vision-Language Models

揭示内在能力:一种用于视觉-语言模型数据整理的范式

Junjie Li, Ziao Wang, Jianghong Ma, Xiaofeng Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Hong Kong Baptist University, China(香港 Baptist大学) City University of Hong Kong, China(香港城市大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CADC通过揭示视觉-语言模型的内在能力,提供了一种基于能力分析的数据整理范式,以提升指令微调的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08871 2026-01-15 cs.SD cs.AI eess.AS 62%

Semantic visually-guided acoustic highlighting with large vision-language models

语义视觉引导的音频突出与大型视觉-语言模型

Junhua Huang, Chao Huang, Chenliang Xu

机构 * University of Rochester(罗切斯特大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出利用大型视觉-语言模型提取视觉-语义特征,以提升音频混音质量,发现摄像机焦点、语气和场景背景对感知混音质量提升最显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08860 2026-01-15 cs.CV cs.AI 62%

Bias Detection and Rotation-Robustness Mitigation in Vision-Language Models and Generative Image Models

视觉-语言模型和生成图像模型中的偏见检测与旋转鲁棒性缓解

Tarannum Mithila

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出旋转鲁棒缓解策略,通过数据增强、表征对齐和模型正则化,提升视觉-语言和生成图像模型在旋转和分布偏移下的鲁棒性和公平性。

Comments Preprint. This work is derived from the author's Master's research. Code and supplementary materials will be released separately

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09575 2026-01-15 cs.CV 57%

OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding

OpenVoxel: 一种无需训练的稀疏体素分组与标注算法用于开放词汇3D场景理解

Sheng-Yu Huang, Jaesung Choe, Yu-Chiang Frank Wang, Cheng Sun

机构 * NVIDIA National Taiwan University(国立台湾大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 OpenVoxel通过无需训练的多模态大语言模型实现稀疏体素的分组与标注,提升开放词汇3D场景理解的性能。

Comments project page: https://peterjohnsonhuang.github.io/openvoxel-pages/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23903 2026-01-15 cs.CV 57%

Scaling Remote Sensing Foundation Models: Data Domain Tradeoffs at the Peta-Scale

在百亿级数据规模下扩展遥感基础模型:在百亿级数据规模下的领域权衡

Charith Wickrema, Eliza Mace, Hunter Brown, Heidys Cabrera, Nick Krall, Matthew O'Neill, Shivangi Sarkar, Lowell Weissman, Eric Hughes, Guido Zarrella

机构 * The MITRE Corporation(MITRE公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究探讨了在百亿级数据规模下扩展遥感基础模型的挑战与权衡,通过训练更大规模的视觉Transformer主干,揭示了数据受限与模型参数受限之间的关系,并提出了优化数据收集和计算资源的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 5 篇

2601.08868 2026-01-15 cs.CV cs.AI cs.RO 90%

Residual Cross-Modal Fusion Networks for Audio-Visual Navigation

残差跨模态融合网络用于音频视觉导航

Yi Wang, Yinfeng Yu, Bin Ren

机构 * School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院) Joint International Research Laboratory of Silk Road Multilingual Cognitive(丝绸之路多语认知联合国际实验室) School of Mechatronic Engineering and Automation Shanghai University, Shanghai, China(上海大学机电工程与自动化学院)

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出残差跨模态融合网络,通过双向残差交互实现音频视觉信息互补建模,提升跨域导航性能。

Comments Main paper (10 pages). Accepted for publication by the 14th international conference on Computational Visual Media (CVM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09385 2026-01-15 cs.SD cs.CL cs.MM 84%

SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing

SLAM-LLM: 一种模块化、开源的多模态大语言模型框架及语音、语言、音频和音乐处理的最佳实践

Ziyang Ma, Guanrou Yang, Wenxi Chen, Zhifu Gao, Yexing Du, Xiquan Li, Zhisheng Zheng, Haina Zhu, Jianheng Zhuo, Zheshu Song, Ruiyang Xu, Tiranrui Wang, Yifan Yang, Yanqiao Zhu, Zhikang Niu, Liumeng Xue, Yinghao Ma, Ruibin Yuan, Shiliang Zhang, Kai Yu, Eng Siong Chng, Xie Chen

机构 * X-LANCE Lab, School of Computer Science, MoE Key Lab of Artificial Intelligence Shanghai Jiao Tong University(X-LANCE实验室,计算机科学学院,人工智能教育部重点实验室,上海交通大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Peng Cheng Laboratory(鹏城实验室) University of Texas at Austin(德克萨斯大学奥斯汀分校) Tianjin University(天津大学) Hong Kong University of Science and Technology(香港科学大学) Queen Mary University of London(伦敦玛丽女王大学) Nanyang Technological University(南洋理工大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.MM

AI总结 SLAM-LLM是一种开源多模态大语言模型框架,专注于语音、语言、音频和音乐处理,提供模块化配置和高性能检查点以加速研究开发。

Comments Published in IEEE Journal of Selected Topics in Signal Processing (JSTSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05699 2026-01-15 cs.CL 79%

Afri-MCQA: Multimodal Cultural Question Answering for African Languages

Afri-MCQA:面向非洲语言的多模态文化问答

Atnafu Lambebo Tonja, Srija Anand, Emilio Villa-Cueva, Israel Abebe Azime, Jesujoba Oluwadara Alabi, Muhidin A. Mohamed, Debela Desalegn Yadeta, Negasi Haile Abadi, Abigail Oppong, Nnaemeka Casmir Obiefuna, Idris Abdulmumin, Naome A Etori, Eric Peter Wairagala, Kanda Patrick Tshinu, Imanigirimbabazi Emmanuel, Gabofetswe Malema, Alham Fikri Aji, David Ifeoluwa Adelani, Thamar Solorio

机构 * MBZUAI AI4Bharat Indian Institute of Technology, Madras(印度理工学院马德拉斯分校) Saarland University(萨尔兰大学) Aston University(阿斯顿大学) Addis Ababa University(亚的斯亚贝巴大学) Lesan AI Friedrich-Alexander University(弗里德里希-亚历山大大学) University of Pretoria(比勒陀利亚大学) University of Minneosta -Twin Cities(明尼苏达大学-双城分校) Lelapa AI Tshwane University of Technology(茨瓦内技术大学) Digital Umuganda University of Botswana(博茨瓦纳大学) Mila, McGill University & Canada CIFAR AI Chair(Mila,麦吉尔大学及加拿大CIFAR人工智能主席)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 Afri-MCQA是首个针对非洲语言的多模态文化问答基准,揭示了本地语言在语音和文本任务中与英语的显著性能差距,强调了文化扎根预训练和跨语言文化转移的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07808 2026-01-15 cs.RO 78%

AcoustoBots: A swarm of robots for acoustophoretic multimodal interactions

AcoustoBots:用于声学电势多模交互的机器人群

Narsimlu Kemsaram, James Hardwick, Jincheng Wang, Bonot Gautam, Ceylan Besevli, Giorgos Christopoulos, Sourabh Dogra, Lei Gao, Akin Delibasi, Diego Martinez Plasencia, Orestis Georgiou, Marianna Obrist, Ryuji Hirayama, Sriram Subramanian

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 AcoustoBots通过可移动相位阵列和BeadDispenserBot实现声学电势多模交互,提升机器人群的灵活性和交互能力。

Journal ref Frontiers in Robotics and AI, 12:1537101, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13433 2026-01-15 cs.SD eess.AS 57%

MATS: An Audio Language Model under Text-only Supervision

MATS: 一种基于纯文本监督的音频语言模型

Wen Wang, Ruibing Hou, Hong Chang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, China(中国科学院智能信息处理重点实验室(中国科学院)) University of Chinese Academy of Sciences, China(中国科学院大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 MATS通过纯文本监督训练,实现音频理解能力,无需依赖音频数据,展现出与大规模音频-语言对训练模型相当的性能。

Comments Accepted by ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 5 篇

2601.09430 2026-01-15 cs.CV 57%

Video-MSR: Benchmarking Multi-hop Spatial Reasoning Capabilities of MLLMs

Video-MSR: 多跳空间推理能力的MLLMs基准测试

Rui Zhu, Xin Shen, Shuchen Wu, Chenxi Miao, Xin Yu, Yang Li, Weikang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanjing University(南京大学) The University of Queensland(昆士兰大学) Peking University(北京大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Video-MSR通过四个任务评估MLLMs的多跳空间推理能力,发现模型在复杂推理中存在显著不足,并通过微调提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09350 2026-01-15 cs.CV 57%

See More, Store Less: Memory-Efficient Resolution for Video Moment Retrieval

看清更多,存储更少:视频时刻检索的内存高效解决方案

Mingyu Jeon, Sungjin Han, Jinkwon Hwang, Minchol Kwon, Jonghee Kim, Junyeong Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学) Electronics and Telecommunications Research Institute (ETRI)(电子与电信研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 SMORE通过查询引导的描述和自适应压缩技术,在视频时刻检索中实现高信息分辨率与内存效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09031 2026-01-15 cs.RO cs.AI 57%

Generalizable Geometric Prior and Recurrent Spiking Feature Learning for Humanoid Robot Manipulation

可推广的几何先验与递归脉冲特征学习用于双足机器人操作

Xuetao Li, Wenke Huang, Mang Ye, Jifeng Xuan, Bo Du, Sheng Liu, Miao Li

机构 * School of Computer Science, School of Robotics, Institute of Technological Sciences, Wuhan University(计算机学院、机器人学院、技术科学研究院、武汉大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出RGMP-S方法,通过几何先验和递归脉冲网络提升双足机器人操作的泛化能力与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08587 2026-01-15 cs.CV 57%

MoCha:End-to-End Video Character Replacement without Structural Guidance

MoCha:端到端视频人物替换无需结构引导

Zhengbo Xu, Jie Ma, Ziheng Wang, Zhan Peng, Jun Liang, Jing Li

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 MoCha提出了一种无需结构引导的端到端视频人物替换方法,通过单帧掩码实现高效替换,并设计了三种数据集以克服数据稀缺问题。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07235 2026-01-15 cs.IT math.IT 50%

Sentiment Analysis on Movie Reviews: A Deep Dive into Modern Techniques and Open Challenges

对电影评论的情感分析:深入探讨现代技术和开放挑战

Agnivo Gosai, Shuvodeep De, Karun Thankachan, Ramadan A. ZeinEldin, Ali W. Mohamed, Seyed J. Mousavirad

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文综述了电影评论情感分析的现代技术和挑战,涵盖从传统方法到深度学习模型的发展,并探讨了多模态分析、可解释性及未来研究方向。

Comments 31 Pages; 1 figure; 108 references; paper under review in APIN

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 4 篇

2601.09606 2026-01-15 cs.CV 79%

GRCF: Two-Stage Groupwise Ranking and Calibration Framework for Multimodal Sentiment Analysis

GRCF: 用于多模态情感分析的两阶段组内排序与校准框架

Manning Gao, Leheng Zhang, Shiqin Han, Haifeng Hu, Yuncheng Jiang, Sijie Mai

机构 * South China Normal University(华南师范大学) Sun Yat-sen University(中山大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 GRCF通过两阶段组内排序与校准框架,解决多模态情感分析中点对点回归的不足,提升预测稳定性和相关性对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10337 2026-01-15 cs.AI cs.LG 79%

A Curriculum Learning Approach to Reinforcement Learning: Leveraging RAG for Multimodal Question Answering

一种基于RAG的强化学习课程学习方法:用于多模态问答

Chenliang Zhang, Lin Wang, Yuanyuan Lu, Yusheng Qi, Kexin Wang, Peixu Hou, Wenshi Chen

机构 * Meituan(美团)

专题命中 跨模态检索 :multimodal(title);multi-modal(abstract);分类 cs.AI

AI总结 本文提出了一种结合课程学习与强化学习的方法,用于多模态问答任务,通过检索增强生成系统在挑战中取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09278 2026-01-15 cs.AI 79%

M$^3$Searcher: Modular Multimodal Information Seeking Agency with Retrieval-Oriented Reasoning

M$^3$Searcher: 模块化多模态信息检索代理与检索导向推理

Xiaohan Yu, Chao Feng, Lang Mei, Chong Chen

机构 * Huawei Cloud BU(华为云业务单元)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 M$^3$Searcher是一种模块化多模态信息检索代理,通过检索导向的多目标奖励机制,提升多模态任务中的事实准确性、推理合理性和检索忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06389 2026-01-15 cs.IR 50%

FastLane: Efficient Routed Systems for Late-Interaction Retrieval

FastLane: 高效的路由系统用于晚期交互检索

Ramnath Kumar, Prateek Jain, Cho-Jui Hsieh

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 FastLane通过动态路由机制显著降低计算复杂度,实现高效且可扩展的检索,适用于大规模应用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 3 篇

2601.09255 2026-01-15 cs.CV 57%

PhyRPR: Training-Free Physics-Constrained Video Generation

PhyRPR: 无训练物理约束视频生成

Yibo Zhao, Hengjia Li, Xiaofei He, Boxi Wu

机构 * State Key Lab of CAD\&CG, Zhejiang University(CAD与CG国家重点实验室,浙江大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 PhyRPR提出一种无训练的三阶段视频生成方法,通过解耦物理理解和视觉合成,提升生成视频的物理合理性和运动可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08954 2026-01-15 cs.HC 56%

Leveraging learning analytics to enhance immersive teacher simulations: Challenges and opportunities

利用学习分析增强沉浸式教师模拟:挑战与机遇

Sumin Hong, Jewoong Moon, Taeyeon Eom, Juno Hwang, Jibeom Seo

专题命中 多模态生成 :multimodal(abstract,comments)

AI总结 本研究探讨如何利用学习分析增强沉浸式教师模拟,分析其在教师专业发展中的挑战与机遇。

Comments 30 pages, 10 figures. This chapter examines immersive teacher simulations and multimodal analytics. Project website: https://teachergenai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09163 2026-01-15 cs.RO 50%

CEI: A Unified Interface for Cross-Embodiment Visuomotor Policy Learning in 3D Space

CEI:一种用于3D空间跨身体视觉运动策略学习的统一接口

Tong Wu, Shoujie Li, Junhao Gong, Changqing Guo, Xingting Li, Shilong Mu, Wenbo Ding

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 CEI提出了一种跨身体视觉运动策略学习框架,通过功能相似性量化和梯度优化实现不同机械臂和末端执行器间的演示转移,实验显示在模拟和现实任务中均取得高转移效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 8 篇

2511.11134 2026-01-15 cs.AI 83%

GGBench: A Geometric Generative Reasoning Benchmark for Unified Multimodal Models

GGBench: 一种用于统一多模态模型的几何生成推理基准

Jingxuan Wei, Caijun Jia, Xi Bai, Xinglong Xu, Siyuan Li, Linzhuang Sun, Bihui Yu, Conghui He, Lijun Wu, Cheng Tan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 GGBench通过几何构造评估统一多模态模型的生成推理能力,推动智能系统发展。

Comments 35 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08183 2026-01-15 cs.CV cs.AI 81%

GI-Bench: A Panoramic Benchmark Revealing the Knowledge-Experience Dissociation of Multimodal Large Language Models in Gastrointestinal Endoscopy Against Clinical Standards

GI-Bench: 一个全景基准测试,揭示多模态大语言模型在内窥镜检查中与临床标准相比的知识-经验脱节

Yan Zhu, Te Luo, Pei-Yao Fu, Zhen Zhang, Zi-Long Wang, Yi-Fan Qu, Zi-Han Geng, Jia-Qi Xu, Lu Yao, Li-Yun Ma, Wei Su, Wei-Feng Chen, Quan-Lin Li, Shuo Wang, Ping-Hong Zhou

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 GI-Bench通过评估多模态大语言模型在胃肠内窥镜中的性能,揭示其在诊断推理和空间定位方面的不足,发现模型在语言流畅度上优于人类,但事实准确性较低。

Comments 45 pages, 17 figures, 6 tables. Leaderboard available at: https://roterdl.github.io/GIBench/ . Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏