IsoBench: Benchmarking Multimodal Foundation Models on Isomorphic Representations
专题命中 多模态评测 :multimodal(title);multimodal foundation model(title);分类 cs.CL、cs.AI
Comments 1st Conference on Language Modeling (COLM), 2024
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态评测 :multimodal(title);multimodal foundation model(title);分类 cs.CL、cs.AI
Comments 1st Conference on Language Modeling (COLM), 2024
揭示通用多模态嵌入中的视觉身份
机构 * Shanghai Jiao Tong University(上海交通大学) ; Alibaba Group(阿里巴巴集团)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 该研究针对通用多模态嵌入缺乏视觉身份判别能力的问题,提出视觉身份判别统一形式化,构建MVEB基准,设计身份感知采样的学习框架,提升了UMEs的身份判别能力。
Comments Accepted to CVPR 2026
Theia:用于无数据蒸馏的Incidents1M数据集的大规模多模态字幕生成与自动验证
机构 * Università Politecnica delle Marche(马尔凯理工大学)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本研究针对灾害领域多模态数据集的缺陷,提出方法构建并自动验证Incidents1M数据集,生成高保真字幕,其语义一致性达78.65/100,为跨模态知识蒸馏提供了可扩展框架。
ClinFusion:用于整体医学理解的以视觉为中心的多模态大语言模型系统
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Laboratory(湖畔实验室) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Department of Radiology, The Affiliated Yangming Hospital of Ningbo University(宁波大学附属阳明医院放射科) ; Zhejiang University-University of Illinois Urbana-Champaign Institute, Zhejiang University(浙江大学伊利诺伊大学厄巴纳香槟校区联合学院,浙江大学) ; Hepato-Pancreato-Biliary Center, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua Medicine, Tsinghua University(清华长庚医院肝胆胰中心,清华大学临床医学院,清华医学,清华大学) ; School of Software, Tsinghua University(清华大学软件学院) ; Beijing National Research Center for Information Science and Technology, Tsinghua University(清华大学北京信息科学与技术国家研究中心)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究针对多模态大语言模型在医学领域部署的挑战,提出ClinFusion,采用组合级联视觉编码器架构和视觉基础评估框架,在多模态医学基准测试中表现优异,超越开源和专有模型,经专家盲评验证效果良好。
Comments Code: https://github.com/alibaba-damo-academy/ClinFusion Models: https://huggingface.co/collections/Alibaba-DAMO-Academy/clinfusion
基于多模态语言模型的计算幽默:方法、数据集、评估及挑战
机构 * Case Western Reserve University(凯斯西储大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI、cs.MM
AI总结 本研究聚焦于单图像和多面板作品中的视觉幽默理解,通过与先前综述对比,按能力层次组织文献,综合基准设计等内容,追溯领域转变,指出进展的主要障碍包括易出现捷径的评估、文化覆盖有限等问题。
VOGUE:面向时尚领域对话式推荐的多模态数据集
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract_cn);multimodal foundation model(abstract)
AI总结 为弥补多模态对话推荐数据集的不足,构建了包含60个人类对话、2100个细粒度标注话语的VOGUE数据集,支持视觉和上下文推理评估,并揭示了多模态大语言模型在偏好推断上的系统性分布误差。
提升多模态语言模型:带有视觉偏见评估的分阶段训练
机构 * StepFun-Audio Team(StepFun-Audio团队)
专题命中 多模态评测 :omni-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文研究了多模态基准在视觉偏见评估下的表现,提出OmniBoost三阶段训练方法,通过混合双模SFT、混合模态RLVR和自蒸馏数据SFT提升模型性能,验证了小模型在分阶段训练下的有效性。
Comments Project page: https://cheliu-computation.github.io/omni/
探索多模态聊天机器人作为治疗艺术活动的促进者
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn)
AI总结 本文提出一种基于多模态大语言模型的聊天机器人,通过实时分析视觉创作并促进反思对话,探讨其在艺术治疗中的应用潜力及未来发展方向。
SciMDR:推动科学多模态文档推理
机构 * Yale University(耶鲁大学)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出SciMDR数据集,通过合成与重嵌框架生成大规模多模态文档推理数据,提升科学问答任务的复杂度和真实性。
Comments ACL 2026
Figma2Code: 将多模态设计转换为代码的自动化
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn)
AI总结 本文提出Figma2Code任务,通过收集Figma文件元数据与设计图像,构建高质量数据集,评估多种多模态大语言模型,发现专有模型在视觉保真度上表现优异,但布局响应性和代码可维护性有限。
Comments ICLR 2026
ChartNet: 一个百万级、高质量的多模态数据集,用于稳健的图表理解
机构 * MIT(麻省理工学院) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) ; IBM Research(IBM研究院) ; Abaka AI & 2077AI(Abaka AI及2077AI)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 ChartNet通过生成150万张不同图表样本,提升图表解释和推理能力,包含代码、图像、表格、自然语言和问答数据,支持多模态对齐,公开可用。
Comments Accepted at CVPR 2026
从无人机图像到农学推理:一种多模态大语言模型基准用于植物表型分析
机构 * University of Memphis(孟菲斯大学) ; University of Missouri(密苏里大学) ; University of Arkansas Division of Agriculture(阿肯色大学农业分部) ; Mississippi State University(密西西比州立大学)
专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出PlantXpert基准,用于大豆和棉花表型分析,评估多模态模型在农业领域的表现,发现任务特定微调显著提升准确率,但模型扩展和跨物种泛化仍面临挑战。
Comments In review
字典对齐的概念控制用于保护多模态大语言模型
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Amazon(亚马逊) ; University of Central Florida(中佛罗里达大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出字典对齐的概念控制框架,通过定制概念字典和稀疏自编码器实现对多模态大语言模型激活的精细控制,提升安全性的同时保持通用能力。
Comments Accepted in CVPR 2026. Project page: https://peterljq.github.io/project/daco
Chitrakshara:一种用于印度语言的大型多语言多模态数据集
机构 * Krutrim AI
专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出Chitrakshara数据集,涵盖11种印度语言,旨在提升多模态模型对印度语言的表示能力,通过大规模预训练和图像文本对的构建,促进更文化包容的视觉语言模型发展。
Comments Accepted at "CVPR 2025: Workshop Vision Language Models For All"
多模态目标时刻在哪里?关于基础模型识别情境重要时刻的能力
机构 * Institute for Logic, Language and Computation University of Amsterdam(逻辑、语言与计算研究所 阿姆斯特丹大学)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文研究了多模态基础模型识别足球比赛中重要时刻的能力,发现现有模型在识别重要子事件时表现欠佳,需改进架构与训练方法以提升跨模态协同能力。
MUSE:一种面向多模态统一安全评估的运行导向平台
机构 * Duke University(杜克大学) ; Virtue AI
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、eess.AS
AI总结 MUSE提出一种多模态统一安全评估平台,通过多轮攻击和跨轮模态切换技术,评估大型语言模型在不同模态下的安全性能。
Comments Submitted to ACL 2026 System Demonstration Track
Vision-R1: 促进多模态大语言模型推理能力的激励方法
机构 * East China Normal University(华东师范大学) ; The Chinese University of Hong Kong(香港中文大学) ; Xiaohongshu Inc.(小红书公司)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 Vision-R1通过构建高质量多模态CoT数据集和渐进性思维抑制训练策略,提升多模态推理能力,在数学推理基准中取得显著成绩。
Comments Accepted to ICLR 2026. Code is available at https://github.com/Osilly/Vision-R1
PointCoT: 一种用于显式3D几何推理的多模态基准
机构 * Xi'an Jiaotong University(西安交通大学) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Institute of Automation, CASIA(中国科学院自动化研究所) ; Taiyuan University of Technology(太原理工大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 PointCoT通过显式链式推理提升3D几何推理能力,提出多模态基准和双流架构,实现对3D点云的高精度理解与推理。
RADAR: 揭示多模态大语言模型预训练中能力的非对称发展
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; Peng Cheng Laboratory(鹏城实验室) ; Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) ; Tsinghua Shenzhen International Graduate School(清华大学深圳国际 Graduate School) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Yinwang Intelligent Technology Co., Ltd.(亿纬智能科技有限公司) ; Huawei’s 2012 Lab(华为2012实验室)
专题命中 多模态评测 :MLLM(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 RADAR提出了一种高效的以能力为中心的评估框架,用于揭示多模态大语言模型预训练中感知和推理能力的非对称发展。
联邦提示调优与异构且不完整多模态客户端数据
机构 * Institute of AI Innovation and Societal Impact, Hanoi University of Science and Technology(人工智能创新与社会影响研究院,河内科学技术大学) ; EPFL(瑞士联邦理工学院) ; Griffith University(格里菲斯大学) ; Washington State University(华盛顿州立大学)
专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文提出联邦提示调优框架,解决异构多模态数据中特征缺失分布不一致的问题,通过客户端调优与服务器聚合提升多模态提示调优效果。
MATRIX: 一种用于材料科学的多模态基准和后训练框架
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract)
AI总结 MATRIX通过多模态后训练提升材料科学推理,展示视觉引导对实验解释和文本任务的显著改进。
Comments 17 pages, 9 Figures, submitted
层次感知的多模态反遗忘用于医疗AI
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; Nanyang Technological University(南洋理工大学)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 MedForget提出一个层次感知的多模态反遗忘基准和CHIP方法,有效解决医疗数据中层次结构的遗忘问题,同时保持下游效用。
Comments Dataset and Code: https://github.com/fengli-wu/MedForget
DentalGPT: 促进牙科多模态复杂推理的激励机制
机构 * Shenzhen Stomatology Hospital (Pingshan) of Southern Medical University(南方医科大学深圳口腔医院(平山)) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; State Key Laboratory of Membrane Biology, Beijing Key Laboratory of Cardiometabolic Molecular Medicine, Institute of Molecular Medicine, National Biomedical Imaging Center, School of Future Technology, Peking University(北京大学膜生物学国家重点实验室、北京心代谢分子医学重点实验室、分子医学研究院、国家生物医学成像中心、未来技术学院) ; Freedom AI ; Division of Applied Oral Sciences & Community Dental Care Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院应用口腔科学与社区牙科护理系) ; Beijing Institute of Collaborative Innovation(北京协同创新研究院) ; National Health Data Institute, Shenzhen(深圳国家健康数据研究院) ; Shenzhen Loop Area Institute(深圳河套学院) ; Shenzhen Institute of Big Data(深圳大数据研究院)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 DentalGPT通过高质量数据和强化学习提升牙科多模态推理能力,实现优于现有模型的诊断性能。
NeuroABench: 一种多模态评估基准,用于神经外科解剖识别
机构 * Hong Kong Institute of Science and Innovation(香港科学与创新研究院) ; The University of Hong Kong-Shenzhen Hospital(香港大学深圳医院) ; Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 NeuroABench是首个用于评估神经外科领域解剖理解的多模态基准,通过实验揭示了MLLMs在解剖识别任务中的局限性,并展示了人类表现与模型之间的差距。
Comments Accepted by IEEE ICIA 2025
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accpeted by AAAI 2026
机构 * Southwest Jiaotong University(西南交通大学) ; Southeast University(东南大学) ; Sichuan University(四川大学)
专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 多模态评测 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 48 pages, 17 figures
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
机构 * McGill University(麦吉尔大学) ; Mila – Quebec AI Institute(魁北克AI研究所)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted to ICCV 2025 Workshop CVAMD
机构 * Waymo LLC(Waymo公司)
专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by TMLR. Blog post: https://waymo.com/blog/2024/10/introducing-emma/