arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9213 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9213 篇

2604.21346 2026-04-24 cs.AI cs.CL cs.CV 67%

Symbolic Grounding Reveals Representational Bottlenecks in Abstract Visual Reasoning

符号 grounding 揭示了抽象视觉推理中的表征瓶颈

Mohit Vaishnav, Tanel Tammet

机构 * Applied Artificial Intelligence Group, Tallinn University of Technology, Estonia(塔林技术大学应用人工智能小组,爱沙尼亚) Kimova AI, Tallinn, Estonia(Kimova AI,塔林,爱沙尼亚)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文通过Bongard-LOGO基准测试,发现符号输入能显著提升抽象视觉推理性能,揭示了表征能力是核心瓶颈。

Journal ref 30th Conference on Computational Natural Language Learning (CoNLL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20511 2026-04-23 cs.LG cs.AI cs.CL cs.CV cs.CY 67%

CHASM: Unveiling Covert Advertisements on Chinese Social Media

CHASM:揭示中国社交媒体上的隐蔽广告

Jingyi Zheng, Tianyi Hu, Yule Liu, Zhen Sun, Zongmin Zhang, Zifan Peng, Wenhan Dong, Xinlei He

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出CHASM数据集,用于评估多模态大语言模型在检测社交媒体隐蔽广告的能力,揭示当前模型在识别隐蔽广告中的不足及改进方向。

Comments NeuIPS 2025 (Datasets and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08562 2026-04-13 cs.CL cs.AI cs.SD eess.AS 67%

Neural networks for Text-to-Speech evaluation

用于文本到语音评估的神经网络

Ilya Trofimenko, David Kocharyan, Aleksandr Zaitsev, Pavel Repnikov, Mark Levin, Nikita Shevtsov

机构 * HSE University(高等经济学院) Institute for System Programming, Russian Academy of Sciences(俄罗斯科学院系统编程研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文提出NeuralSBS和改进的MOSNet及WhisperBert,通过神经网络模型在相对和绝对评估中实现高精度,优于人类评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07101 2026-04-09 cs.CV cs.AI cs.MM eess.IV 67%

SurFITR: A Dataset for Surveillance Image Forgery Detection and Localisation

SurFITR:用于监控图像伪造检测与定位的数据集

Qizhou Wang, Guansong Pang, Christopher Leckie

机构 * The University of Melbourne(墨尔本大学) Singapore Management University(新加坡管理大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 SurFITR数据集旨在解决监控场景中伪造检测与定位的挑战,通过多模态LLM生成大量高质量伪造图像,提升检测模型在不同场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04997 2026-04-08 cs.IR cs.AI cs.CL cs.CV cs.LG 67%

Evaluation of Embedding-Based and Generative Methods for LLM-Driven Document Classification: Opportunities and Challenges

嵌入式与生成方法在LLM驱动文档分类中的评估:机遇与挑战

Rong Lu, Hao Liu, Song Hou

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文比较了基于嵌入和生成模型在地学技术文档分类中的表现,发现增强的生成视觉-语言模型在零样本准确率上表现更优,但监督微调对训练数据不平衡敏感。

Comments Accepted at the IMAGE'25 Workshop (PCW-11), Society of Exploration Geophysicists (SEG). Published version available at https://doi.org/10.1190/image2025-w11-03.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12705 2026-04-08 cs.CL cs.AI cs.CV eess.IV 67%

MedXIAOHE: A Comprehensive Recipe for Building Medical MLLMs

MedXIAOHE:构建医疗多模态大语言模型的全面指南

Baorong Shi, Bo Cui, Boyuan Jiang, Deli Yu, Fang Qian, Haihua Yang, Huichao Wang, Jiale Chen, Jianfei Pan, Jieqiong Cao, Jinghao Lin, Kai Wu, Lin Yang, Shengsheng Yao, Tao Chen, Xiaojun Xiao, Xiaozhong Ji, Xu Wang, Yijun He, Zhixiong Yang

机构 * ByteDance XiaoHe Medical AI(字节跳动小荷医疗AI)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MedXIAOHE通过实体感知持续预训练框架和强化学习提升医疗理解与推理,实现医疗多模态大模型的突破性进展。

Comments XIAOHE Medical AI team. See paper for full author list. Currently, the model is exclusively available on XIAOHE AI Doctor, accessible via both the App Store and the Douyin Mini Program. Updated to improve the layout

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02804 2026-04-06 cs.CV cs.AI cs.MM 67%

PaveBench: A Versatile Benchmark for Pavement Distress Perception and Interactive Vision-Language Analysis

PaveBench: 一种多功能的路面病害感知及交互视觉-语言分析基准

Dexiang Li, Zhenning Che, Haijun Zhang, Dongliang Zhou, Zhao Zhang, Yahong Han

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tianjin University(天津大学) Hefei University of Technology(合肥工业大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 PaveBench针对路面状况评估中的视觉识别与多模态交互需求,提供分类、检测、分割及视觉-语言问答等四项任务,支持多轮交互与事实推理,填补现有数据集在多模态分析与实际应用连接上的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12797 2026-04-03 cs.CV cs.AI cs.CL 67%

KARL: Knowledge-Aware Reasoning and Reinforcement Learning for Knowledge-Intensive Visual Grounding

KARL:面向知识密集型视觉定位的知识感知推理与强化学习

Xinyu Ma, Ziyang Ding, Zhicong Luo, Chi Chen, Zonghao Guo, Derek F. Wong, Zhen Zhao, Xiaoyi Feng, Maosong Sun

机构 * University of Macau(澳门大学) Shandong University(山东大学) Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出KARL框架,通过知识引导的推理数据和强化学习方法,提升模型在知识密集型视觉定位任务中的表现,实现跨领域泛化能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24866 2026-03-27 cs.AI cs.CL cs.CV 67%

How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning

视觉-语言模型距离构建现实世界还有多远?一个物理生成推理的基准测试

Luyu Yang, Yutong Dai, An Yan, Viraj Prabhu, Ran Xu, Zeyuan Chen

机构 * Salesforce AI Research(Salesforce 人工智能研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出DreamHouse基准测试,评估视觉-语言模型在物理生成推理能力上的不足,通过住宅木构架建造领域验证模型在结构、施工可行性等约束下的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11809 2026-03-26 cs.HC cs.RO 67%

HiSync: Spatio-Temporally Aligning Hand Motion from Wearable IMU and On-Robot Camera for Command Source Identification in Long-Range HRI

HiSync: 从可穿戴IMU和机器人摄像头同步手部运动以在远距离HRI中进行命令源识别

Chengwen Zhang, Chun Yu, Borong Zhuang, Haopeng Jin, Qingyang Wan, Zhuojun Li, Zhe He, Zhoutong Ye, Yu Mei, Chang Liu, Weinan Shi, Yuanchun Shi

机构 * Department of Computer Science Technology, BNRist Tsinghua University Beijing China Technology, BNRist, College of AI Tsinghua University Beijing China Technology Tsinghua University Beijing China Beijing University of Posts Academy of Arts \& Design Tsinghua University Beijing China Qinghai University Xining China Tsinghua University Technology, BNRist, College of AI Technology Tsinghua University Academy of Arts \& Design Tsinghua University Qinghai University

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 HiSync通过同步机器人摄像头光流与手环IMU信号,提取频域手部运动特征并融合多模态数据,实现远距离多用户HRI中的高准确率命令源识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22529 2026-03-25 cs.CV cs.AI cs.CL 67%

Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos

Ego2Web:一种基于第一人称视频的网络代理基准测试

Shoubin Yu, Lei Shu, Antoine Yang, Yao Fu, Srinivas Sunkara, Maria Wang, Jindong Chen, Mohit Bansal, Boqing Gong

机构 * Google DeepMind(谷歌DeepMind) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Ego2Web通过结合真实世界第一人称视频与网络任务,解决网络代理在现实物理环境中的感知问题,提出LLM-as-a-Judge评估方法,揭示当前代理在视觉理解和任务规划上的不足。

Comments CVPR 2026. Project page: https://ego2web.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18675 2026-03-13 cs.CV cs.AI cs.CL 67%

ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps

ReasonMap:迈向基于交通地图的细粒度视觉推理

Sicheng Feng, Song Wang, Shuyi Ouyang, Lingdong Kong, Zikai Song, Jianke Zhu, Huan Wang, Xinchao Wang

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 ReasonMap是一个针对交通地图的细粒度视觉推理基准,通过评估16种MLLMs揭示开源与闭源模型在推理性能上的差异,并强调视觉支撑对高性能的重要性。

Comments CVPR 2026, website: https://fscdc.github.io/ReasonMap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08173 2026-03-11 cs.RO cs.AI cs.CL cs.CV 67%

NavSpace: How Navigation Agents Follow Spatial Intelligence Instructions

NavSpace: 导航代理如何遵循空间智能指令

Haolin Yang, Yuxing Long, Zhuoyuan Yu, Zihan Yang, Minghan Wang, Jiapeng Xu, Yihan Wang, Ziyan Yu, Wenzhe Cai, Lei Kang, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 NavSpace基准测试通过评估导航代理的空间感知与推理能力,提出SNav模型在指令遵循任务中表现优异,为具身智能研究提供新基准。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05151 2026-03-09 cs.CL cs.AI cs.CV cs.LG 67%

Transforming Science with Large Language Models: A Survey on AI-assisted Scientific Discovery, Experimentation, Content Generation, and Evaluation

用大语言模型变革科学:一项关于人工智能辅助科学发现、实验、内容生成和评估的综述

Steffen Eger, Yong Cao, Jennifer D'Souza, Andreas Geiger, Christian Greisinger, Stephanie Gross, Yufang Hou, Brigitte Krenn, Anne Lauscher, Yizhi Li, Chenghua Lin, Nafise Sadat Moosavi, Wei Zhao, Tristan Miller

机构 * University of Technology Nuremberg (UTN)(图恩大学(UTN)) University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) TIB Leibniz Information Centre for Science and Technology(莱比锡信息科学与技术研究中心) Austrian Research Institute for Artificial Intelligence(奥地利人工智能研究所) IT:U Interdisciplinary Transformation University Austria(奥地利 interdisciplinary transformation 大学) University of Hamburg(汉堡大学) University of Manchester(曼彻斯特大学) University of Sheffield(谢菲尔德大学) University of Aberdeen(阿伯丁大学) University of Manitoba(曼尼托巴大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文综述了大语言模型在科学发现、实验、内容生成和评估中的应用,探讨了相关技术、数据集和伦理问题,旨在为AI辅助科学研究提供指导。

Comments 46 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04670 2026-03-06 cs.AI cs.CL cs.CV 67%

Using Vision + Language Models to Predict Item Difficulty

利用视觉与语言模型预测项目难度

Samin Khan

机构 * Stanford Graduate School of Education(斯坦福大学教育研究生院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 利用视觉与语言模型结合预测数据可视化测试项目难度,通过多模态方法实现更低的误差率,展示了LLMs在心理测量中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07957 2026-03-05 astro-ph.IM astro-ph.HE 67%

In-Orbit GRB Identification Using LLM-based model for the CXPD CubeSat

利用基于大语言模型的模型进行轨道上伽马射线暴识别

Cunshi Wang, Zuke Feng, Difan Yi, Yuyang Li, Lirong Xie, Huanbo Feng, Yi Liu, Qian Liu, Yang Huang, Hongbang Liu, Xinyu Qi, Yangheng Zheng, Ali Luo, Guirong Xue, Jifeng Liu

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract)

AI总结 本文提出基于大语言模型的轨道上伽马射线暴识别方法,通过模拟数据训练模型,实现高精度分类和光谱指数估计,为未来轨道上实时GRB检测提供技术基础。

Comments 16 pages, 8 figures, accepted by RAA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19517 2026-03-04 cs.AI cs.CE cs.CL cs.CV 67%

Classroom Final Exam: An Instructor-Tested Reasoning Benchmark

教室期末考试:一个由教师测试的推理基准

Chongyang Gao, Diji Yang, Shuyan Zhou, Xichen Yan, Luchuan Song, Shuo Li, Kezhen Chen

机构 * Northwestern University(西北大学) UC Santa Cruz(加州大学圣克鲁兹分校) Duke University(杜克大学) University of Birmingham(伯明翰大学) University of Rochester(罗切斯特大学) Analogy AI, Inc.(Analogy AI 公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 CFE-Bench是一个由教师测试的多模态推理基准,用于评估大语言模型在STEM领域中的推理能力,发现前沿模型在多步骤解决方案中存在中间状态推导和保持的困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22373 2026-03-03 cs.CL cs.AI cs.CV 67%

VisJudge-Bench: Aesthetics and Quality Assessment of Visualizations

VisJudge-Bench: 可视化美学与质量评估

Yupeng Xie, Zhiyang Zhang, Yifan Wu, Sirong Lu, Jiayi Zhang, Zhaoyang Yu, Jinlin Wang, Sirui Hong, Bang Liu, Chenglin Wu, Yuyu Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) DeepWisdom(深智科技) Université de Montréal & Mila(蒙特利尔大学及Mila)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 VisJudge-Bench提出首个可视化质量评估基准,通过VisJudge模型显著提升对可视化美学和质量的判断精度。

Comments 62 pages, 27 figures, 8 tables. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06905 2026-03-03 cs.AI cs.CL cs.CV cs.LG 67%

Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering

元适应性提示蒸馏用于少样本视觉问答

Akash Gupta, Amos Storkey, Mirella Lapata

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出元适应性提示蒸馏方法,通过固定软提示提升少样本视觉问答性能,实验表明在低数据情况下优于ICL和参数高效微调方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00994 2026-03-03 cs.HC 67%

VizQStudio: Iterative Visualization Literacy MCQs Design with Simulated Students

VizQStudio: 基于模拟学生的迭代可视化素养多选题设计

Zixin Chen, Yuhang Zeng, Sicheng Song, Yanna Lin, Xian Xu, Huamin Qu, Meng Xia

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract)

AI总结 VizQStudio通过模拟学生帮助教师迭代设计高质量可视化素养多选题,提升评估设计的灵活性和适应性。

Comments TVCG fast track (PVIS 2026 TVCG Track) under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00080 2026-03-03 cs.DL 67%

From Static Repositories to Agentic Knowledge Webs: ResearchTwin and the S-Index for Federated Human-AI Research Discovery

从静态仓库到代理知识网络:ResearchTwin和S-指数用于联邦人机研究发现

Martin G. Frasch

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract)

AI总结 ResearchTwin通过S-指数量化多模态研究影响,利用联邦架构实现人机协同的知识发现。

Comments 15 pages, 1 figure, https://github.com/martinfrasch/ResearchTwin

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00043 2026-02-26 cs.CV cs.AI cs.CL 67%

VOILA: Evaluation of MLLMs For Perceptual Understanding and Analogical Reasoning

VOILA:对多模态大语言模型的感知理解与类比推理能力评估

Nilay Yilmaz, Maitreya Patel, Yiran Lawrence Luo, Tejas Gokhale, Chitta Baral, Suren Jayasuriya, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 VOILA通过类比映射方法评估多模态大语言模型的感知理解和抽象推理能力,发现其在图像间关系理解上存在不足,但通过多步提示策略可提升性能。

Comments Accepted at ICLR 2025. Code and data: https://github.com/nlylmz/Voila

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15958 2026-02-19 cs.CL cs.AI cs.CV 67%

DocSplit: A Comprehensive Benchmark Dataset and Evaluation Approach for Document Packet Recognition and Splitting

DocSplit: 一个全面的基准数据集和评估方法用于文档包识别与分割

Md Mofijul Islam, Md Sirajus Salekin, Nivedha Balakrishnan, Vincil C. Bishop, Niharika Jain, Spencer Romo, Bob Strahan, Boyi Xie, Diego A. Socolinsky

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 DocSplit提出首个全面的文档包识别与分割基准数据集及评估方法,涵盖多类型文档和复杂场景,揭示当前模型在处理复杂文档分割任务中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20430 2026-02-17 cs.CL cs.AI cs.CV cs.MA 67%

An Agentic System for Rare Disease Diagnosis with Traceable Reasoning

一种具有可追溯推理的罕见病诊断代理系统

Weike Zhao, Chaoyi Wu, Yanjie Fan, Xiaoman Zhang, Pengcheng Qiu, Yuze Sun, Xiao Zhou, Yanfeng Wang, Xin Sun, Ya Zhang, Yongguo Yu, Kun Sun, Weidi Xie

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 DeepRare是一种基于大型语言模型的多代理系统,通过整合40多种专用工具和最新知识源,为罕见病诊断提供决策支持,实现了透明可追溯的推理链。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12092 2026-02-13 cs.CL cs.AI cs.CR cs.CV 67%

DeepSight: An All-in-One LM Safety Toolkit

DeepSight: 一个全方位的大型模型安全工具包

Bo Zhang, Jiaxuan Guo, Lijun Li, Dongrui Liu, Sujin Chen, Guanxu Chen, Zhijie Zheng, Qihao Lin, Lewen Yan, Chen Qian, Yijin Zhou, Yuyao Wu, Shaoxiong Guo, Tianyi Du, Jingyi Yang, Xuhao Hu, Ziqi Miao, Xiaoya Lu, Jing Shao, Xia Hu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 DeepSight是一个开源工具包,旨在通过整合安全评估与诊断,提升大型模型的安全性与可解释性。

Comments Technical report, 29 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09294 2026-02-11 cs.CE 67%

BrainTAP: Brain Disorder Prediction with Adaptive Distill and Selective Prior Integration

BrainTAP: 基于自适应蒸馏和选择性先验整合的脑部疾病预测

Zhenyu Lei, Aiying Zhang, Song Wang, Han Fan, Jundong Li

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 BrainTAP通过自适应蒸馏和选择性先验整合,提升脑部疾病预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08588 2026-02-10 cs.DB 67%

MMTS-BENCH: A Comprehensive Benchmark for Time Series Understanding and Reasoning

MMTS-BENCH: 一个全面的时间序列理解和推理基准

Yao Yin, Zhenyu Xiao, Musheng Li, Yiwen Liu, Sutong Nan, Yiting He, Ruiqi Wang, Zhenwei Zhang, Qingmin Liao, Yuantao Gu

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 MMTS-BENCH通过多模态基准评估大语言模型在时间序列理解与推理中的表现,揭示了TS-LLMs在跨领域泛化和多模态整合方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04365 2026-02-05 cs.LG 67%

EXaMCaP: Subset Selection with Entropy Gain Maximization for Probing Capability Gains of Large Chart Understanding Training Sets

EXaMCaP: 通过熵增最大化进行子集选择以探测大规模图表理解训练集的探测能力提升

Jiapeng Liu, Liang Li, Bing Li, Peng Fu, Xiyan Gao, Chengyang Fang, Xiaoshuai Hao, Can Ma

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyberspace Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院) School of Computer and Artificial Intelligence, Jiangxi University of Finance and Economics(江西财经大学计算机与人工智能学院)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract)

AI总结 EXaMCaP通过熵增最大化选择子集,以高效探测大规模图表理解训练集的能力提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22881 2026-02-02 cs.SE 67%

AnoMod: A Dataset for Anomaly Detection and Root Cause Analysis in Microservice Systems

AnoMod:一个用于微服务系统异常检测和根本原因分析的数据集

Ke Ping, Hamza Bin Mazhar, Yuqing Wang, Ying Song, Mika V. Mäntylä

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 AnoMod数据集通过多模态数据支持微服务系统中异常检测与根本原因分析的端到端研究。

Comments Accepted at the 23rd International Conference on Mining Software Repositories (MSR 2026). Dataset paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14084 2026-01-21 cs.CV cs.AI cs.CL 67%

DermaBench: A Clinician-Annotated Benchmark Dataset for Dermatology Visual Question Answering and Reasoning

DermaBench:一种用于皮肤科视觉问答和推理的临床标注基准数据集

Abdurrahim Yilmaz, Ozan Erdem, Ece Gokyayla, Ayda Acar, Burc Bugra Dagtas, Dilara Ilhan Erdil, Gulsum Gencoglan, Burak Temelkuran

机构 * Imperial College London(帝国理工学院伦敦分校) Istanbul Medeniyet University(伊斯坦布尔医学大学) Usak Research and Training Hospital(Usak研究与培训医院) Istanbul Research and Training Hospital(伊斯坦布尔研究与培训医院) Ipswich Hospital(伊普斯韦奇医院) Medicana Atakoy Hospital(Medicana阿塔基医院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 DermaBench是首个由临床专家标注的皮肤科视觉问答基准数据集,通过精细标注和开放式描述提升多模态模型在皮肤科图像理解与临床推理中的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏