arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9176 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9176 篇

2512.00993 2026-04-22 cs.CV 79%

PhotoFramer: Multi-modal Image Composition Instruction

PhotoFramer:多模态图像构图指令

Zhiyuan You, Ke Wang, He Zhang, Xin Cai, Jinjin Gu, Tianfan Xue, Chao Dong, Zhoutong Zhang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Adobe NextCam Adobe Research Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(InnoHK下的CPII) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 PhotoFramer通过多模态框架为用户提供图像构图指导,通过自然语言描述改进方法并生成示例图像,结合文本与图像生成模型提升日常用户构图能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18224 2026-04-21 cs.SE cs.AI 79%

WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models

WebCompass:迈向多模态网络编码评估的代码语言模型

Xinping Lei, Xinyu Che, Junqi Xiong, Chenchen Zhang, Yukai Huang, Chenyu Zhou, Haoyang Huang, Minghao Liu, Letian Zhu, Hongyi Ye, Jinhua Hao, Ken Deng, Zizheng Zhan, Han Li, Dailin Li, Yifan Yao, Ming Sun, Zhaoxiang Zhang, Jiaheng Liu

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 WebCompass提出一个多模态基准测试,用于评估代码语言模型在网络工程中的能力,涵盖生成、编辑和修复三种任务类型,通过多阶段人机协作流程,发现闭源模型在编辑和修复方面表现更优,但美学仍是开放源模型的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04509 2026-04-21 cs.CL 79%

ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection

ErrorRadar:通过错误检测基准测试多模态大语言模型的复杂数学推理能力

Yibo Yan, Shen Wang, Jiahao Huo, Hang Li, Boyan Li, Jiamin Su, Xiong Gao, Yi-Fan Zhang, Tianlong Xu, Zhendong Chu, Aoxiao Zhong, Kun Wang, Hui Xiong, Philip S. Yu, Xuming Hu, Qingsong Wen

机构 * Squirrel AI HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) MSU(密歇根州立大学) UCAS(中国科学技术大学) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 ErrorRadar通过错误检测任务评估多模态大语言模型在复杂数学推理中的能力,包含2500个高质量K-12数学问题,实验显示GPT-4o仍比人类评价差10%。

Comments Accepted by The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03191 2026-04-21 cs.CV 79%

CORP: A Multi-Modal Dataset for Campus-Oriented Roadside Perception Tasks

CORP:面向校园道路感知任务的多模态数据集

Beibei Wang, Zijian Yu, Lu Zhang, Jingjing Huang, Yao Li, Haojie Ren, Yuxuan Xiao, Yuru Peng, Jianmin Ji, Yu Zhang, Yanyong Zhang

机构 * Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出CORP数据集,首个针对校园场景的多模态道路感知任务基准数据集,包含205k张图像和102k点云,用于提升校园区域的3D跟踪和实例分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17065 2026-04-21 cs.CV 79%

BasketHAR: A Multimodal Dataset for Human Activity Recognition and Sport Analysis in Basketball Training Scenarios

BasketHAR:一种用于篮球训练场景中的人体活动识别和运动分析的多模态数据集

Xian Gao, Haoyue Zhang, Zongyun Zhang, Jiacheng Ruan, Ting Liu, Yuzhuo Fu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出BasketHAR数据集,用于解决现有HAR数据集在体育分析应用中的不足,通过多模态数据包括运动传感器和视频记录,提供先进的HAR任务研究资源。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17037 2026-04-21 cs.CL 79%

Dynamic Emotion and Personality Profiling for Multimodal Deception Detection

动态情绪与人格画像用于多模态欺骗检测

Li Zheng, Yanyi Luo, Hao Fei, Yuzhe Ding, Yujie Huang, Fei Li, Chong Teng, Donghong Ji

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航天信息安全部门与可信计算教育部重点实验室,网络安全科学与工程学院,武汉大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出多模型多提示标注方案和严格标签质量评估标准,建立多模态联合检测数据集DDEP,提出Rel-DDEP框架,通过高维高斯分布空间量化不确定性,实现欺骗、情绪和人格的联合检测。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16980 2026-04-21 cs.LG cs.AI 79%

Evaluating Multimodal LLMs for Inpatient Diagnosis: Real-World Performance, Safety, and Cost Across Ten Frontier Models

评估多模态大语言模型在住院诊断中的表现:在十个前沿模型上的真实世界性能、安全性和成本

Bruce A. Bassett, Amy Rouillard, Sitwala Mundia, Michael Cameron Gramanie, Linda Camara, Ziyaad Dangor, Shabir A. Madhi, Kajal Morar, Marlvin T. Ncube, Ismail Kalla, Haroon Saloojee

机构 * School of Computer Science and Applied Mathematics, University of the Witwatersrand(沃斯兰大学计算机科学与应用数学学院) Wits MIND Institute, University of the Witwatersrand(沃斯兰大学Wits MIND研究所) Grai Labs, Cape Town, South Africa(南非开普敦Grai实验室) Faculty of Health Sciences, University of the Witwatersrand(沃斯兰大学健康科学学院) South African Medical Research Council Vaccines and Infectious Diseases Analytics Research Unit, Faculty of Health Sciences, University of the Witwatersrand(南非医学研究委员会疫苗与传染病分析研究单位,沃斯兰大学健康科学学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文评估了十个前沿多模态大语言模型在住院诊断中的真实世界性能,发现尽管成本差异大,模型表现紧密聚集,且在安全性和诊断准确性上均优于常规护理。

Comments 17 pages, 11 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01306 2026-04-21 cs.CL 79%

M2-Verify: A Large-Scale Multidomain Benchmark for Checking Multimodal Claim Consistency

M2-Verify:一个大规模多领域基准用于检查多模态声明一致性

Abolfazl Ansari, Delvin Ce Zhang, Zhuoyang Zou, Wenpeng Yin, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Sheffield(谢菲尔德大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出M2-Verify基准,用于评估多模态科学声明与证据之间的一致性。该数据集包含16个领域46.9万实例,通过专家审核验证,揭示了现有模型在复杂挑战中的表现不足。

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17932 2026-04-21 cs.SE cs.AI 79%

From Charts to Code: A Hierarchical Benchmark for Multimodal Models

从图表到代码:一个多模态模型的分层基准

Jiahao Tang, Henry Hengyuan Zhao, Lijian Wu, Zijian Zhang, Yifei Tao, Dongxing Mao, Yang Wan, Jingru Tan, Min Zeng, Min Li, Alex Jinpeng Wang

机构 * CSU-JPG, Central South University(中南大学CSU-JPG) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Chart2Code基准,用于评估大多模态模型的图表理解和代码生成能力,包含三个层级任务,涵盖图表复现、编辑和长表转图表生成,测试了25种最先进的LMMs,结果显示GPT-5在编辑任务中表现不佳,凸显了该基准的挑战性。

Comments This work has been accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16214 2026-04-20 cs.CV 79%

GAViD: A Large-Scale Multimodal Dataset for Context-Aware Group Affect Recognition from Videos

GAViD:一个大规模多模态数据集,用于视频中基于情境的群体情感识别

Deepak Kumar, Abhishek Pratap Singh, Puneet Kumar, Xiaobai Li, Balasubramanian Raman

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Roorkee(计算机科学与工程系,印度理工学院Roorkee分校) Indian Institute of Technology Ropar(印度理工学院Ropar分校) Zhejiang University(浙江大学) University of Oulu(奥卢大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GAViD数据集和CAGNet网络,用于视频中基于情境的群体情感识别,通过多模态数据和上下文信息提升识别性能,测试准确率达63.20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20214 2026-04-17 cs.AI 79%

When Slower Isn't Truer: Inverse Scaling Law of Truthfulness in Multimodal Reasoning

当慢并非真:多模态推理中真理性的反比例定律

Sitong Fang, Wenjing Cao, Jiahao Li, Xuyao Wang, Juntao Dai, Chi-Min Chan, Sirui Han, Yike Guo, Yaodong Yang, Jiaming Ji

机构 * Institute for AI(人工智能研究院) Peking University(北京大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 研究探讨了多模态推理中慢思考模式的反比例定律,发现慢思考模型在面对不完整或误导性视觉输入时更易生成虚假细节,揭示了推理模型在处理模糊输入时的脆弱性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13142 2026-04-16 cs.RO cs.CV cs.DB 79%

Multi-modal panoramic 3D outdoor datasets for place categorization

多模态全景三维户外数据集用于场所分类

Hojung Jung, Yuki Oto, Oscar M. Mozos, Yumi Iwashita, Ryo Kurazume

机构 * Graduate School of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工程研究生院) Polytechnic University of Cartagena (UPCT)(卡塔赫纳理工学院) Faculty of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工程学系)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出两个多模态全景三维户外数据集,用于语义场所分类,包含森林、海岸、住宅区、城市区及室内外停车场六类,通过激光扫描和同步图像获取数据,并比较了多种分类方法,取得高准确率。

Comments This is the authors' manuscript. The final published article was presented at IROS 2026, and it is available at https://doi.org/10.1109/IROS.2016.7759669

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21652 2026-04-15 eess.IV cs.AI physics.med-ph 79%

Enabling Ultra-Fast Cardiovascular Imaging Across Heterogeneous Clinical Environments with A Generalist Foundation Model and Multimodal Database

通过通用基础模型和多模态数据库实现跨异构临床环境的超快速心血管成像

Zi Wang, Mingkai Huang, Zhang Shi, Hongjie Hu, Lan Lan, Hui Zhang, Yan Li, Xi Hu, Qing Lu, Zongming Zhu, Qiong Yao, Yuxiang Dai, Fanwen Wang, Yinzhe Wu, Jun Lyu, Qianqian Gao, Guangming Xu, Zhenxuan Zhang, Haosen Zhang, Qing Li, Guangming Wang, Tianxing He, Lizhen Lan, Siyue Li, Le Xue, Mengting Sun, Yuntong Lyu, Junpu Hu, Jiayu Zhu, Rizwan Ahmad, Zhengyu Bu, Xianling Qian, Guanke Cai, Ruiyu Cao, Weirui Cai, Chang Xu, Yuyang Ren, Feidan Yu, Siying Ma, Ziqiang Xu, Xinran Chen, Sha Hua, Daniel Kim, Yajing Zhang, Chen Ouyang, Wenjia Bai, Jing Qin, Yucheng Yang, Daniel Rueckert, He Wang, Qian Tao, Claudia Prieto, Michael Markl, Alistair Young, Lianming Wu, Shuo Wang, Chen Qin, Mengsu Zeng, Xihong Hu, Haibo Xu, Xiaobo Qu, Hao Li, Guang Yang, Chengyan Wang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出CardioMM模型,通过统一语义理解和物理约束数据一致性,实现跨不同扫描仪、协议和患者情况的稳健重建,验证了24倍加速仍能保持关键心脏表型和诊断图像质量。

Comments Github: https://github.com/wangziblake/CardioMM_MMCMR-427K

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11709 2026-04-14 cs.AI 79%

A Mamba-Based Multimodal Network for Multiscale Blast-Induced Rapid Structural Damage Assessment

基于Mamba的多模态网络用于多尺度爆炸诱导快速结构损伤评估

Wanli Ma, Sivasakthy Selvakumaran, Dain G. Farrimond, Adam A. Dennis, Samuel E. Rigby

机构 * School of Mechanical, Aerospace

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于Mamba的多模态网络,整合多尺度爆炸载荷信息与光学遥感图像,提升爆炸后结构损伤评估的准确性和速度,通过2020年贝鲁特爆炸案例验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11307 2026-04-14 cs.AI 79%

PaperScope: A Multi-Modal Multi-Document Benchmark for Agentic Deep Research Across Massive Scientific Papers

PaperScope:一种多模态多文档基准,用于跨大规模科学论文的智能深度研究

Lei Xiong, Huaying Yuan, Zheng Liu, Zhao Cao, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 PaperScope提出一个多模态多文档基准,用于评估智能深度研究能力,包含2000多个跨领域问题,验证了现有系统在长上下文检索和多源推理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09249 2026-04-14 cs.CV cs.IR 79%

FashionStylist: An Expert Knowledge-enhanced Multimodal Dataset for Fashion Understanding

FashionStylist: 一个增强专家知识的多模态数据集用于时尚理解

Kaidong Feng, Zhuoxuan Huang, Huizhong Guo, Yuting Jin, Xinyu Chen, Yue Liang, Yifei Gai, Li Zhou, Yunshan Ma, Zhu Sun

机构 * Yanshan University(燕山大学) Central South University(中南大学) Zhejiang University(浙江大学) Southwest University(西南大学) Singapore Management University(新加坡管理大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 多模态评测 :multimodal(title);MLLM(abstract);分类 cs.CV

AI总结 本文提出FashionStylist,一个专家标注的多任务时尚理解基准,支持服装到物品定位、服装补全和评估任务,提升多模态时尚系统的语义理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18073 2026-04-14 cs.CV 79%

FPBench: A Comprehensive Benchmark of Multimodal Large Language Models for Fingerprint Analysis

FPBench: 多模态大语言模型在指纹分析中的综合基准测试

Ekta Gavas, Sudipta Banerjee, Chinmay Hegde, Nasir Memon

机构 * New York University(纽约大学) University of Wyoming(怀俄明大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出FPBench基准测试,评估20种多模态大语言模型在7个真实和合成数据集上的8项生物识别任务,发现微调视觉和语言编码器可提升性能7%-39%。

Comments Revised version with additional experiments and code release

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21998 2026-04-14 cs.CV 79%

Can Multi-Modal LLMs Provide Live Step-by-Step Task Guidance?

多模态大语言模型能否提供实时逐步任务指导?

Apratim Bhattacharyya, Bicheng Xu, Sanjay Haresh, Reza Pourreza, Litian Liu, Sunny Panchal, Pulkit Madan, Leonid Sigal, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究院) University of British Columbia(不列颠哥伦比亚大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出Qualcomm Interactive Cooking基准和数据集,用于评估多模态大语言模型在实时任务指导中的能力,引入LiveMamba作为新的基线模型。

Comments Accepted to NeurIPS 2025 (Project page: https://apratimbh.github.io/livecook)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09596 2026-04-14 cs.AI cs.MA 79%

DERM-3R: A Resource-Efficient Multimodal Agents Framework for Dermatologic Diagnosis and Treatment in Real-World Clinical Settings

DERM-3R:一种资源高效的多模态代理框架,用于皮肤病诊断和治疗的现实世界临床应用

Ziwen Chen, Zhendong Wang, Chongjing Wang, Yurui Dong, Luozhijie Jin, Jihao Gu, Kui Chen, Jiaxi Yang, Bingjie Lu, Zhou Zhang, Jirui Dai, Changyong Luo, Xiameng Gai, Haibing Lan, Zhi Liu

机构 * School of Pharmacy, Nanjing University of Chinese Medicine(南京中医药大学药学院) Department of Dermatology, the Gulou Hospital of Traditional Chinese Medicine of Beijing(北京鼓楼中医医院皮肤科) Infectious disease department, Dongfang Hospital, Beijing University of Chinese Medicine(北京中医药大学东方医院感染科) College of Art and Science, university of Washington(华盛顿大学文理学院) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Fudan Unversity(复旦大学) Zhejiang Lab(之江实验室) University College London(伦敦大学学院) Department of Dermatology, Inner Mongolia Hospital of Traditional Chinese Medicine(内蒙古自治区中医医院皮肤科) International Campus of Zhejiang University(浙江大学国际校区)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出DERM-3R框架,通过三个协作代理解决皮肤病诊断中的细粒度病变识别、多视角病变表示和综合推理问题,展示了其在资源受限下的高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08896 2026-04-13 cs.CV 79%

GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing

GeoMMBench 和 GeoMMAgent:迈向地质科学和遥感领域的专家级多模态智能

Aoran Xiao, Shihao Cheng, Yonghao Xu, Yexian Ren, Hongruixuan Chen, Naoto Yokoya

机构 * RIKEN AIP(日本理化学研究所革新智能研究中心) Wuhan University(武汉大学) Linköping University(林雪平大学) University of Tokyo(东京大学) Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出 GeoMMBench 和 GeoMMAgent,通过综合多模态问答基准和多智能体框架,解决地质科学和遥感领域知识广、传感器异构、任务碎片化等挑战,提升专家级空间解释能力。

Comments CVPR 2026 Highlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06925 2026-04-10 cs.MM 79%

LungCURE: Benchmarking Multimodal Real-World Clinical Reasoning for Precision Lung Cancer Diagnosis and Treatment

LungCURE:多模态真实世界临床推理基准测试用于精准肺癌诊断与治疗

Fangyu Hao, Jiayu Yang, Yifan Zhu, Zijun Yu, Qicen Wu, Wang Yunlong, Jiawei Li, Yulin Liu, Xu Zeng, Guanting Chen, Shihao Li, Zhonghong Ou, Meina Song, Mengyang Sun, Haoran Luo, Yu Shi, Yingyi Wang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出LungCURE基准测试,通过1000个真实世界病例评估多模态模型在肺癌TNM分期、治疗推荐和临床决策支持中的性能,并引入LCAgent框架提升模型在复杂医疗场景中的推理能力。

Comments 20 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23322 2026-04-10 cs.CV 79%

Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework

缓解大多模态模型中的视觉上下文退化:一种无需训练的解耦代理框架

Hongrui Jia, Chaoya Jiang, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) Shandong University(山东大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出无需训练的解耦代理框架DRP,通过让LLM作为策略推理者与LMM作为观察者解耦,有效缓解多模态推理中的视觉退化问题,实验表明其在MathVision基准上准确率优于GPT-4o。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06985 2026-04-09 cs.LG cs.AI 79%

Frailty Estimation in Elderly Oncology Patients Using Multimodal Wearable Data and Multi-Instance Learning

利用多模态可穿戴数据和多实例学习估计老年癌症患者的虚弱状态

Ioannis Kyprakis, Vasileios Skaramagkas, Georgia Karanasiou, Lampros Lakkas, Andri Papakonstantinou, Domen Ribnikar, Kalliopi Keramida, Dorothea Tsekoura, Ketti Mazzocco, Anastasia Constantinidou, Konstantinos Marias, Dimitrios I. Fotiadis, Manolis Tsiknakis

机构 * Univ. of Ioannina(约阿尼纳大学) Karolinska Univ. Hosp.(卡罗林斯卡大学医院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种多模态可穿戴框架,通过整合智能手表和心电图数据,利用多实例学习方法估计老年乳腺癌患者在随访期间的虚弱状态变化,实验结果显示模型在预测功能变化方面具有较高准确性。

Comments 7 pages, 1 figure, under review for IEEE EMBC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02676 2026-04-09 cs.CV 79%

AdaptMMBench: Benchmarking Adaptive Multimodal Reasoning for Mode Selection and Reasoning Process

AdaptMMBench: 多模态适应推理的基准测试用于模式选择和推理过程

Xintong Zhang, Xiaowen Zhang, Jingrong Wu, Zhi Gao, Shilin Yan, Zhenxin Diao, Kunpeng Gao, Xuanyan Chen, Yuwei Wu, Yunde Jia, Qing Li

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出AdaptMMBench,通过五类领域评估多模态适应推理,利用MCC指标评估模式选择合理性,揭示适应模式选择与最终准确率的脱钩现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19640 2026-04-09 cs.CV 79%

Focus on What Really Matters in Low-Altitude Governance: A Management-Centric Multi-Modal Benchmark with Implicitly Coordinated Vision-Language Reasoning Framework

聚焦低空治理中真正重要的问题:一种以管理为中心的多模态基准与隐式协调的视觉-语言推理框架

Hao Chang, Zhihui Wang, Lingxiang Wu, Wei An, Boyang Li, Zaiping Lin, Weidong Sheng, Jinqiao Wang

机构 * National University of Defense Technology(国防科技大学) Zidong Taichu (Beijing) Technology Co., Ltd.(紫东太初(北京)科技有限公司) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wuhan AI Research(武汉人工智能研究院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出GovLA-10K多模态基准和GovLA-Reasoner框架,通过功能显著目标和隐式协调的视觉-语言推理提升低空治理中的管理需求理解与执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05674 2026-04-08 cs.CR cs.AI 79%

From Incomplete Architecture to Quantified Risk: Multimodal LLM-Driven Security Assessment for Cyber-Physical Systems

从不完整架构到量化风险:面向网络物理系统的多模态LLM驱动安全评估

Shaofei Huang, Christopher M. Poskitt, Lwin Khin Shar

机构 * Singapore Management University(新加坡管理大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出ASTRAL方法,利用多模态LLM重构和分析网络物理系统架构,通过提示链、少样本学习和架构推理实现安全威胁识别和风险量化评估。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05558 2026-04-08 cs.CV 79%

Evaluation Before Generation: A Paradigm for Robust Multimodal Sentiment Analysis with Missing Modalities

在生成前评估:一种用于缺失模态的鲁棒多模态情感分析的范式

Rongfei Chen, Tingting Zhang, Xiaoyu Shen, Wei Zhang

机构 * School of Computer Science and Technology, Eastern Institute of Technology, Ningbo, China(东部理工学院计算机科学与技术学院) School of Mechatronic Engineering and Automation, Shanghai University, China(上海大学机电工程与自动化学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种在生成前评估的框架,通过动态评估缺失模态的重要性,分解共享提示为模态特定的私有提示,并动态调整提示权重,以提升多模态情感分析的鲁棒性与稳定性。

Comments 6 pages, 3 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05557 2026-04-08 cs.CL 79%

EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents

EpiBench:多轮研究工作流的多模态代理基准测试

Xuan Dong, Huanyang Zheng, Tianhao Niu, Zhe Han, Pengzhan Li, Bofei Liu, Zhengyang Liu, Guancheng Li, Qingfu Zhu, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 EpiBench通过多轮多模态任务评估代理在文献检索、证据整合和跨论文比较中的能力,揭示现有基准在多证据整合和持续证据使用方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05545 2026-04-08 eess.AS 79%

Multimodal Deep Learning Method for Real-Time Spatial Room Impulse Response Computing

多模态深度学习方法用于实时空间房间脉冲响应计算

Zhiyu Li, Xinwen Yue, Shenghui Zhao, Jing Wang

专题命中 多模态评测 :multimodal(title,abstract);分类 eess.AS

AI总结 本文提出一种多模态深度学习模型,用于VR混响生成实时空间房间脉冲响应,通过几何声学计算低阶反射,提升计算效率与个性化声学感知重建能力。

Comments This work was accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10287 2026-04-08 cs.LG cs.CL 79%

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models

OutSafe-Bench:一种用于大型语言模型多模态攻击内容检测的基准测试

Yuping Yan, Yuhan Xie, Yuanshuai Li, Yingchao Yu, Lingjuan Lyu, Yaochu Jin

机构 * School of Engineering, Westlake University(西湖大学工学院) Sony AI(索尼人工智能)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出OutSafe-Bench,首个多模态时代内容安全评估测试套件,包含四类模态大规模数据集及多维交叉风险评分指标,评估九种内容风险类别,揭示九种先进MLLM的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏