arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9150 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9150 篇

2604.13252 2026-04-16 cs.LG cs.AI 83%

Out of Context: Reliability in Multimodal Anomaly Detection Requires Contextual Inference

脱离上下文:多模态异常检测的可靠性需要上下文推断

Kevin Wilkinghoff, Neelu Madan, Juan Miguel Valverde, Kamal Nasrollahi, Radu Tudor Ionescu, Rafal Wisniewski, Thomas B. Moeslund, Wenwu Wang, Zheng-Hua Tan

机构 * Aalborg University(奥尔堡大学) Pioneer Centre for Artificial Intelligence(先锋人工智能中心) Technical University of Denmark(丹麦技术大学) Milestone Systems(Milestone系统) University of Bucharest(布加勒斯特大学) University of Surrey(萨里大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 多模态异常检测需通过上下文推断区分真实异常与环境变化,提出跨模态上下文推断框架以提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12632 2026-04-16 eess.IV cs.CV 83%

Cyclic 2.5D Perceptual Loss for Cross-Modal 3D Medical Image Synthesis: T1w MRI to Tau PET

循环2.5D感知损失用于跨模态3D医学图像合成:T1加权MRI到tau PET

Junho Moon, Symac Kim, Haejun Chung, Ikbeom Jang

机构 * Department of Artificial Intelligence, Hanyang University, Seoul, South Korea(人工智能系,翰阳大学,首尔,韩国) Department of Electronic Engineering, Hanyang University, Seoul, South Korea(电子工程系,翰阳大学,首尔,韩国) Division of Computer Engineering, Hankuk University of Foreign Studies, Yongin, South Korea(计算机工程系,韩国外语大学, Yongin,韩国) Division of AI Data Convergence, Hankuk University of Foreign Studies, Yongin, South Korea(AI数据融合系,韩国外语大学, Yongin,韩国) Division of Language & AI, Hankuk University of Foreign Studies, Seoul, South Korea(语言与AI系,韩国外语大学,首尔,韩国)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出循环2.5D感知损失用于从T1加权MRI生成tau PET,通过交替优化不同切面提升体积一致性,并标准化SUVR以提高准确性。

Comments Published in Human Brain Mapping, available at https://doi.org/10.1002/hbm.70508

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12700 2026-04-15 cs.AI 83%

MISID: A Multimodal Multi-turn Dataset for Complex Intent Recognition in Strategic Deception Games

MISID:一种多模态多轮对话数据集,用于战略欺骗游戏中复杂意图识别

Shufang Lin, Muyang Chen, Xiabing Zhou, Rongrong Zhang, Dayou Zhang, Fangxin Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Capital Normal University(首都师范大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出MISID数据集,用于复杂战略欺骗游戏中多模态多轮对话的意图识别,通过系统评估发现现有多模态大语言模型在复杂场景中存在缺陷,并提出FRACTAM框架提升性能。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11589 2026-04-14 cs.CV 83%

MLLM-as-a-Judge Exhibits Model Preference Bias

基于大语言模型的自动评估存在模型偏好偏差

Shuitsu Koyama, Yuiga Wada, Daichi Yashima, Komei Sugiura

机构 * Keio University(庆应义塾大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文研究了基于多模态大语言模型(MLLM)的自动评估方法中存在模型特定偏好偏差的问题,提出Philautia-Eval工具量化这种偏差,并通过实验发现模型间存在相互偏好偏差,最后引入Pomms模型组合方法有效缓解了偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16165 2026-04-13 cs.SE cs.AI cs.HC 83%

Investigating Multimodal Large Language Models to Support Usability Evaluation

探究多模态大语言模型以支持可用性评估

Sebastian Lubos, Alexander Felfernig, Damian Garber, Gerhard Leitner, Julian Schwazer, Manuel Henrich

机构 * Graz University of Technology(格拉茨技术大学) University of Klagenfurt(克拉根福大学) UNiQUARE Software Development GmbH(UNiQUARE软件开发有限公司)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文探讨了多模态大语言模型在可用性评估中的应用,通过优先级问题框架识别并排名可用性问题,比较了MLLM与专家评估结果,展示了交互可视化工具,并提出整合MLLM评估到实际开发流程的概念。

Comments To appear in the Proceedings of IEA/AIE 2026, Springer LNAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15118 2026-04-10 cs.CV 83%

VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents

VAREX:多模态结构提取文档的基准

Udi Barzelay, Ophir Azulai, Inbar Shapira, Idan Friedman, Foad Abo Dahood, Madison Lee, Abraham Daniels

机构 * IBM Research(IBM研究院)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 VAREX基准通过四类输入模态评估多模态基础模型在政府表格结构数据提取中的性能,揭示参数规模、输入格式对提取准确率的影响,强调结构合规性是关键瓶颈。

Comments 9 pages, 4 figures, 4 tables, plus 12-page supplementary. Dataset: https://huggingface.co/datasets/ibm-research/VAREX Code: https://github.com/udibarzi/varex-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05873 2026-04-08 cs.MM 83%

Learning Shared Sentiment Prototypes for Adaptive Multimodal Sentiment Analysis

学习共享情感原型以实现自适应多模态情感分析

Chen Su, Yuanhe Tian, Yan Song

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出PRISM框架,通过共享原型空间实现多模态证据的结构化比较与自适应融合,动态调整模态权重以提升多模态情感分析性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05831 2026-04-08 cs.LG cs.AI 83%

HeartcareGPT: A Unified Multimodal ECG Suite for Dual Signal-Image Modeling and Understanding

HeartcareGPT:一种统一的多模态ECG套件,用于双信号-图像建模与理解

Yihan Xie, Sijing Li, Tianwei Lin, Zhuonan Wang, Chenglin Yang, Yu Zhong, Wenjie Yan, Wenqiao Zhang, Xiaogang Guo, Jun Xiao, Yueting Zhuang, Beng Chin Ooi

机构 * Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出HeartcareGPT,通过Dual Stream Projection Alignment机制,实现ECG信号与图像的统一建模,提升多视角ECG理解能力,并建立医学多模态大语言模型向生理信号领域扩展的方法论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28183 2026-04-02 cs.AI 83%

PReD: An LLM-based Foundation Multimodal Model for Electromagnetic Perception, Recognition, and Decision

PReD:基于大语言模型的电磁感知、识别与决策基础多模态模型

Zehua Han, Jing Xiao, Yiqi Duan, Mengyu Xiang, Yuheng Ji, Xiaolong Zheng, Chenghanyu Zhang, Zhendong She, Junyu Shen, Dingwei Tan, Shichu Sun, Zhou Cong, Mingxuan Liu, Fengxiang Wang, Jinping Sun, Yangang Sun

机构 * Tsinghua University(清华大学) National University of Defense Technology(国防科技大学) Beihang University(北京航空航天大学) Tianjin University(天津大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) The Hong Kong University of Science and Technology(香港科技大学) Civil Aviation University of China(中国民航大学) Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出PReD,首个电磁领域基础模型,涵盖感知、识别与决策闭环,构建高质量多任务电磁数据集和评估基准,通过多阶段训练策略提升电磁领域能力,实验显示在PReD-Bench上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10495 2026-04-02 cs.CV 83%

IMTBench: A Multi-Scenario Cross-Modal Collaborative Evaluation Benchmark for In-Image Machine Translation

IMTBench: 一种多场景跨模态协作评估基准用于图像机器翻译

Jiahao Lyu, Pei Fu, Zhenhang Li, Weichao Zeng, Shaojie Zhang, Jiahui Yang, Can Ma, Yu Zhou, Zhenbo Luo, Jian Luan

机构 * Institute of Information Engineering, Chinese Academy of Science(中国科学院信息工程研究所) MiLM Plus, Xiaomi Inc(小米公司MiLM Plus) Binghamton University(宾汉姆顿大学) The University of Tokyo(东京大学) School of Cyber Security, University of Chinese Academy of Science(中国科学院大学网络空间安全学院)

专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 IMTBench通过2500个图像翻译样本覆盖四个场景和九种语言,提供多方面评估,包括翻译质量、背景保持、整体图像质量和跨模态对齐得分,揭示不同场景和语言间的性能差距,推动图像文本翻译研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06328 2026-04-02 cs.CV 83%

Improving Multimodal Sentiment Analysis via Modality Optimization and Dynamic Primary Modality Selection

通过模态优化和动态主模态选择改进多模态情感分析

Dingkang Yang, Mingcheng Li, Xuecheng Wu, Zhaoyu Chen, Kaixun Jiang, Keliang Liu, Peng Zhai, Lihua Zhang

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MODS框架,通过动态主模态选择和模态优化提升多模态情感分析性能,有效平衡模态贡献并消除冗余噪声。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27737 2026-03-31 cs.CV 83%

Synergizing Discriminative Exemplars and Self-Refined Experience for MLLM-based In-Context Learning in Medical Diagnosis

融合判别示例与自我优化经验的医学诊断基于MLLM的上下文学习

Wenkai Zhao, Zipei Wang, Mengjie Fang, Di Dong, Jie Tian, Lingwei Zhang

机构 * CAS Key Laboratory of Molecular Imaging, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所分子影像重点实验室) School of Software, North University of China(中北大学软件学院)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出Clinician Mimetic Workflow框架,结合判别示例核心集选择与自我优化经验总结,提升医学诊断中基于MLLM的上下文学习性能,超越零样本通用和医疗MLLM,并接近全监督视觉模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16417 2026-03-31 cs.AI 83%

Pharos-ESG: A Framework for Multimodal Parsing, Contextual Narration, and Hierarchical Labeling of ESG Report

Pharos-ESG:一种用于多模态解析、上下文叙述和分层标注ESG报告的框架

Yan Chen, Yu Zou, Jialei Zeng, Haoran You, Xiaorui Zhou, Aixi Zhong

机构 * Southwestern University of Finance and Economics(西南财经大学)

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 本文提出Pharos-ESG框架,通过多模态解析、上下文叙述和分层标注解决ESG报告中布局混乱和隐含层级的问题,实现结构化表示,并发布Aurora-ESG数据集以支持金融治理决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16816 2026-03-30 cs.CV cs.DL 83%

WildDepth: A Multimodal Dataset for 3D Wildlife Perception and Depth Estimation

WildDepth:用于野生动物感知和深度估计的多模态数据集

Muhammad Aamir, Naoya Muramatsu, Sangyun Shin, Matthew Wijers, Jia-Xing Zhong, Xinyu Hou, Amir Patel, Andrew Loveridge, Andrew Markham

机构 * University of Oxford(牛津大学) University of Cape Town(开普敦大学) University College London(伦敦大学学院)

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文提出WildDepth数据集,通过同步RGB和LiDAR数据提升动物深度估计和3D重建性能,实验表明多模态数据使深度可靠性提升10%RMSE,3D重建精度提高12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25388 2026-03-27 cs.CV 83%

Multimodal Dataset Distillation via Phased Teacher Models

通过分阶段教师模型进行多模态数据集蒸馏

Shengbin Guo, Hang Zhao, Senqiao Yang, Chenyang Jiang, Yuhang Cheng, Xiangru Peng, Rui Shao, Zhuotao Tian

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出PTM-ST框架,通过分阶段教师建模和快捷路径轨迹构建策略,解决多模态数据集蒸馏中的跨阶段性能差距和教师轨迹不稳定问题,提升蒸馏过程的稳定性和表达性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23938 2026-03-26 cs.CL 83%

OmniACBench: A Benchmark for Evaluating Context-Grounded Acoustic Control in Omni-Modal Models

OmniACBench:一种评估多模态模型上下文感知语音控制的基准

Seunghee Kim, Bumkyu Park, Kyudan Jung, Joosung Lee, Soyoon Kim, Jeonghoon Kim, Taeuk Kim, Hwiyeol Jo

机构 * Hanyang University(翰阳大学) Seoul National University(首尔国立大学) KAIST AI(韩国科学技术院人工智能研究所) NAVER Cloud(NAVER云)

专题命中 多模态评测 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 OmniACBench评估多模态模型在上下文感知语音生成中的能力,通过语音速率、音调等六种特征验证,揭示模型在多模态整合中的瓶颈及三种常见失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08174 2026-03-25 cs.CV 83%

MERLIN: Building Low-SNR Robust Multimodal LLMs for Electromagnetic Signals

MERLIN:构建低信噪比鲁棒的多模态大语言模型以电磁信号

Junyu Shen, Zhendong She, Chenghanyu Zhang, Yuchuang Sun, Luqing Luo, Dingwei Tan, Zonghao Guo, Bo Guo, Zehua Han, Wupeng Xie, Yaxin Mu, Peng Zhang, Peipei Li, Fengxiang Wang, Yangang Sun, Maosong Sun

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tianjin University(天津大学) Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院微电子研究所) HKUST (Guangzhou)(香港科技大学(广州)) National University of Defense Technology(国防科技大学) Beihang University(北航) Beijing Information Science and Technology University(北京信息科技大学) Artificial Intelligence Institute of China Electronics Technology Group Corporation(中国电子科技集团人工智能研究院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出MERLIN框架,通过构建EM-100k数据集和EM-Bench基准,解决电磁信号多模态大语言模型在低信噪比环境下的鲁棒性问题,验证了方法在EM-Bench上的领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19744 2026-03-23 cs.CL 83%

Rethinking Ground Truth: A Case Study on Human Label Variation in MLLM Benchmarking

重新审视真实标签:在大语言模型基准测试中的人类标签变异案例研究

Tomas Ruiz, Tanalp Agustoslu, Carsten Schwemmer

机构 * Bavarian Research Institute for Digital Transformation(巴伐利亚数字转型研究所)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 研究探讨了人类标注差异对大语言模型基准测试的影响,发现大模型在高一致性子集表现最佳,但在高分歧情况下表现不佳,表明参数数量不决定对模糊性和主观性的敏感度。

Comments 6 pages, 3 tables, 1 figure

Journal ref 2025 IEEE International Conference on Big Data (BigData), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19077 2026-03-20 cs.CV 83%

Multi-Modal Building Change Detection for Large-Scale Small Changes: Benchmark and Baseline

多模态大规模小变化建筑物变化检测:基准与基线

Ye Wang, Wei Lu, Zhihui You, Keyan Chen, Tongfei Liu, Kaiyu Li, Hongruixuan Chen, Qingling Shu, Sibao Chen

机构 * MOE Key Lab of ICSP, Anhui Provincial Key Lab of Multimodal Cognitive Computation, IMIS Lab of Anhui Province, School of Computer Science and Technology, Anhui University, Hefei, China(教育部信息与通信领域重点实验室、安徽省多模态认知计算重点实验室、安徽省IMIS实验室、计算机科学与技术学院、安徽大学、合肥,中国) School of Public Safety and Emergency Management, Anhui University of Science and Technology, Hefei 231131, China(公共安全与应急管理学院、安徽理工大学、合肥231131,中国) College of Computing and Data Science, Nanyang Technological University, Singapore 639798(计算与数据科学学院、南洋理工大学、新加坡639798) Shaanxi Joint Laboratory of Artificial Intelligence, Shaanxi University of Science and Technology, Xi’an 710021, China(人工智能联合实验室、陕西科技大学、西安710021,中国) School of Software Engineering, Xi’an Jiaotong University, Xi’an 710049, China(软件工程学院、西安交通大学、西安710049,中国) Graduate School of Frontier Sciences, The University of Tokyo, Chiba, 277-8561, Japan(前沿科学研究生院、东京大学、千叶,日本)

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出LSMD多模态数据集和MSCNet网络,通过融合RGB和NIR信息提升小变化检测精度,验证了多模态特征融合的有效性。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21475 2026-03-20 cs.AI 83%

MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents

MMSearch-Plus:面向多模态浏览代理的溯源感知基准测试

Xijia Tao, Yihua Teng, Xinxing Su, Xinyu Fu, Jihao Wu, Chaofan Tao, Ziru Liu, Haoli Bai, Rui Liu, Lingpeng Kong

机构 * The University of Hong Kong (HKU)(香港大学) Huawei Inc(华为公司)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.AI

AI总结 MMSearch-Plus是一个包含311个任务的基准测试,通过迭代图像-文本检索和交叉验证在噪声下强制多模态理解,提供模型无关的代理框架和集中标记模块,提升多步推理的鲁棒性。

Comments Project Page: https://mmsearch-plus.github.io

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00204 2026-03-20 cs.MM cs.SI 83%

MSM-BD: Multimodal Social Media Bot Detection Using Heterogeneous Information

MSM-BD:基于异构信息的多模态社交媒体机器人检测

Tingxuan Wu, Zhaorui Ma, Yanjun Cui, Ziyi Zhou, Eric Wang

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出MSM-BD方法,通过异构信息融合技术提升社交媒体机器人检测精度,利用TwiBot-22数据集验证了模型有效性。

Comments Springer Nature in Studies in Computational Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03951 2026-03-18 cs.CV 83%

ANTS: Adaptive Negative Textual Space Shaping for OOD Detection via Test-Time MLLM Understanding and Reasoning

ANTS: 通过测试时MLLM理解和推理实现的自适应负文本空间塑造用于OOD检测

Wenjie Zhu, Yabin Zhang, Xin Jin, Wenjun Zeng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Zhongguancun Academy(中关村学院)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出ANTs通过利用多模态大语言模型的理解和推理能力,构建自适应负文本空间,提升OOD检测的准确性和适应性,实验表明在ImageNet上FPR95降低3.1%。

Comments Accepted by CVPR2026, Project Page: https://zhuwenjie98.github.io/ANTS-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15467 2026-03-17 cs.CV 83%

Evaluating Time Awareness and Cross-modal Active Perception of Large Models via 4D Escape Room Task

通过4D逃脱房间任务评估大模型的时间意识和跨模态主动感知

Yurui Dong, Ziyue Wang, Shuyun Lu, Dairu Liu, Xuechen Liu, Fuwen Luo, Peng Li, Yang Liu

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出4D逃脱房间任务,用于评估大模型在时间变化和不可逆条件下跨模态感知和时间意识的能力,发现模型在多模态整合中存在模态偏差和能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15117 2026-03-17 cs.CL 83%

MMKU-Bench: A Multimodal Update Benchmark for Diverse Visual Knowledge

MMKU-Bench:一种多模态更新基准,用于多样化视觉知识

Baochen Fu, Yuntao Du, Cheng Chang, Baihao Jin, Wenzhi Deng, Muhao Xu, Hongmei Yan, Weiye Song, Yi Wan

机构 * Shandong University, Jinan, China(山东大学,济南,中国)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本文提出MMKU-Bench,用于评估多模态知识更新,包含25k以上知识实例和49k张图像,涵盖更新知识和未知知识两种场景,评估SFT、RLHF和KE等方法,发现SFT和RLHF易遗忘,KE保留能力但更新有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11987 2026-03-13 cs.AI 83%

LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratories

LABSHIELD:一种多模态基准,用于科学实验室中的安全关键推理和规划

Qianpu Sun, Xiaowei Chi, Yuhan Rui, Ying Li, Kuangzhi Ge, Jiajun Li, Sirui Han, Shanghang Zhang

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 LABSHIELD是一个多模态基准,用于评估MLLM在科学实验室中的安全关键推理和规划能力,揭示了现有模型在专业实验室场景中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09478 2026-03-11 cs.MM 83%

MORE-R1: Guiding LVLM for Multimodal Object-Entity Relation Extraction via Stepwise Reasoning with Reinforcement Learning

MORE-R1: 通过强化学习引导大视觉-语言模型进行多模态对象-实体关系提取的分步推理

Xiang Yuan, Xu Chu, Xinrong Chen, Haochen Li, Zonghong Dai, Hongcheng Fan, Xiaoyue Yuan, Weiping Li, Tong Mo

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 MORE-R1通过强化学习引导大视觉-语言模型进行多模态对象-实体关系提取,提升推理能力与模型性能。

Comments Accepted by the 31st International Conference on Database Systems for Advanced Applications. This is the Accepted Manuscript (AM) version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06578 2026-03-10 cs.CV 83%

Multimodal Large Language Models as Image Classifiers

多模态大语言模型作为图像分类器

Nikita Kisel, Illia Volkov, Klara Janouskova, Jiri Matas

机构 * Visual Recognition Group, Czech Technical University in Prague(捷克技术大学普拉茨视觉识别组)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本研究通过修正评估协议和真实标签问题,发现多模态大语言模型在图像分类中的表现受注释质量影响显著,且能辅助人类注释者提升数据集整理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05867 2026-03-10 cs.CV 83%

TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis

TumorChain: 交错多模态链式推理用于可追溯的临床肿瘤分析

Sijing Li, Zhongwei Qiu, Jiang Liu, Wenqiao Zhang, Tianwei Lin, Yihan Xie, Jianxiang An, Boxiang Yun, Chenglin Yang, Jun Xiao, Guangyu Guo, Jiawen Yao, Wei Liu, Yuan Gao, Ke Yan, Weiwei Cao, Zhilin Zheng, Tony C. W. Mok, Kai Cao, Yu Shi, Jiuyu Zhang, Jian Zhou, Beng Chin Ooi, Yingda Xia, Ling Zhang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里集团达摩院) Hupan Lab(虎扑实验室) Shanghai Institution of Pancreatic Disease(上海胰腺疾病研究所) Shengjing Hospital of China Medical University(中国医科大学盛京医院) Sun Yat-sen University Cancer Center(中山大学肿瘤中心)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 TumorChain通过多模态交错推理框架提升临床肿瘤分析的可追溯性和准确性。

Comments Accepted at ICLR 2026. 10 pages + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06985 2026-03-10 cs.CV 83%

Perception-Aware Multimodal Spatial Reasoning from Monocular Images

视感知-aware的多模态空间推理从单目图像

Yanchun Cheng, Rundong Wang, Xulei Yang, Alok Prakash, Daniela Rus, Marcelo H Ang, ShiJie Li

机构 * NUS, Singapore(新加坡国立大学) NTU, Singapore(新加坡国立大学) MIT, US(麻省理工学院) A*STAR, Singapore(新加坡科技研究局)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种感知-aware的多模态推理框架,通过统一标记空间联合处理视觉证据和文本推理,提升单目图像空间推理的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06681 2026-03-10 cs.CV 83%

RADAR: A Multimodal Benchmark for 3D Image-Based Radiology Report Review

RADAR:用于基于3D图像的放射学报告审查的多模态基准

Zhaoyi Sun, Minal Jagtiani, Wen-wai Yim, Fei Xia, Martin Gunn, Meliha Yetisgen, Asma Ben Abacha

机构 * University of Washington(华盛顿大学) Microsoft Health AI(微软健康AI)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 RADAR是一个用于放射学报告审查的多模态基准,通过3D医学图像与初步报告及候选编辑的配对,评估模型在细粒度临床推理和图像-文本对齐方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏