arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-18 至 2025-12-18 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 10 篇

2510.01899 2025-12-18 cs.LG cs.AI cs.HC 89%

Multimodal Foundation Models for Early Disease Detection

多模态基础模型用于早期疾病检测

Md Talha Mohsin, Ismail Abdulrashid

机构 * The University of Tulsa(塔尔萨大学)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出一种多模态基础模型,通过整合电子病历、医学影像、基因组学和可穿戴传感器数据,提升早期疾病检测的准确性和鲁棒性。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15171 2025-12-18 cs.CV 85%

Cross-modal ultra-scale learning with tri-modalities of renal biopsy images for glomerular multi-disease auxiliary diagnosis

跨模态超尺度学习:利用三种模态的肾活检图像进行肾小球多病种辅助诊断

Kaixing Long, Danyi Weng, Yun Mi, Zhentai Zhang, Yanmeng Lu, Jian Geng, Zhitao Zhou, Liming Zhong, Qianjin Feng, Wei Yang, Lei Cao

机构 * School of Biomedical Engineering, Southern Medical University(生物医学工程学院,南方医科大学) Guangdong Provincial Key Laboratory of Medical Image Processing(广东省医学影像处理重点实验室) Guangdong Province Engineering Laboratory for Medical Imaging and Diagnostic Technology(广东省医学影像与诊断技术工程实验室) Central Laboratory, Southern Medical University(中心实验室,南方医科大学) Department of Pathology, School of Basic Medical Sciences, Southern Medical University(病理学部,基础医学学院,南方医科大学) Guangzhou Huayin Medical Laboratory Center(广州华英医学实验室中心)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文提出CMUS-Net,通过跨模态超尺度学习,利用三种模态的肾活检图像实现肾小球多病种的自动分类,提升了诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09603 2025-12-18 cs.CV 83%

Do MLLMs Exhibit Human-like Perceptual Behaviors? HVSBench: A Benchmark for MLLM Alignment with Human Perceptual Behavior

多模态大语言模型是否表现出类人感知行为?HVSBench:一个用于多模态大语言模型对齐人类视觉行为的基准测试

Jiaying Lin, Shuquan Ye, Dan Xu, Wanli Ouyang, Rynson W. H. Lau

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 HVSBench通过测试多模态大语言模型与人类视觉行为的对齐性,揭示了其在感知任务上的显著差距,并强调了开发更符合人类认知的AI的重要性。

Comments Project page: https://jiaying.link/HVSBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14691 2025-12-18 cs.CL cs.CV 81%

MMGR: Multi-Modal Generative Reasoning

MMGR:多模态生成推理

Zefan Cai, Haoyi Qiu, Tianyi Ma, Haozhe Zhao, Gengze Zhou, Kung-Hsiang Huang, Parisa Kordjamshidi, Minjia Zhang, Wen Xiao, Jiuxiang Gu, Nanyun Peng, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Los Angeles(加州大学洛杉矶分校) Michigan State University(密歇根州立大学) University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Adelaide(阿德莱德大学) Salesforce AI Research(Salesforce人工智能研究) Microsoft(微软) Adobe Research(Adobe研究)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.CL

AI总结 MMGR提出一个多模态生成推理评估框架,通过物理、逻辑、空间和时间五个能力评估视频和图像生成模型,揭示其在抽象推理和具身导航中的性能不足。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01140 2025-12-18 stat.ML cs.AI cs.CV cs.LG eess.IV 81%

Few-Shot Multimodal Medical Imaging: A Theoretical Framework

少样本多模态医学影像:一个理论框架

Md Talha Mohsin, Ismail Abdulrashid

机构 * The University of Tulsa 800 S Tucker Dr, Tulsa, OK 74104, USA(塔尔萨大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出少样本多模态医学影像的理论框架,通过样本复杂性、不确定性量化和可解释性分析,为低资源环境下的高效、可靠诊断模型设计提供理论基础。

Comments 6 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03197 2025-12-18 cs.CL 79%

Explain with Visual Keypoints Like a Real Mentor! A Benchmark for Multimodal Solution Explanation

像真实导师一样用视觉关键点解释吧!一个多模态解决方案解释基准

Jaewoo Park, Jungyang Park, Dongju Jang, Jiwan Chung, Byungwoo Yoo, Jaewoo Shin, Seonjoon Park, Taehyeong Kim, Youngjae Yu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出多模态解决方案解释任务和ME2数据集,旨在评估模型识别视觉关键点并生成相关解释的能力,揭示当前LLM在数学视觉推理和教育应用中的不足。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14750 2025-12-18 q-bio.QM cs.AI 79%

Multiscale Cross-Modal Mapping of Molecular, Pathologic, and Radiologic Phenotypes in Lipid-Deficient Clear Cell Renal CellCarcinoma

多尺度跨模态映射分子、病理和放射表型在脂质缺乏型清细胞癌肾癌中的应用

Ying Cui, Dongzhe Zheng, Ke Yu, Xiyin Zheng, Xiaorui Wang, Xinxiang Li, Yan Gu, Lin Fu, Xinyi Chen, Wenjie Mei, Xin-Gui Peng

机构 * Nurturing Center of Jiangsu Province for State Laboratory of AI Imaging & Interventional Radiology, Department of Radiology, Zhongda Hospital, School of Medicine, Southeast University(江苏省人工智能影像与介入放射学 state laboratory 育成中心,放射科,中大医院,东南大学) Department of Mechanical and Aerospace Engineering, Princeton University(机械与航空航天工程系,普林斯顿大学) School of Automation, Southeast University(自动化学院,东南大学) Department of Biomedical Engineering, Columbia University(生物医学工程系,哥伦比亚大学) Automation and Electrical Engineering College, Lanzhou University of Technology(自动化与电气工程学院,兰州理工大学) The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学附属第一医院,生命科学与医学学院,中国科学技术大学) Lianyungang First People’s Hospital(连云港第一人民医院) School of Robotics and Automation, Suzhou Campus, Nanjing University(机器人与自动化学院,南京大学苏智校区)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.AI

AI总结 本研究提出多尺度跨模态框架,用于术前识别脂质缺乏型清细胞肾癌的分子、病理和放射表型,实现非侵入性分子表型分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15298 2025-12-18 cs.AI cs.CL cs.CY 62%

ChatGPT and Gemini participated in the Korean College Scholastic Ability Test -- Earth Science I

ChatGPT 和 Gemini 参与韩国大学入学考试——地球科学I

Seok-Hyun Ga, Chun-Yen Chang

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究分析了ChatGPT和Gemini在地球科学I考试中的多模态推理能力,发现模型在感知与认知之间存在差距,揭示了AI在科学评估中的局限性。

Comments 23 pages, 9 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09677 2025-12-18 cs.CV cs.AI 62%

Benchmarking Gaslighting Negation Attacks Against Reasoning Models

对抗性否定攻击下推理模型的基准测试

Bin Zhu, Hailong Yin, Jingjing Chen, Yu-Gang Jiang

机构 * Singapore Management University, Singapore College of Computer Science(新加坡国立管理学院计算机科学学院) Artificial Intelligence, Fudan University, China(人工智能,复旦大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文评估了三种顶级推理模型在对抗性否定攻击下的表现,发现其准确率显著下降,并提出了GaslightingBench-R基准以进一步研究模型对这类攻击的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18929 2025-12-18 cs.CV 57%

Human-Centric Open-Future Task Discovery: Formulation, Benchmark, and Scalable Tree-Based Search

以人为中心的开放未来任务发现: formulation、基准和可扩展的树基搜索

Zijian Song, Xiaoxin Lin, Tao Pu, Zhenlong Yuan, Guangrun Wang, Liang Lin

机构 * Zijian Song 1(Song 研究所) Xiaoxin Lin 1(Lin 研究所) Tao Pu 1(Pu 研究所) Zhenlong Yuan 4(Yuan 研究所) Guangrun Wang 1,2,3(Wang 研究所) Liang Lin 1,2,3(Lin 研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出HOTD问题,通过CMAST框架在开放未来任务发现中实现最佳性能,显著超越现有LMMs。

Comments accepted to AAAI 2026, 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏