arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-30 至 2025-12-30 共收录 18 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 18 篇

2512.23219 2025-12-30 cs.CV 83%

MM-UAVBench: How Well Do Multimodal Large Language Models See, Think, and Plan in Low-Altitude UAV Scenarios?

MM-UAVBench: 多模态大语言模型在低空无人机场景中的感知、推理与规划能力如何?

Shiqi Dai, Zizhi Ma, Zhicong Luo, Xuesong Yang, Yibin Huang, Wanyue Zhang, Chi Chen, Zonghao Guo, Wang Xu, Yufei Sun, Maosong Sun

机构 * Tsinghua University(清华大学) Nankai University(南开大学) Northwest Polytechnical University(西北工业大学) Chinese Academy of Sciences(中国科学院) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 MM-UAVBench通过系统评估多模态大语言模型在低空无人机场景中的感知、推理与规划能力,揭示其在复杂任务中的性能瓶颈与改进方向。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03146 2025-12-30 cs.CL 83%

MME-CC: A Challenging Multi-Modal Evaluation Benchmark of Cognitive Capacity

MME-CC:认知能力多模态评估基准

Kaiyuan Zhang, Chenghao Yang, Zhoufutu Wen, Sihang Yuan, Qiuyue Wang, Chaoyi Huang, Guosheng Zhu, He Wang, Huawenyu Lu, Jianing Wen, Jianpeng Jiao, Lishu Luo, Longxiang Liu, Sijin Wu, Xiaolei Zhu, Xuanliang Zhang, Yu Liu, Ge Zhang, Yi Lin, Guang Shi, Chaoyou Fu, Wenhao Huang

机构 * Nanjing University(南京大学)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 MME-CC提出一个以视觉为基础的多模态评估基准,系统评估大语言模型在空间、几何和知识推理中的认知能力,揭示封闭源模型在总体表现上的优势及空间几何推理的薄弱环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22877 2025-12-30 cs.CV 79%

M-ErasureBench: A Comprehensive Multimodal Evaluation Benchmark for Concept Erasure in Diffusion Models

M-ErasureBench:一种全面的多模态评估基准,用于扩散模型的概念擦除

Ju-Hsuan Weng, Jia-Wei Liao, Cheng-Fu Chou, Jun-Cheng Chen

机构 * National Taiwan University(国立台湾大学) Research Center for Information Technology Innovation, Academia Sinica(学术院资讯技术创新研究中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 M-ErasureBench提出一种多模态评估框架,评估扩散模型的概念擦除方法,并提出IRECE模块提升擦除鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19466 2025-12-30 cs.CV cs.LG 79%

ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection

ForgerySleuth: 赋能多模态大语言模型进行图像篡改检测

Zhihao Sun, Haoran Jiang, Haoran Chen, Yixin Cao, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 ForgerySleuth通过多模态大语言模型进行图像篡改检测,利用线索融合和数据集构建提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22689 2025-12-30 cs.CV cs.LG 79%

Multimodal Diffeomorphic Registration with Neural ODEs and Structural Descriptors

基于神经ODE和结构描述符的多模态可微映射注册

Salvador Rodriguez-Sanz, Monica Hernandez

机构 * Aragon Institute for Engineering Research (I3A), University of Zaragoza(阿拉贡工程研究院(I3A)、萨拉戈塔大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于神经ODE和结构描述符的多模态可微映射注册方法,通过整合图像或特征描述符和局部互信息,实现了高精度且高效的多模态注册性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22899 2025-12-30 cs.AI cs.CV 73%

HiSciBench: A Hierarchical Multi-disciplinary Benchmark for Scientific Intelligence from Reading to Discovery

HiSciBench: 一个分层多学科基准,用于从阅读到发现的科学智能

Yaping Zhang, Qixuan Zhang, Xingquan Zhang, Zhiyuan Chen, Wenwen Zhuang, Yupu Liang, Lu Xiang, Yang Zhao, Jiajun Zhang, Yu Zhou, Chengqing Zong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 HiSciBench是一个分层多学科基准,用于评估从阅读到发现的科学智能,涵盖五个层次,揭示了模型在不同科学推理阶段的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03347 2025-12-30 cs.RO 71%

GrOMP: Grasped Object Manifold Projection for Multimodal Imitation Learning of Manipulation

GrOMP:抓取物体流形投影用于多模态模仿学习的操控

William van den Bogert, Gregory Linkowski, Nima Fazeli

机构 * Mechanical Engineering Department at the University of Michigan(密歇根大学机械工程系) Robotics & Automation Research Department at the Ford Motor Company(福特汽车公司机器人与自动化研究部) Robotics Department at the University of Michigan(密歇根大学机器人系)

专题命中 多模态评测 :multimodal(title)

AI总结 GrOMP通过抓取物体流形投影技术,提升多模态模仿学习中操控任务的精度和鲁棒性,基于累积误差界理论,利用触觉反馈在多个装配任务中验证其有效性。

Comments 8 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22257 2025-12-30 q-bio.QM 67%

LiveProteinBench: A Contamination-Free Benchmark for Assessing Models' Specialized Capabilities in Protein Science

LiveProteinBench: 一种无污染的基准测试,用于评估模型在蛋白质科学中的专用能力

Dingyi Rong, Zijian Chen, Qi Jia, Kaiwei Zhang, Haotian Lu, Guangtao Zhai, Ning Liu

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract)

AI总结 LiveProteinBench通过无污染的多模态基准测试,评估LLM在蛋白质科学中的专用能力,揭示了通用模型在零样本性能上的优势及多模态信息融合的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23078 2025-12-30 q-fin.GN cs.AI cs.CV cs.LG econ.GN q-fin.EC 62%

Deep Learning for Art Market Valuation

深度学习在艺术市场估值中的应用

Jianping Mei, Michael Moses, Jan Waelty, Yucheng Yang

机构 * CKGSB(CKGSB商学院) Art Market Consultancy(艺术市场咨询公司) University of Zurich(苏黎世大学) Swiss Finance Institute(瑞士金融研究所)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过多模态深度学习方法,利用艺术品视觉信息提升艺术市场估值,尤其在缺乏历史参照物的首次销售中展现显著价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22275 2025-12-30 cs.CV cs.AI 62%

The Illusion of Clinical Reasoning: A Benchmark Reveals the Pervasive Gap in Vision-Language Models for Clinical Competency

临床推理的幻觉:一个基准揭示了视觉语言模型在临床能力方面的广泛差距

Dingyu Wang, Zimu Yuan, Jiajun Liu, Shanggui Liu, Nan Zhou, Tianxing Xu, Di Huang, Dong Jiang

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出B&J基准测试,揭示了视觉语言模型在临床推理任务中存在显著的多模态整合能力不足问题,强调需在多模态整合和视觉理解上取得突破才能实现临床应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22218 2025-12-30 cs.CV cs.MM 62%

Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark

面向路牌的视觉问答:ViSignVQA数据集、方法与基准

Hieu Minh Nguyen, Tam Le-Thanh Dang, Kiet Van Nguyen

机构 * University of Information Technology, Ho Chi Minh City, Vietnam(胡志明市信息技术大学) Vietnam National University(越南国家大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 ViSignVQA首次提出大规模越南语路牌多模态数据集,结合OCR与预训练语言模型,提升低资源语言VQA性能。

Comments Dataset paper; code and data will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23142 2025-12-30 cs.CV 57%

Domain-Shift Immunity in Deep Deformable Registration via Local Feature Representations

通过局部特征表示实现深度可变形配准的领域偏移免疫

Mingzhen Shao, Sarang Joshi

机构 * Kahlert School of Computing(卡尔伯特计算学校) Scientific Computing and Imaging Institute(科学计算与成像研究所) University of Utah(犹他大学) Department of Biomedical Engineering(生物医学工程系)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出UniReg框架,通过局部特征表示实现深度可变形配准的领域偏移免疫,揭示了局部特征一致性对鲁棒性的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23024 2025-12-30 cs.CV 57%

With Great Context Comes Great Prediction Power: Classifying Objects via Geo-Semantic Scene Graphs

大_context带来大预测能力:通过地-语义场景图进行物体分类

Ciprian Constantinescu, Marius Leordeanu

机构 * National University of Science and Technology(科学与技术国家大学) POLITEHNICA Bucharest(布加勒斯特POLITEHNICA)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于地-语义场景图的上下文感知物体分类框架,通过整合深度估计与全景分割模型,显著提升分类准确率至73.4%,优于传统方法和多模态大语言模型。

Comments This paper is a development of the visual riddle game with Human-AI interaction, entitled "GuessWhat - Riddle Eye with AI", developed by Ciprian Constantinescu (POLItEHNICA Bucharest), Serena Stan (Instituto Cervantes Bucarest) and Marius Leordeanu (POLITEHNICA Bucharest), which was the winner (1st place) of the NeoArt Connect NAC 2025 Scholarship Program

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19683 2025-12-30 cs.CV 57%

From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs

从室内到开放世界:揭示MLLMs中的空间推理差距

Mingrui Wu, Zhaozhi Wang, Fangjinhua Wang, Jiaolong Yang, Marc Pollefeys, Tong Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) ETH Zürich(苏黎世联邦理工学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种大规模基准测试,通过户外数据集揭示MLLMs在空间推理方面的不足,并证明其依赖语言先验而非真实视觉推理。

Comments Project page: https://mingrui-wu.github.io/openbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14404 2025-12-30 cs.CV 57%

ViC-Bench: Benchmarking Visual-Interleaved Chain-of-Thought Capability in MLLMs with Free-Style Intermediate State Representations

ViC-Bench: 用自由式中间状态表示法对多模态大语言模型的视觉交错链式思维能力进行基准测试

Xuecheng Wu, Jiaxing Liu, Danlei Huang, Yifan Wang, Yunyun Shi, Kedi Chen, Junxiao Xue, Yang Liu, Chunlin Chen, Hairong Dong, Dingkang Yang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Meituan Inc.(美团公司) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Research Center for Space Computing System, Zhejiang Lab(浙江实验室空间计算系统研究中心) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) School of Robotics and Automation, Nanjing University(南京大学机器人与自动化学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 ViC-Bench 通过自由式中间状态表示法,系统评估多模态大语言模型的视觉交错链式思维能力,涵盖四个任务并提出新评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22304 2025-12-30 cs.CV 57%

PortionNet: Distilling 3D Geometric Knowledge for Food Nutrition Estimation

PortionNet:基于3D几何知识的食品营养估计

Darrin Bright, Rakshith Raj, Kanchan Keisham

机构 * Vellore Institute of Technology(维捷里尼学院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 PortionNet通过跨模态知识蒸馏框架,在无需专用硬件的情况下,利用点云学习几何特征,实现单图像食品营养估计的高精度

Comments Accepted at the 11th Annual Conference on Vision and Intelligent Systems (CVIS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22197 2025-12-30 cs.CV 57%

Quadrant Segmentation VLM with Few-Shot Adaptation and OCT Learning-based Explainability Methods for Diabetic Retinopathy

四象限分割视觉语言模型结合少样本适应与基于OCT学习的可解释方法用于糖尿病视网膜病变

Shivum Telang

机构 * Department of Biostatics(生物统计学系) North Allegheny Senior High School(北阿勒格尼高中) University of Pittsburgh Rangos Research Center(匹兹堡大学Rangos研究中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种基于四象限分割和少样本学习的多模态视觉语言模型,利用OCT和视网膜图像生成可解释性热图,提升糖尿病视网膜病变的诊断效果。

Comments 4 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12615 2025-12-30 cs.CV cs.LG 57%

Text-Driven Weakly Supervised OCT Lesion Segmentation with Structural Guidance

基于文本驱动的弱监督OCT病变分割与结构引导

Jiaqi Yang, Nitish Mehta, Xiaoling Hu, Chao Chen, Chia-Ling Tsai

机构 * CUNY Graduate Center(CUNY研究生中心) New York University Department of Ophthalmology(纽约大学眼科系) NYU Langone Health(NYU兰格one健康) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院) Stony Brook University(石溪大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于文本驱动和结构引导的弱监督OCT病变分割方法,通过融合视觉和文本信息提升分割性能。

Comments 21 pages, 10 figures, 11 tables

Journal ref IEEE Journal of Biomedical and Health Informatics, Early Access, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏