arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-02 至 2025-12-02 共收录 20 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 20 篇

2512.00450 2025-12-02 cs.CV cs.AI 84%

RecruitView: A Multimodal Dataset for Predicting Personality and Interview Performance for Human Resources Applications

RecruitView:一个用于人力资源应用预测性格和面试表现的多模态数据集

Amit Kumar Gupta, Farhan Sheth, Hammad Shaikh, Dheeraj Kumar, Angkul Puniya, Deepak Panwar, Sandeep Chaurasia, Priya Mathur

机构 * Manipal University Jaipur(马普尔大学贾布尔) Poornima Institute of Engineering & Technology(波尼玛工程与技术学院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 RecruitView通过几何深度学习框架CRMF,利用多模态数据预测性格和面试表现,实现更高效且准确的评估方法。

Comments 20 pages, 10 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00082 2025-12-02 cs.CV 84%

Exploring Diagnostic Prompting Approach for Multimodal LLM-based Visual Complexity Assessment: A Case Study of Amazon Search Result Pages

探索用于多模态大语言模型视觉复杂性评估的诊断提示方法:亚马逊搜索结果页面案例研究

Divendar Murtadak, Yoon Kim, Trilokya Akula

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本研究通过对比诊断提示与传统提示方法,发现其在提升多模态大语言模型对亚马逊搜索结果页面视觉复杂性评估的可靠性方面有显著改进,但仍有待进一步优化。

Comments 9 pages, 4 figures, 9 tables. Study on diagnostic prompting for multimodal LLM-based visual complexity assessment of Amazon search result pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01274 2025-12-02 cs.CL cs.AI cs.LG 81%

SUPERChem: A Multimodal Reasoning Benchmark in Chemistry

SUPERChem:化学领域的多模态推理基准

Zehua Zhao, Zhixian Huang, Junren Li, Siyu Lin, Junting Zhou, Fengqi Cao, Kun Zhou, Rui Ge, Tingting Long, Yuexiang Zhu, Yan Liu, Jie Zheng, Junnian Wei, Rong Zhu, Peng Zou, Wenyu Li, Zekai Cheng, Tian Ding, Yaxuan Wang, Yizhao Yan, Tingru Wei, Haowei Ming, Weijie Mao, Chen Sun, Yiming Liu, Zichen Wang, Zuo Zhang, Tong Yang, Hao Ma, Zhen Gao, Jian Pei

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 SUPERChem通过多模态推理基准测试,评估LLMs在化学领域的能力,揭示模型对视觉信息的依赖,并区分高保真推理与启发式推理。

Comments 35 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00060 2025-12-02 cs.CV cs.AI 81%

PEFT-DML: Parameter-Efficient Fine-Tuning Deep Metric Learning for Robust Multi-Modal 3D Object Detection in Autonomous Driving

PEFT-DML:参数高效微调深度度量学习用于自动驾驶中鲁棒的多模态3D物体检测

Abdolazim Rezaei, Mehdi Sookhak

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 PEFT-DML通过参数高效微调深度度量学习,提升自动驾驶中多模态3D物体检测的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01519 2025-12-02 cs.CV cond-mat.mtrl-sci quant-ph 79%

QuantumCanvas: A Multimodal Benchmark for Visual Learning of Atomic Interactions

QuantumCanvas:一种用于原子相互作用视觉学习的多模态基准

Can Polat, Erchin Serpedin, Mustafa Kurban, Hasan Kurban

机构 * Texas A&M University(德克萨斯大学) Ankara University(安卡拉大学) Texas A&M University at Qatar(德克萨斯大学(卡塔尔)) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 QuantumCanvas通过多模态基准统一轨道物理与视觉表示学习,为学习可转移的量子相互作用提供了系统且可解释的基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01300 2025-12-02 cs.AI 70%

RoboDriveVLM: A Novel Benchmark and Baseline towards Robust Vision-Language Models for Autonomous Driving

RoboDriveVLM:一种面向自动驾驶鲁棒视觉-语言模型的新型基准与基线

Dacheng Liao, Mengshi Qi, Peng Shu, Zhining Zhang, Yuxin Lin, Liang Liu, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 RoboDriveVLM提出了一种新型基准和基线,用于评估视觉-语言模型在自动驾驶中的鲁棒性,通过模拟多种腐蚀场景提升系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00880 2025-12-02 cs.CV 70%

Quantum-Inspired Spectral Geometry for Neural Operator Equivalence and Structured Pruning

量子启发的谱几何用于神经运算等价与结构剪枝

Haijian Shao, Wei Liu, Xing Deng

机构 * School of Computer Jiangsu University of Science and Technology(江苏科技大学计算机学院) School of Computer and Software Nanjing University of Information Science and Technology(南京信息工程大学计算机与软件学院) Department of Electrical and Computer Engineering University of Nevada Las Vegas(内华达大学拉斯维加斯分校电气与计算机工程系)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出量子启发的谱几何框架,用于神经运算等价与结构化剪枝,通过归一化奇异值谱建立跨模态运算替代的理论基础,并验证其在异构硬件上的有效性。

Comments 6 pages, 1 figure, preliminary version; concepts and simulation experiments only

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01755 2025-12-02 cs.CV cs.RO 70%

3EED: Ground Everything Everywhere in 3D

3EED: 在三维中万物皆 grounded

Rong Li, Yuhao Dong, Tianshuai Hu, Ao Liang, Youquan Liu, Dongyue Lu, Liang Pan, Lingdong Kong, Junwei Liang, Ziwei Liu

机构 * WorldBench Team(WorldBench团队)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 3EED提出一个大规模多平台多模态三维 grounding 基准测试,通过提供丰富的户外场景数据和跨平台学习技术,推动语言驱动的三维具身感知研究。

Comments NeurIPS 2025 DB Track; 38 pages, 17 figures, 10 tables; Project Page at https://project-3eed.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00259 2025-12-02 cs.NI 67%

Design and Evaluation of a Multi-Agent Perception System for Autonomous Flying Networks

自主飞行网络多智能体感知系统的設計與評估

Diogo Ferreira, Pedro Ribeiro, André Coelho, Rui Campos

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract)

AI总结 本文提出多智能体感知系统MAPS,利用多模态大语言模型和代理AI,实现自主飞行网络中用户感知与服务需求的自动识别与规范生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07993 2025-12-02 cs.CV cs.AI eess.IV q-bio.NC 62%

Multigranular Evaluation for Brain Visual Decoding

多粒度评估用于脑视觉解码

Weihao Xia, Cengiz Oztireli

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出BASIC框架,通过多粒度评估方法提升脑视觉解码的评估精度与解释性。

Comments AAAI 2026 (Oral). Code: https://github.com/weihaox/BASIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00287 2025-12-02 cs.RO cs.AI cs.CV 62%

RealAppliance: Let High-fidelity Appliance Assets Controllable and Workable as Aligned Real Manuals

RealAppliance: 让高保真家电资产可控且可操作,如对齐的现实手册

Yuzheng Gao, Yuxing Long, Lei Kang, Yuchong Guo, Ziyan Yu, Shangqing Mao, Jiyao Zhang, Ruihai Wu, Dongjiang Li, Hui Shen, Hao Dong

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 RealAppliance通过高保真家电资产和对齐手册的基准测试,推动家电操控技术的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01989 2025-12-02 cs.CV 57%

PAI-Bench: A Comprehensive Benchmark For Physical AI

PAI-Bench: 一个全面的物理AI基准

Fengzhe Zhou, Jiannan Huang, Jialuo Li, Deva Ramanan, Humphrey Shi

机构 * Georgia Tech(佐治亚理工学院) CMU(卡内基梅隆大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 PAI-Bench通过评估视频生成和理解任务,揭示了当前模型在物理合理性和动态一致性上的不足,为物理AI的发展指明了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01771 2025-12-02 cs.CV 57%

Robust Rigid and Non-Rigid Medical Image Registration Using Learnable Edge Kernels

鲁棒的刚性与非刚性医学图像配准使用可学习边缘核

Ahsan Raza Siyal, Markus Haltmeier, Ruth Steiger, Malik Galijasevic, Elke Ruth Gizewski, Astrid Ellen Grams

机构 * Department of Mathematics, University of Innsbruck(因斯布鲁克大学数学系) Department of Radiology, Medical University of Innsbruck(因斯布鲁克医学大学放射学系) Neuroimaging Research Core Facility, Medical University of Innsbruck(因斯布鲁克医学大学神经影像研究核心设施)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种结合可学习边缘核的刚性和非刚性医学图像配准方法,通过自适应边缘检测提升多模态图像对齐和解剖结构分析的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01352 2025-12-02 cs.CV 57%

OpenBox: Annotate Any Bounding Boxes in 3D

OpenBox: 任意3D边界框的标注

In-Jae Lee, Mungyeom Kim, Kwonyoung Ryu, Pierre Musacchio, Jaesik Park

机构 * Seoul National University(首尔国立大学) POSTECH

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 OpenBox通过2D视觉基础模型实现无需自我训练的高质量3D边界框标注,提升自动驾驶中物体检测的准确性和效率。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01340 2025-12-02 cs.CV 57%

EvalTalker: Learning to Evaluate Real-Portrait-Driven Multi-Subject Talking Humans

EvalTalker: 学习评估基于真实人像的多主体说话人类

Yingjie Zhou, Xilei Zhu, Siyu Ren, Ziyi Zhao, Ziwen Wang, Farong Wen, Yu Zhou, Jiezhang Cao, Xiongkuo Min, Fengjiao Chen, Xiaoyu Li, Xuezhi Cao, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 EvalTalker通过构建大规模多Talker生成的说话人类质量评估数据集,提出了一种能够感知整体质量、人类特征和身份一致性的新型质量评估框架,以提升多主体说话人类生成的质量和用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01077 2025-12-02 cs.CL cs.HC 57%

ELR-1000: A Community-Generated Dataset for Endangered Indic Indigenous Languages

ELR-1000:一个社区生成的濒危印度-原住民语言数据集

Neha Joshi, Pamir Gogoi, Aasim Mirza, Aayush Jansari, Aditya Yadavalli, Ayushi Pandey, Arunima Shukla, Deepthi Sudharsan, Kalika Bali, Vivek Seshadri

机构 * Karya UC San Diego Microsoft Corporation(微软公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 ELR-1000数据集通过众包方式收集10种濒危印度-原住民语言的传统食谱,评估LLMs翻译表现,发现提供文化背景信息可显著提升翻译质量,推动公平的文化敏感语言技术发展。

Comments Accepted at AACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01009 2025-12-02 cs.RO cs.CV 57%

FOM-Nav: Frontier-Object Maps for Object Goal Navigation

FOM-Nav:用于目标导航的前沿-对象地图

Thomas Chabal, Shizhe Chen, Jean Ponce, Cordelia Schmid

机构 * Inria(法国国家信息与自动化技术研究院) Department of Computer Science, École normale supérieure (ENS-PSL, CNRS, Inria)(高等师范学院计算机科学系) Courant Institute of Mathematical Sciences and Center for Data Science, New York University(纽约大学Courant数学科学研究所和数据科学中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 FOM-Nav通过前沿-对象地图和视觉-语言模型提升机器人在未知环境中的目标导航效率,实现最先进的导航性能。

Comments Project page: https://www.di.ens.fr/willow/research/fom-nav/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23594 2025-12-02 cs.CV 57%

PRISM-Bench: A Benchmark of Puzzle-Based Visual Tasks with CoT Error Detection

PRISM-Bench: 一个包含推理错误检测的基于谜题的视觉任务基准

Yusu Qian, Cheng Wan, Chao Jia, Yinfei Yang, Qingyu Zhao, Zhe Gan

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 PRISM-Bench通过检测推理错误评估多模态模型的视觉推理能力,揭示了流畅生成与忠实推理之间的差距。

Comments This paper's first error detection task's ground truth data contains hallucination introduced by gpt and needs to be withdrawn

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00305 2025-12-02 cs.AI 57%

ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning

ChartPoint: 通过 grounding 反射引导 MLLMs 进行图表推理

Zhengzhuo Xu, SiNan Du, Yiyan Qi, SiwenLu, Chengjin Xu, Chun Yuan, Jian Guo

机构 * Tsinghua University(清华大学) International Digital Economy Academy(国际数字经济学院) Beihang University(北航) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 ChartPoint通过引入 grounding 反射机制,提升 MLLMs 在图表推理中的表现,开发了两个指令微调模型,在多个图表基准上取得显著提升。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17808 2025-12-02 cs.LG 50%

Remote Sensing-Oriented World Model

面向遥感的世界模型

Yuxi Lu, Biao Wu, Zhidong Li, Kunqi Li, Chenya Huang, Huacan Wang, Qizhen Lan, Ronghao Chen, Ling Chen, Bin Liang

机构 * University of Technology Sydney (UTS)(悉尼技术大学) University of Chinese Academy of Sciences (UCAS)(中国科学院大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Peking University(北京大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出首个面向遥感的世界模型框架,通过RemoteBAGEL模型在RSWISE基准上实现空间推理的高效外推。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏