arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-26 至 2025-11-26 共收录 20 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 20 篇

2511.20422 2025-11-26 cs.AI cs.CV cs.GR cs.RO 84%

VibraVerse: A Large-Scale Geometry-Acoustics Alignment Dataset for Physically-Consistent Multimodal Learning

VibraVerse: 一个大规模的几何-声学对齐数据集,用于物理一致的多模态学习

Bo Pang, Chenxi Xu, Jierui Ren, Guoping Wang, Sheng Li

机构 * Peking University(北京大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 VibraVerse通过构建几何-声学对齐数据集,实现了物理一致的多模态学习,支持几何到声音预测、声音引导的形状重建等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20490 2025-11-26 cs.LG cs.AI 83%

MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology

MTBBench: 一个用于肿瘤学的多模态序列临床决策制定基准

Kiril Vasilev, Alexandre Misrahi, Eeshaan Jain, Phil F Cheng, Petros Liakopoulos, Olivier Michielin, Michael Moor, Charlotte Bunne

机构 * ETH Zürich(苏黎世联邦理工学院) EPFL(洛桑联邦理工学院) HUG

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 MTBBench通过模拟分子肿瘤委员会的决策流程,提出一个多模态、纵向的肿瘤学基准测试,评估LLMs在复杂临床任务中的表现并提升其推理与可靠性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19537 2025-11-26 cs.CV cs.AI cs.LG eess.IV 81%

Cross-Domain Generalization of Multimodal LLMs for Global Photovoltaic Assessment

多领域泛化用于全球光伏评估的多模态大语言模型

Muhao Guo, Yang Weng

机构 * School of Electrical, Computer and Energy Engineering(电气、计算机与能源工程学院) Arizona State University(亚利桑那州立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出利用多模态大语言模型实现跨领域泛化,用于全球光伏评估,通过结构化提示和微调在统一框架内整合检测、定位和量化,优于传统CV和Transformer基线。

Comments 5 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19470 2025-11-26 cs.LG cs.AI cs.CL 81%

Quantifying Modality Contributions via Disentangling Multimodal Representations

通过解构多模态表示量化模态贡献

Padegal Amit, Omkar Mahesh Kashyap, Namitha Rayasam, Nidhi Shekhar, Surabhi Narayan

机构 * PES University(PES大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于部分信息分解的框架,通过分解多模态表示中的预测信息,量化各模态的贡献,提供更清晰的多模态行为分析。

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19830 2025-11-26 cs.DB cs.AI 79%

Beyond Relational: Semantic-Aware Multi-Modal Analytics with LLM-Native Query Optimization

超越关系:基于语义的多模态分析与LLM原生查询优化

Junhao Zhu, Lu Chen, Xiangyu Ke, Ziquan Fang, Tianyi Li, Yunjun Gao, Christian S. Jensen

机构 * Zhejiang University(浙江大学) Aalborg University(奥胡斯大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 Nirvana通过结合可编程语义运算符和LLM原生查询优化,实现多模态数据分析,显著提升效率和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19667 2025-11-26 cs.CV 79%

OncoVision: Integrating Mammography and Clinical Data through Attention-Driven Multimodal AI for Enhanced Breast Cancer Diagnosis

OncoVision:通过注意力驱动的多模态AI整合乳腺X线和临床数据以提升乳腺癌诊断

Istiak Ahmed, Galib Ahmed, K. Shahriar Sanjid, Md. Tanzim Hossain, Md. Nishan Khan, Md. Misbah Khan, Md. Arifur Rahman, Sheikh Anisul Haque, Sharmin Akhtar Rupa, Mohammed Mejbahuddin Mia, Mahmud Hasan Mostofa Kamal, Md. Mostafa Kamal Sarker, M. Monir Uddin

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 OncoVision通过注意力驱动的多模态AI整合乳腺X线和临床数据,提升乳腺癌诊断的准确性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10068 2025-11-26 cs.CV 79%

Probabilistic Hyper-Graphs using Multiple Randomly Masked Autoencoders for Semi-supervised Multi-modal Multi-task Learning

基于多随机掩码自编码器的概率超图用于半监督多模态多任务学习

Pîrvu Mihai-Cristian, Marius Leordeanu

机构 * Faculty of Automatic Control and Computer Science, Politehnica University of Bucharest(自动化控制与计算机科学系,布加勒斯特理工大学) Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出PHG-MAE模型,结合神经图和掩码自编码器,通过随机掩码多模态数据提升多任务学习性能,并公开了相关工具和数据集。

Comments Submitted to Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15509 2025-11-26 eess.IV 78%

Multimodal Optical Imaging Platform for Quantitative Burn Assessment

多模光学成像平台用于定量烧伤评估

Nathaniel Hanson, Mateusz Wolak, Jonathan Richardson, Patrick Walker, David M. Burmeister, Chakameh Jafari

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出了一种多模光学成像平台,结合高光谱成像与激光散斑成像,用于快速准确评估烧伤严重程度,适用于战场等恶劣环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19836 2025-11-26 cs.CV 77%

4DWorldBench: A Comprehensive Evaluation Framework for 3D/4D World Generation Models

4DWorldBench: 一种用于3D/4D世界生成模型的综合评估框架

Yiting Lu, Wei Luo, Peiyan Tu, Haoran Li, Hanxin Zhu, Zihao Yu, Xingrui Wang, Xinyi Chen, Xinge Peng, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Beijing Zhongguancun Academy(北京中关村学院)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 4DWorldBench提出了一种用于评估3D/4D世界生成模型的综合框架,通过四个维度评估模型的感知质量、条件对齐、物理真实性和一致性,支持多模态输入并整合多种评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15947 2025-11-26 q-bio.QM cs.LG 71%

Mamba-based Deep Learning Approach for Sleep Staging on a Wireless Multimodal Wearable System without Electroencephalography

基于Mamba的深度学习方法用于无线多模态可穿戴系统中的睡眠分期(无脑电图)

Andrew H. Zhang, Alex He-Mo, Richard Fei Yin, Chunlin Li, Yuzhi Tang, Dharmendra Gurve, Veronique van der Horst, Aron S. Buchman, Nasim Montazeri Ghahjaverestan, Maged Goubran, Bo Wang, Andrew S. P. Lim

专题命中 多模态评测 :multimodal(title)

AI总结 本文提出基于Mamba的深度学习方法,用于无脑电图的无线多模态可穿戴系统中实现睡眠分期,通过整合多种生物信号提升睡眠阶段识别的准确性。

Comments 40 pages, 24 figures. Authors Andrew H. Zhang, Alex He-Mo, and Richard Fei Yin contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19988 2025-11-26 cs.CV 70%

GazeProphetV2: Head-Movement-Based Gaze Prediction Enabling Efficient Foveated Rendering on Mobile VR

GazeProphetV2:基于头部运动的注视预测,实现移动VR中的高效视网膜渲染

Farhaan Ebadulla, Chiraag Mudlpaur, Shreya Chaurasia, Gaurav BV

机构 * PES University(PES大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 GazeProphetV2通过结合头部运动和视觉信息,提升移动VR中的注视预测准确性,为高效视网膜渲染和用户体验优化提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20650 2025-11-26 cs.CV cs.AI 62%

MedROV: Towards Real-Time Open-Vocabulary Detection Across Diverse Medical Imaging Modalities

MedROV:面向跨多种医学影像模态的实时开放词汇检测

Tooba Tehreem Sheikh, Jean Lahoud, Rao Muhammad Anwer, Fahad Shahbaz Khan, Salman Khan, Hisham Cholakkal

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MedROV是首个实时开放词汇医学影像检测模型,通过大规模数据集和伪标签策略提升检测性能,实现40 mAP50的提升并达到70 FPS的实时处理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20116 2025-11-26 cs.CV cs.AI 62%

LungEvaty: A Scalable, Open-Source Transformer-based Deep Learning Model for Lung Cancer Risk Prediction in LDCT Screening

LungEvaty: 一种可扩展、开源的基于Transformer的深度学习模型,用于LDCT筛查中的肺癌风险预测

Johannes Brandt, Maulik Chevli, Rickmer Braren, Georgios Kaissis, Philip Müller, Daniel Rueckert

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) TUM University Hospital(慕尼黑技术大学医院) Imperial College London(伦敦帝国学院) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 LungEvaty是一种基于Transformer的深度学习模型,利用LDCT扫描预测肺癌风险,通过全肺输入和解剖学指导注意力实现高效且准确的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19684 2025-11-26 cs.CV cs.AI cs.HC cs.RO 62%

IndEgo: A Dataset of Industrial Scenarios and Collaborative Work for Egocentric Assistants

IndEgo:工业场景及协作工作的人际助理数据集

Vivek Chavan, Yasmina Imgrund, Tung Dao, Sanwantri Bai, Bosong Wang, Ze Lu, Oliver Heimann, Jörg Krüger

机构 * Fraunhofer IPK(弗劳恩霍夫研究所) Technical University of Berlin(柏林技术大学) University of Tübingen(图宾根大学) RWTH Aachen University(亚琛工业大学) Leibniz University Hannover(汉诺威莱布尼茨大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 IndEgo数据集旨在通过工业场景中的协作工作提升人机交互助理的多模态理解与错误检测能力。

Comments Accepted to NeurIPS 2025 D&B Track. Project Page: https://indego-dataset.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10979 2025-11-26 cs.CV cs.AI 62%

VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?

VidComposition: MLLMs能否分析编译视频中的构成?

Yolo Y. Tang, Junjia Guo, Hang Hua, Susan Liang, Mingqian Feng, Xinyang Li, Rui Mao, Chao Huang, Jing Bi, Zeliang Zhang, Pooyan Fazli, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Arizona State University(亚利桑那州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VidComposition通过编排视频和电影级注释评估MLLMs对视频构成的理解能力,揭示了当前模型在复杂编译视频分析中的局限性。

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20573 2025-11-26 cs.CV 57%

VQ-VA World: Towards High-Quality Visual Question-Visual Answering

VQ-VA世界:迈向高质量的视觉问题-视觉回答

Chenhui Gou, Zilong Chen, Zeyu Wang, Feng Li, Deyao Zhu, Zicheng Duan, Kunchang Li, Chaorui Deng, Hongyi Yuan, Haoqi Fan, Cihang Xie, Jianfei Cai, Hamid Rezatofighi

专题命中 多模态评测 :image-text(abstract);分类 cs.CV

AI总结 VQ-VA World通过大规模数据构建框架提升开源模型的视觉问题-视觉回答能力,实现性能超越现有开源基线并接近专有系统水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20169 2025-11-26 cs.CV 57%

ADNet: A Large-Scale and Extensible Multi-Domain Benchmark for Anomaly Detection Across 380 Real-World Categories

ADNet: 一个大规模且可扩展的多领域异常检测基准,涵盖380个现实世界类别

Hai Ling, Jia Guo, Zhulin Tao, Yunkang Cao, Donglin Di, Hongyan Xu, Xiu Su, Yang Song, Lei Fan

机构 * Communication University of China(中国通信大学) DZ Matrix(DZ矩阵) Tsinghua University(清华大学) Hunan University(湖南大学) Central South University(中南大学) UNSW Sydney(新南威尔士大学悉尼分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 ADNet是一个大规模多领域异常检测基准,涵盖380个现实世界类别,通过多模态数据支持异常检测研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10007 2025-11-26 cs.AI 57%

Deep Hidden Cognition Facilitates Reliable Chain-of-Thought Reasoning

深度隐式认知促进可靠推理链推理

Zijun Chen, Wenbo Hu, Richang Hong

机构 * Zijun Chen, Wenbo Hu, Richang Hong Corresponding Author(对应作者)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出利用模型内在真实性编码提升CoT推理的可靠性,通过置信度预测器和束搜索优化推理路径,显著提高数学、符号和常识推理任务的准确性和可靠性。

Comments This paper has been accepted by AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16383 2025-11-26 cs.CL 57%

Large Language Models in Argument Mining: A Survey

大型语言模型在论证挖掘中的应用:综述

Hao Li, Viktor Schlegel, Yizheng Sun, Riza Batista-Navarro, Goran Nenadic

机构 * University of Manchester(曼彻斯特大学) Imperial College London(伦敦帝国学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型对论证挖掘领域的影响,分析了LLM如何改变任务设计、数据集构建和评估方法,并提出了未来研究方向。

Comments Work draft

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20426 2025-11-26 cs.CV 57%

MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness

MMPerspective: 多模态大语言模型是否理解视角?一个全面的视角感知、推理和鲁棒性评估基准

Yolo Y. Tang, Pinxin Liu, Zhangyun Tan, Mingqian Feng, Rui Mao, Chao Huang, Jing Bi, Yunzhong Xiao, Susan Liang, Hang Hua, Ali Vosoughi, Luchuan Song, Zeliang Zhang, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 MMPerspective通过10个任务评估多模态大语言模型在视角感知、推理和鲁棒性方面的能力,揭示其在空间一致性维持和组合推理上的局限性。

Comments Accepted to NeurIPS 2025 DB Track. Rating: 5,5,5,5

详情

展开后加载摘要…

URL PDF HTML 收藏