arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-28 至 2026-01-28 共收录 16 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 16 篇

2512.14961 2026-01-28 cs.CV cs.SD eess.AS eess.IV 84%

Adaptive Multimodal Person Recognition: A Robust Framework for Handling Missing Modalities

自适应多模态人物识别:一种处理缺失模态的稳健框架

Aref Farhadipour, Teodora Vukovic, Volker Dellwo, Petr Motlicek, Srikanth Madikeri

机构 * Department of Computational Linguistics, University of Zurich(苏黎世大学计算语言学系) Faculty of Information Technology, Brno University of Technology(布拉格技术大学信息学院) Idiap Research Institute(Idiap研究机构)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、eess.AS

AI总结 本文提出一种自适应多模态人物识别框架,通过融合上半身运动、面孔和语音信息,提升在缺失模态下的识别准确率,达到99.51%的Top-1准确率。

Comments 9 pages and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07295 2026-01-28 cs.CL 83%

CCFQA: A Benchmark for Cross-Lingual and Cross-Modal Speech and Text Factuality Evaluation

CCFQA:跨语言和跨模态语音与文本事实性评估基准

Yexing Du, Kaiyuan Liu, Youcheng Pan, Zheng Chu, Bo Yang, Xiaocheng Feng, Ming Liu, Yang Xiang

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 CCFQA是一个用于评估多模态大语言模型跨语言和跨模态事实性能力的基准,通过少样本迁移学习策略在多语言语音问答任务中取得与GPT-4o-mini-Audio相当的性能。

Comments Accepted in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19702 2026-01-28 eess.AS cs.AI 81%

SAM Audio Judge: A Unified Multimodal Framework for Perceptual Evaluation of Audio Separation

SAM音频裁判:一种用于音频分离感知评估的统一多模态框架

Helin Wang, Bowen Shi, Andros Tjandra, John Hoffman, Yi-Chiao Wu, Apoorv Vyas, Najim Dehak, Ann Lee, Wei-Ning Hsu

机构 * Johns Hopkins University(约翰霍普金斯大学) Meta

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI、eess.AS

AI总结 SAM Audio Judge 提出了一种多模态细粒度参考自由客观指标,用于评估音频分离的感知性能,支持多种音频领域和输入类型,具有高一致性与实际应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19898 2026-01-28 cs.CV 79%

DuwatBench: Bridging Language and Visual Heritage through an Arabic Calligraphy Benchmark for Multimodal Understanding

DuwatBench: 通过阿拉伯书法基准桥接语言与视觉遗产以实现多模态理解

Shubham Patle, Sara Ghaboura, Hania Tariq, Mohammad Usman Khan, Omkar Thawakar, Rao Muhammad Anwer, Salman Khan

机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) NUCES(努赛斯大学) NUST(努斯特大学) Australian National University(澳大利亚国立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 DuwatBench通过阿拉伯书法基准推动多模态研究,揭示多模态模型在处理书法变体和艺术扭曲时的局限性。

Comments Accepted to EACL-2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19557 2026-01-28 cs.CV cs.RO 79%

The S3LI Vulcano Dataset: A Dataset for Multi-Modal SLAM in Unstructured Planetary Environments

S3LI Vulcano数据集:用于无结构行星环境多模态SLAM的数据集

Riccardo Giubilato, Marcus Gerhard Müller, Marco Sewtz, Laura Alejandra Encinar Gonzalez, John Folkesson, Rudolph Triebel

机构 * German Aerospace Center (DLR) Institute of Robotics and Mechatronics(德国航空航天中心(DLR)机器人与机电研究所) KTH Royal Institute of Technology(皇家理工学院) Deptartment of Intelligent Systems(智能系统部门)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 S3LI Vulcano数据集为无结构行星环境中的多模态SLAM和场景识别算法提供多模态数据及开源工具支持。

Comments Accepted submission to the 2026 IEEE Aerospace Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19193 2026-01-28 cs.AI 79%

CoReTab: Improving Multimodal Table Understanding with Code-driven Reasoning

CoReTab:通过代码驱动推理提升多模态表格理解

Van-Quang Nguyen, Takayuki Okatani

机构 * RIKEN AIP(日本理化学研究所AIP) GSIS, Tohoku University/RIKEN AIP(东京东京大学GSIS/日本理化学研究所AIP)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 CoReTab通过代码驱动推理框架,提升多模态表格理解的准确性和可解释性,实现显著的性能提升。

Comments accepted to EACL'26 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17644 2026-01-28 cs.CR cs.AI 79%

A Systemic Evaluation of Multimodal RAG Privacy

多模态RAG隐私的系统评估

Ali Al-Lawati, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文系统评估了多模态RAG隐私风险,揭示了推理过程中可能泄露私有信息的问题,并呼吁开发隐私保护机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03660 2026-01-28 cs.CV 79%

MGPC: Multimodal Network for Generalizable Point Cloud Completion With Modality Dropout and Progressive Decoding

MGPC:多模态网络用于通用点云补全与模态丢弃和渐进解码

Jiangyuan Liu, Yuhao Zhao, Hongxuan Ma, Zhe Liu, Jian Wang, Wei Zou

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation of Chinese Academy of Sciences(中国科学院自动化研究所 multimodal 人工智能系统国家重点实验室) Chemical Defense Institute, Academy of Military Sciences(军事科学院化学防御研究院) Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation of Chinese Academy of Sciences(中国科学院自动化研究所 复杂系统认知与决策智能重点实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MGPC通过多模态融合和渐进生成提升点云补全的泛化能力,构建大规模基准并验证其在现实场景中的有效性。

Comments Code and dataset are available at https://github.com/L-J-Yuan/MGPC

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03785 2026-01-28 cs.LG cs.AI 79%

SoilNet: A Multimodal Multitask Model for Hierarchical Classification of Soil Horizons

SoilNet:一种用于土壤剖面层次分类的多模态多任务模型

Vipin Singh, Teodor Chiaburu, Einar Eberhardt, Stefan Broda, Joey Prüssing, Frank Haußer, Felix Bießmann

机构 * Einstein Center Digital Future(数字未来爱因斯坦中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 SoilNet通过多模态多任务模型解决土壤层次分类问题,结合图像数据和地理时间元数据,利用图结构表示实现复杂层次结构的准确分类。

Comments 29 pages, 9 figures, 7 tables

Journal ref Geoderma, Volume 466, 2026, 117684

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07559 2026-01-28 cs.LG cs.AI 79%

Zer0-Jack: A Memory-efficient Gradient-based Jailbreaking Method for Black-box Multi-modal Large Language Models

Zer0-Jack: 一种内存高效的基于梯度的对抗方法用于黑盒多模态大语言模型

Tiejin Chen, Kaishen Wang, Hua Wei

机构 * Arizona State University(亚利桑那州立大学) University of Maryland(马里兰大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 Zer0-Jack通过零阶优化实现高效黑盒对抗,显著降低内存使用并提升攻击成功率。

Comments Accepted to EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19198 2026-01-28 cs.IR 78%

Propagating Similarity, Mitigating Uncertainty: Similarity Propagation-enhanced Uncertainty for Multimodal Recommendation

传播相似性,缓解不确定性:多模态推荐的相似性传播增强不确定性

Xinzhuo Wu, Hongbo Wang, Yuan Lin, Kan Xu, Liang Yang, Hongfei Lin

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 SPUMR通过构建模态相似性图和协作相似性图,结合不确定性感知的偏好聚合模块,提升多模态推荐系统的特征融合和不确定性估计能力。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09497 2026-01-28 quant-ph 78%

Quantum mixture-density network for multimodal probabilistic prediction

量子混合密度网络用于多模概率预测

Jaemin Seo

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 量子混合密度网络通过参数化量子电路高效建模多模分布,在双缝实验和混沌分岔任务中优于经典方法,展现量子机器学习在概率回归中的优势。

Journal ref IEEE Access 13 (2025) 199317-199325

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19222 2026-01-28 cs.CV cs.AI 73%

UniPCB: A Unified Vision-Language Benchmark for Open-Ended PCB Quality Inspection

UniPCB: 一个统一的视觉-语言基准用于开放式PCB质量检测

Fuxiang Sun, Xi Jiang, Jiansheng Wu, Haigang Zhang, Feng Zheng, Jinfeng Yang

机构 * Shenzhen Polytechnic University(深圳职业技术大学) Southern University of Science and Technology(南方科技大学) University of Science and Technology Liaoning(辽宁科技大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 UniPCB提出一个统一的视觉-语言基准用于开放式PCB质量检测,通过系统化流程和PCB-GPT模型提升缺陷定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16435 2026-01-28 cs.CV cs.CL 62%

Human Cognitive Benchmarks Reveal Foundational Visual Gaps in MLLMs

人类认知基准揭示大规模多模态语言模型中的基础视觉缺陷

Jen-Tse Huang, Dasen Dai, Jen-Yuan Huang, Youliang Yuan, Xiaoyuan Liu, Wenxuan Wang, Wenxiang Jiao, Pinjia He, Zhaopeng Tu, Haodong Duan

机构 * CUHK(香港中文大学) PKU(北京大学) CUHKSZ(香港中文大学深圳分校) RUC(中国人民大学) Tencent(腾讯) SHLab(深圳实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 人类认知基准揭示大规模多模态语言模型在基础视觉能力上的不足,通过VisFactor评估发现模型在关键视觉任务上表现不佳。

Comments Update: Evaluated 23 SOTA MLLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19202 2026-01-28 cs.CL 57%

Do Images Speak Louder than Words? Investigating the Effect of Textual Misinformation in VLMs

图像胜过言语吗?探讨文本误导在VLMs中的影响

Chi Zhang, Wenxuan Ding, Jiale Liu, Mingrui Wu, Qingyun Wu, Ray Mooney

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Pennsylvania State University(宾夕法尼亚州立大学) New York University(纽约大学) University of Chinese Academy of Sciences(中国科学院大学) AG2ai, Inc.(AG2ai公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 研究探讨了文本误导对视觉-语言模型(VLMs)的影响,发现模型易受误导性文本提示影响,导致性能显著下降。

Comments 24 pages, 10 figures. Accepted at EACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19345 2026-01-28 cs.CR 50%

AI-driven Intrusion Detection for UAV in Smart Urban Ecosystems: A Comprehensive Survey

基于人工智能的无人机智能城市生态系统入侵检测:综述

Abdullah Khanfor, Raby Hamadi, Noureddine Lasla, Hakim Ghazzai

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文综述了无人机在智能城市中的应用及安全挑战,探讨了人工智能技术在入侵检测中的作用,并提出了十个关键研究方向。

Comments 68 pages, 13 figures, 6 tables, journal

详情

展开后加载摘要…

URL PDF HTML 收藏