arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-23 至 2026-01-23 共收录 50 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 10 篇

2601.15406 2026-01-23 cs.CV 79%

Evaluating Multimodal Large Language Models for Heterogeneous Face Recognition

评估多模态大语言模型用于异构人脸识别

Hatef Otroshi Shahreza, Anjith George, Sébastien Marcel

机构 * Idiap Research Institute(日内瓦研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文评估了多模态大语言模型在异构人脸识别中的性能,发现其在跨模态条件下表现欠佳,凸显了当前模型的局限性及生物识别评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05577 2026-01-23 cs.LG cs.AI 79%

PyTDC: A multimodal machine learning training, evaluation, and inference platform for biomedical foundation models

PyTDC: 一种用于生物医学基础模型的多模态机器学习训练、评估和推理平台

Alejandro Velez-Arce, Jesus Caraballo, Marinka Zitnik

机构 * arcellai(ArcellAI公司) calculus(The Residency公司) mit(麻省理工学院) hms(哈佛医学院生物医学信息学系) broad(MIT与哈佛大学Broad研究所) harvard-ds(哈佛大学数据科学倡议) kempner(哈佛大学Kempner研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 PyTDC是一种多模态机器学习平台,旨在提升生物医学基础模型的训练、评估和推理能力,通过统一数据源和模型权重,促进多模态、上下文感知的研究。

Comments Proceedings of the 42nd International Conference on Machine Learning, Vancouver, Canada. PMLR 267, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11558 2026-01-23 cs.DB 78%

Bridging Radiology and Pathology: A DICOM-Based Framework for Multimodal Mapping and Integrated Visualization

连接放射学与病理科:基于DICOM的多模态映射与集成可视化框架

Nilesh P. Rijhwani, Titus J. Brinker, Peter Neher, Marco Nolden, Klaus Maier-Hein, Maximilian Fischer, Christoph Wies

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本研究提出一种基于DICOM的跨学科工具,通过多模态映射和集成可视化,促进放射学与病理科的协同分析与研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18457 2026-01-23 cs.LG cs.CV 74%

Radiation-Preserving Selective Imaging for Pediatric Hip Dysplasia: A Cross-Modal Ultrasound-Xray Policy with Limited Labels

辐射保护的儿童髋关节发育不良选择性成像:一种跨模态超声-X射线策略(有限标注)

Duncan Stothers, Ben Stothers, Emily Schaeffer, Kishore Mulpuri

专题命中 多模态评测 :cross-modal(title);分类 cs.CV

AI总结 本文提出了一种跨模态超声-X光策略,通过有限标注实现儿童髋关节发育不良的可解释测量和选择性成像。

Comments Accepted (with oral presentation) to the AAAI 2026 AI for Medicine and Healthcare Bridge Program Awarded Best Paper Runner-Up at the AAAI 2026 AI for Medicine and Healthcare Bridge Program

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15711 2026-01-23 cs.CV 57%

Zero-Shot Product Attribute Labeling with Vision-Language Models: A Three-Tier Evaluation Framework

基于视觉-语言模型的零样本产品属性标注:一种三级评估框架

Shubham Shukla, Kunal Sonalkar

机构 * Nordstrom(诺德斯特拉姆)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种三级评估框架,评估视觉-语言模型在多属性服装任务中的零样本属性标注性能,发现高效模型在成本较低时能实现接近旗舰级性能,揭示了属性适用性检测是关键瓶颈。

Comments Accepted to WACV 2026 Workshop on Physical Retail AI (PRAW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15385 2026-01-23 cs.HC cs.CL 57%

VegaChat: A Robust Framework for LLM-Based Chart Generation and Assessment

VegaChat: 一种基于大语言模型的图表生成与评估稳健框架

Marko Hostnik, Rauf Kurbanov, Yaroslav Sokolov, Artem Trofimov

机构 * JetBrains

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 VegaChat通过引入Spec Score和Vision Score两个指标,解决了LLM基于自然语言生成可视化中的评估难题,实现了高准确率的图表生成与评估。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15211 2026-01-23 cs.AI stat.AP 57%

Embracing Ambiguity: Bayesian Nonparametrics and Stakeholder Participation for Ambiguity-Aware Safety Evaluation

拥抱模糊性:基于贝叶斯非参数方法和利益相关者参与的模糊性感知安全评估

Yanan Long

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出了一种基于贝叶斯非参数方法和利益相关者参与的框架,用于模糊性感知的安全评估,通过量化尾部风险和整合利益相关者偏好提升生成模型的可信度。

Comments AAAI 2026 workshop MURE

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 2 篇

2601.01910 2026-01-23 cs.AI 79%

MMP-A*: Multimodal Perception Enhanced Incremental Heuristic Search on Path Planning

MMP-A*:多模态感知增强的路径规划增量启发式搜索

Minh Hieu Ha, Khanh Ly Ta, Hung Phan, Tung Doan, Tung Dao, Dao Tran, Huynh Thi Thanh Binh

机构 * Hanoi University of Science and Technology(河内科学技术大学) Vingroup Big Data Research Center(VinGroup大数据研究中心) FPT Software AI Center(FPT软件AI中心)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 MMP-A*通过融合视觉语言模型的空间感知与自适应衰减机制,提升路径规划的几何精度与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14274 2026-01-23 cs.CV cs.LG math.AT 57%

TUN: Detecting Significant Points in Persistence Diagrams with Deep Learning

TUN:利用深度学习在持续图中检测显著点

Yu Chen, Hongwei Lin

机构 * School of Mathematical Sciences Zhejiang University Hangzhou, China(数学科学学院 浙江大学 杭州, 中国)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 TUN通过深度学习方法在持续图中自动检测显著点,提升拓扑数据分析的实用性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 5 篇

2601.15316 2026-01-23 cs.AI cs.CV 84%

The Paradigm Shift: A Comprehensive Survey on Large Vision Language Models for Multimodal Fake News Detection

范式转变:大型视觉语言模型在多模态虚假新闻检测中的全面调查

Wei Ai, Yilong Tan, Yuntao Shou, Tao Meng, Haowen Chen, Zhixiong He, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(计算机与数学学院,中央南大学林业科技学院) College of Computer Science and Electronic Engineering, Hunan University(计算机科学与电子工程学院,湖南大学) College of Economics and Management, Central South University of Forestry and Technology(经济管理学院,中央南大学林业科技学院) Department of Computer Science, State University of New York(计算机科学系,纽约州立大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过大型视觉语言模型全面调查多模态虚假新闻检测,分析其发展历程、技术挑战及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15734 2026-01-23 cs.CV 79%

Sub-Region-Aware Modality Fusion and Adaptive Prompting for Multi-Modal Brain Tumor Segmentation

子区域感知模态融合与自适应提示的多模态脑肿瘤分割

Shadi Alijani, Fereshteh Aghaee Meibodi, Homayoun Najjaran

机构 * University of Victoria, BC, Canada(维多利亚大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出子区域感知模态融合与自适应提示方法,提升多模态脑肿瘤分割的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15390 2026-01-23 cs.LG 78%

FedUMM: A General Framework for Federated Learning with Unified Multimodal Models

FedUMM: 一种统一多模态模型的联邦学习通用框架

Zhaolong Su, Leheng Zhao, Xiaoying Wu, Ziyue Xu, Jindong Wang

机构 * NVIDIA

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 FedUMM提出了一种低通信成本的联邦学习框架,用于训练统一多模态模型,通过参数高效微调实现客户端和服务器的高效协作,提升了隐私保护下的多模态模型训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16009 2026-01-23 cs.SE 50%

The Role of Cognitive Abilities in Requirements Inspection: Comparing UML and Textual Representations

认知能力在需求检查中的作用:比较UML和文本表示

Giovanna Broccia, Sira Vegas, Alessio Ferrari

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本研究比较UML和文本表示在需求检查中的效果,发现认知能力影响UML辅助检查的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15786 2026-01-23 cs.CE 50%

Endowing Molecular Language with Geometry Perception via Modality Compensation for High-Throughput Quantum Hamiltonian Prediction

通过模态补偿赋予分子语言几何感知能力以实现高通量量子哈密顿量预测

Zhenzhong Wang, Yongjie Hou, Chenggong Huang, Yuxuan Du, Dacheng Tao, Min Jiang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 通过模态补偿赋予分子语言几何感知能力,利用 SMILES 实现高通量量子哈密顿量预测,提高计算效率与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 6 篇

2405.10739 2026-01-23 cs.CV cs.AI 84%

Efficient Multimodal Large Language Models: A Survey

高效多模态大语言模型:综述

Yizhang Jin, Jian Li, Yexin Liu, Tianjun Gu, Kai Wu, Zhengkai Jiang, Muyang He, Bo Zhao, Xin Tan, Zhenye Gan, Yabiao Wang, Chengjie Wang, Lizhuang Ma

机构 * Youtu Lab, Tencent(腾讯优图实验室) SJTU(上海交通大学) BAAI(北京人工智能研究院) ECNU(华东师范大学)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了高效多模态大语言模型的发展现状,探讨了其高效结构、策略及应用,并展望了未来研究方向。

Comments Accepted by Visual Intelligence

Journal ref Visual Intelligence, Volume 3, article number 27, (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11304 2026-01-23 cs.AI cs.CL cs.CV 82%

Leveraging Multimodal-LLMs Assisted by Instance Segmentation for Intelligent Traffic Monitoring

利用实例分割辅助的多模态大语言模型进行智能交通监控

Murat Arda Onsu, Poonam Lohan, Burak Kantarci, Aisha Syed, Matthew Andrews, Sean Kennedy

机构 * University of Ottawa(渥太华大学) Nokia Bell Labs(诺基亚贝尔实验室)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文利用多模态大语言模型和实例分割技术,实现高准确率的交通监控系统,提升交通管理效率和安全性。

Comments 6 pages, 7 figures, submitted to 30th IEEE International Symposium on Computers and Communications (ISCC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15947 2026-01-23 physics.med-ph physics.app-ph physics.bio-ph physics.ins-det physics.optics 78%

Multimodal Imaging System Combining Hyperspectral and Laser Speckle Imaging for In Vivo Hemodynamic and Metabolic Monitoring

多模态成像系统:结合超光谱成像与激光散斑成像用于活体血流和代谢监测

Junda Wang, Luca Giannoni, Ayse Gertrude Yenicelik, Eleni Giama, Frederic Lange, Kenneth J. Smith, Ilias Tachtsidis

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本研究提出了一种结合超光谱和激光散斑成像的多模态成像系统,用于实时监测活体组织的血流和代谢状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15347 2026-01-23 cs.AI cs.CL cs.LG 62%

Logic Programming on Knowledge Graph Networks And its Application in Medical Domain

知识图谱网络上的逻辑编程及其在医疗领域的应用

Chuanqing Wang, Zhenmin Zhao, Shanshan Du, Chaoqun Fei, Songmao Zhang, Ruqian Lu

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出知识图谱网络的系统理论与技术,探讨其在医疗领域的应用,通过多条件下的实验验证创新方法。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14625 2026-01-23 cs.CR cs.AI 57%

VTarbel: Targeted Label Attack with Minimal Knowledge on Detector-enhanced Vertical Federated Learning

VTarbel:基于最小知识的目标标签攻击与增强垂直联邦学习

Juntao Tan, Anran Li, Quanchao Liu, Peng Ran, Lan Zhang

机构 * University of Science and Technology of China(科学技术大学) Department of Security Technology Research, China Mobile Research Institute(安全技术研究所)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 VTarbel是一种针对增强垂直联邦学习的最小知识目标标签攻击框架,通过两阶段方法规避检测并有效诱导误分类。

Comments Accepted by ACM Transactions on Sensor Networks (TOSN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15716 2026-01-23 cs.CE cs.CR 50%

zkFinGPT: Zero-Knowledge Proofs for Financial Generative Pre-trained Transformers

zkFinGPT: 用于金融生成预训练变换器的零知识证明

Xiao-Yang Liu, Ningjie Li, Keyi Wang, Xiaoli Zhi, Weiqin Tong

专题命中 其他多模态 :multimodal(abstract)

AI总结 zkFinGPT通过零知识证明技术,在保护数据隐私的同时验证金融生成预训练变换器的合法性与可信度,但其较高的计算开销限制了实际应用。

详情

展开后加载摘要…

URL PDF HTML 收藏