arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-17 至 2025-12-17 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 9 篇

2412.07148 2025-12-17 cs.CV cs.AI cs.CL cs.LG 82%

MM-PoE: Multiple Choice Reasoning via. Process of Elimination using Multi-Modal Models

MM-PoE:通过多模态模型的排除过程进行多选推理

Sayak Chakrabarty, Souradip Pal

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MM-PoE通过多模态模型的排除过程提升视觉语言模型在多选推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13747 2025-12-17 cs.CV cs.AI 82%

Why Text Prevails: Vision May Undermine Multimodal Medical Decision Making

为何文本占上风:视觉可能损害多模态医疗决策制定

Siyuan Dai, Lunxiao Li, Kun Zhao, Eardi Lila, Paul K. Crane, Heng Huang, Dongkuan Xu, Haoteng Tang, Liang Zhan

机构 * University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷大学) University of Pittsburgh(匹兹堡大学) NC State University(北卡罗来纳州立大学) University of Washington(华盛顿大学) University of Maryland(马里兰大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究发现文本推理在医疗多模态决策中优于多模态输入,提出三种策略以提升多模态医疗决策能力。

Comments Accepted by ICDM 2025 the Workshop on Synergy of AI and Multimodal Biomedical Data Mining

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14050 2025-12-17 cs.CV 70%

SELECT: Detecting Label Errors in Real-world Scene Text Data

SELECT:在现实世界场景文本数据中检测标签错误

Wenjun Liu, Qian Wu, Yifeng Hu, Yuke Li

机构 * Yidun AI Lab, NetEase(网易异度人工智能实验室)

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 SELECT通过多模态训练和SSLC方法有效检测现实世界场景文本数据中的标签错误,提升文本识别准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20047 2025-12-17 cs.CV eess.IV 70%

Med3DVLM: An Efficient Vision-Language Model for 3D Medical Image Analysis

Med3DVLM: 一种高效的视觉-语言模型用于3D医学图像分析

Yu Xin, Gorkem Can Ates, Kuang Gong, Wei Shao

机构 * University of Florida(佛罗里达大学)

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 Med3DVLM通过三个创新提出,实现了高效的3D医学图像分析,显著提升了图像-文本检索、报告生成和视觉问答的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14480 2025-12-17 cs.CV 57%

SuperCLIP: CLIP with Simple Classification Supervision

SuperCLIP:带有简单分类监督的CLIP

Weiheng Zhao, Zilong Huang, Jiashi Feng, Xinggang Wang

机构 * School of EIC, Huazhong University of Science and Technology(华中科技大学电子与信息学院) ByteDance(字节跳动)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 SuperCLIP通过添加轻量级分类监督提升CLIP的细粒度视觉-文本对齐能力,有效提升零样本分类和检索性能。

Comments Accepted by NeurIPS 2025. Code: https://github.com/hustvl/SuperCLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14137 2025-12-17 cs.CV 57%

Erasing CLIP Memories: Non-Destructive, Data-Free Zero-Shot class Unlearning in CLIP Models

擦除CLIP记忆:非破坏性、无数据零样本类去学习在CLIP模型中

Ashish Mishra, Tarun Kumar, Gyanaranjan Nayak, Arpit Shah, Suparna Bhattacharya, Martin Foltin

机构 * Hewlett Packard Labs(惠普实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于空空间投影的非破坏性零样本类去学习方法,有效降低CLIP模型中目标类别的性能,同时保留整体多模态知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14113 2025-12-17 cs.CV 57%

Selective, Controlled and Domain-Agnostic Unlearning in Pretrained CLIP: A Training- and Data-Free Approach

选择性、可控性和领域无关的预训练CLIP模型去学习:一种无需训练和数据的方法

Ashish Mishra, Gyanaranjan Nayak, Tarun Kumar, Arpit Shah, Suparna Bhattacharya, Martin Foltin

机构 * Hewlett Packard Labs(惠普实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种无需训练和数据的CLIP去学习方法,能够实现选择性、可控性和领域无关的模型遗忘,提升模型在不同任务上的适应性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02503 2025-12-17 cs.CV 57%

Adapting General-Purpose Foundation Models for X-ray Ptychography in Low-Data Regimes

为低数据情形下的X射线衍射成像适应通用基础模型

Robinson Umeike, Neil Getty, Yin Xiangyu, Yi Jiang

机构 * The University of Alabama(阿拉巴马大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出PtychoBench基准,通过比较SFT和ICL策略,在低数据环境下优化X射线衍射成像任务的模型适应性,发现任务模态决定最佳专门化路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14661 2025-12-17 cs.AR 50%

Focus: A Streaming Concentration Architecture for Efficient Vision-Language Models

聚焦:一种高效的视觉-语言模型流式集中架构

Chiyue Wei, Cong Guo, Junyao Zhang, Haoxuan Shan, Yifan Xu, Ziyue Zhang, Yudong Liu, Qinsi Wang, Changchun Zhou, Hai "Helen" Li, Yiran Chen

专题命中 图文多模态 :cross-modal(abstract)

AI总结 Focus提出了一种高效的视觉-语言模型流式集中架构,通过分层压缩和细粒度冗余消除,实现2.4倍速度提升和3.3倍能效提升。

Comments HPCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏