arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-22 至 2025-08-22 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2508.15297 2025-08-22 cs.CV cs.AI 81%

DesignCLIP: Multimodal Learning with CLIP for Design Patent Understanding

Zhu Wang, Homaira Huda Shomee, Sathya N. Ravi, Sourav Medya

机构 * Department of Computer Science, University of Illinois Chicago(计算机科学系,伊利诺伊大学芝加哥分校)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by EMNLP 2025. 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00329 2025-08-22 cs.CV cs.LG 79%

ABC: Achieving Better Control of Multimodal Embeddings using VLMs

Benjamin Schneider, Florian Kerschbaum, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

Comments TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10225 2025-08-22 cs.CV 57%

Synthesizing Near-Boundary OOD Samples for Out-of-Distribution Detection

Jinglun Li, Kaixun Jiang, Zhaoyu Chen, Bo Lin, Yao Tang, Weifeng Ge, Wenqiang Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University, Shanghai(智能机器人与先进制造学院,复旦大学,上海) Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University, Shanghai(上海智能信息处理重点实验室,计算机科学与人工智能学院,复旦大学,上海) JIIOV Technology, Beijing(JIIOV技术,北京)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by ICCV 2025 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏