arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-28 至 2026-01-28 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 4 篇

2601.19060 2026-01-28 cs.CV cs.AI 81%

Pixel-Grounded Retrieval for Knowledgeable Large Multimodal Models

基于像素的检索用于知识型大型多模态模型

Jeonghwan Kim, Renjie Tao, Sanat Sharma, Jiaqi Wang, Kai Sun, Zhaojiang Lin, Seungwhan Moon, Lambert Mathias, Anuj Kumar, Heng Ji, Xin Luna Dong

机构 * Meta Reality Labs(Meta现实实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 PixSearch是一种端到端的多模态模型,通过像素级检索和统一感知与推理,提升视觉问答任务中的事实一致性与泛化能力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18203 2026-01-28 cs.IR 78%

DMAP: Human-Aligned Structural Document Map for Multimodal Document Understanding

DMAP: 人类对齐的多模态文档结构地图用于多模态文档理解

ShunLiang Fu, Yanxin Zhang, Yixin Xiang, Xiaoyu Du, Jinhui Tang

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 DMAP通过构建人类对齐的多模态文档结构地图,提升文档理解的结构化表示和多模态推理能力。

Comments WebConf 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19606 2026-01-28 cs.CV cs.AI cs.LG cs.SD eess.AS 67%

GMS-CAVP: Improving Audio-Video Correspondence with Multi-Scale Contrastive and Generative Pretraining

GMS-CAVP:通过多尺度对比和生成预训练提升音频视频对应关系

Shentong Mo, Zehua Chen, Jun Zhu

机构 * Carnegie Mellon University(卡内基梅隆大学) MBZUAI Tsinghua University(清华大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI、eess.AS

AI总结 GMS-CAVP通过多尺度对比和生成预训练方法提升音频视频对应关系建模,实现更深入的跨模态理解和高保真生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18850 2026-01-28 cs.SE 67%

Towards Safety-Compliant Transformer Architectures for Automotive Systems

面向汽车系统的安全合规Transformer架构

Sven Kirchner, Nils Purschke, Chengdong Wu, Alois Knoll

专题命中 跨模态检索 :multimodal(abstract);multimodal foundation model(abstract)

AI总结 本文提出了一种安全合规的Transformer架构,通过多模态基础模型提升汽车系统的容错性和鲁棒性,实现自动驾驶中的可认证AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏