arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-03 至 2025-10-03 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 2 篇

2510.01513 2025-10-03 cs.CV cs.AI cs.CL cs.IR 82%

From Videos to Indexed Knowledge Graphs -- Framework to Marry Methods for Multimodal Content Analysis and Understanding

Basem Rizk, Joel Walsh, Mark Core, Benjamin Nye

机构 * University Of Southern California(美国南加州大学)

专题命中 视频多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02287 2025-10-03 cs.CV 79%

MultiModal Action Conditioned Video Generation

Yichen Li, Antonio Torralba

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏