arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-07-28 至 2025-07-28 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4 篇

2507.18763 2025-07-28 cs.CV cs.RO 79%

Diffusion-FS: Multimodal Free-Space Prediction via Diffusion for Autonomous Driving

Keshav Gupta, Tejas S. Stanley, Pranjal Paul, Arun K. Singh, K. Madhava Krishna

机构 * Robotics Research Center, IIIT-Hyderabad(IIIT-海得拉巴机器人研究中心) The University of Tartu(塔尔图大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments 8 pages, 7 figures, IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18750 2025-07-28 cs.MM cs.SD eess.AS 73%

CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation

Hyunwoo Oh, SeungJu Cha, Kwanyoung Lee, Si-Woo Kim, Dong-Jin Kim

机构 * Hanyang University(翰阳大学)

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07919 2025-07-28 cs.CL q-bio.BM 70%

Advancing biomolecular understanding and design following human instructions

Xiang Zhuang, Keyan Ding, Tianwen Lyu, Yinuo Jiang, Xiaotong Li, Zhuoyi Xiang, Zeyuan Wang, Ming Qin, Kehua Feng, Jike Wang, Qiang Zhang, Huajun Chen

专题命中 多模态生成 :multimodal(abstract);any-to-any(abstract);分类 cs.CL

Journal ref Nature Machine Intelligence volume 7, pages1154-1167 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18667 2025-07-28 cs.CV cs.AI 62%

Gen-AI Police Sketches with Stable Diffusion

Nicholas Fidalgo, Aaron Contreras, Katherine Harvey, Johnny Ni

机构 * Harvard College(哈佛学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏