arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-20 至 2026-02-20 共收录 1 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 1 篇

2602.16895 2026-02-20 cs.HC 71%

Connecting the Dots: Surfacing Structure in Documents through AI-Generated Cross-Modal Links

连接点:通过AI生成的跨模态链接揭示文档结构

Alyssa Hwang, Hita Kambhamettu, Yue Yang, Ajay Patel, Joseph Chee Chang, Andrew Head

专题命中 多模态Agent :cross-modal(title)

AI总结 本文提出通过AI生成跨模态链接的框架,帮助用户更高效地理解和整合复杂文档中的信息。

Comments 40 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏