arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-11 至 2025-09-11 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 2 篇

2509.08689 2025-09-11 cs.HC 78%

Augmenting speech transcripts of VR recordings with gaze, pointing, and visual context for multimodal coreference resolution

Riccardo Bovo, Frederik Brudy, George Fitzmaurice, Fraser Anderson

专题命中 音频语音多模态 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07538 2025-09-11 cs.CV 57%

TextlessRAG: End-to-End Visual Document RAG by Speech Without Text

Peijin Xie, Shun Qian, Bingquan Liu, Dexin Wang, Lin Sun, Xiangzheng Zhang

机构 * IEEE

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

Comments 5 pages, 4 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏