Do Slides Help? Multi-modal Context for Automatic Transcription of Conference Talks
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL、cs.AI
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL、cs.AI
机构 * Adam Mickiewicz University(亚当·密茨凯维奇大学)
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI
Comments 5 pages, 1 figure; benchmark code available at https://github.com/SamsungLabs/C3T