Audio-Enhanced Vision-Language Modeling with Latent Space Broadening for High Quality Data Expansion
机构 * ByteDance Inc.(字节跳动公司)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * ByteDance Inc.(字节跳动公司)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
机构 * CASIA(中国科学院自动化研究所) ; UCAS(中国科学技术大学) ; ZGCA(北京智感科技有限公司) ; HKU(香港大学) ; HKUST(香港科技大学) ; NTU(国立台湾大学) ; PKU(北京大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments Preprint, Under review