Learning to Unify Audio, Visual and Text for Audio-Enhanced Multilingual Visual Answer Localization
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、cs.AI、cs.MM
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、cs.AI、cs.MM
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、eess.AS
Comments Technical report, work in progress. Demo and code: https://github.com/gpt-omni/mini-omni2
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments Project Website: https://sakshi113.github.io/mmau_homepage/
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Working in progress
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract)
Comments 15 pages
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM、eess.AS
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments 9 pages, 6 figures, 4 tables, accepted for Findings of EMNLP 2024. Demo samples: https://rinnakk.github.io/research/publications/PSLM
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments accepted by EMNLP2024 findings
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM、eess.AS
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments 14 pages, 11 figures
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments 8+5 pages
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
专题命中 音频语音多模态 :multimodal(abstract);multimodal foundation model(abstract)
Comments 2024 33rd IEEE International Conference on Robot and Human Interactive Communication (RO-MAN), Workshop: Large Language Models in the RoMan Age
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments This work is accepted by IROS 2024 (Oral)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments Accepted at ACM MM 2024
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、eess.AS
Comments Accepted to ECCV 2024
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS
Comments 10 pages, work in progress
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、cs.MM、eess.AS
Comments Accepted to TASLP
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 8 pages. Paper accepted at WACAI 2024
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments 9 pages, 3 figures, ACL24 accepted
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI、eess.AS
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、eess.AS
Comments Computer Vision and Pattern Recognition 2024
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.MM、eess.AS
Comments typos corrected
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments InterSpeech 2024. Code and Data: https://github.com/Sreyan88/LipGER
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、cs.AI、eess.AS
Comments Published in: Springer Nature International Journal of Applied Intelligence (2024)
Journal ref Applied Intelligence (2024), 1-24
专题命中 音频语音多模态 :multimodal(abstract);MLLM(abstract)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI、eess.AS
Comments CVPR 2024
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments 14 pages, Accepted by ACL 2024