COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI、eess.AS
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI、eess.AS
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、eess.AS
Comments Computer Vision and Pattern Recognition 2024
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.MM、eess.AS
Comments typos corrected
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments InterSpeech 2024. Code and Data: https://github.com/Sreyan88/LipGER
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、cs.AI、eess.AS
Comments Published in: Springer Nature International Journal of Applied Intelligence (2024)
Journal ref Applied Intelligence (2024), 1-24
专题命中 音频语音多模态 :multimodal(abstract);MLLM(abstract)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI、eess.AS
Comments CVPR 2024
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments 14 pages, Accepted by ACL 2024
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments 17 pages, 4 tables, 4 figures Accepted at the 2024 ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT '24)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted for publication, 3rd ACM Int. Workshop on Multimedia AI against Disinformation (MAD'24) at ACM ICMR'24, June 10, 2024, Phuket, Thailand. This is the "accepted version"
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、eess.AS
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract)
Comments Accepted by LREC Coling 2024 -FinNLP (oral)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS
Comments This article needs major revision
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments 15 pages, 5 figures
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、eess.AS
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI、eess.AS
Comments 12 pages,
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS
专题命中 音频语音多模态 :multimodal(abstract);multimodal foundation model(abstract)
Comments Accepted to the 2024 IEEE International Conference on Robotics and Automation (ICRA), May 13 to 17, 2024; Yokohama, Japan
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments Accepted in ICASSP 2023
Journal ref ICASSP 2023
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI、eess.AS
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments Check-Worthiness, Fact-Checking, Fake News, Misinformation, Disinformation, Political Debates, Multimodality
Journal ref ICASSP 2024
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、eess.AS
Comments Accepted at ICASSP 2024
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Camera-ready version for the Machine Learning for Audio Workshop at NeurIPS 2023
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments Accepted to EMNLP2023 main conference
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments EMNLP findings 2023
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments NeurIPS 2023. Audio samples are available at https://ictnlp.github.io/daspeech-demo/
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、eess.AS
Comments 7 pages, 2 figures, presented at the ISCA Speech Synthesis Workshop (SSW) 2023
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、cs.AI、eess.AS
Comments Interspeech 2023
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
Journal ref INTERSPEECH 2023
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted for publication in IEEE Transactions on Multimedia