Voice-Enabled AI Agents can Perform Common Scams
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI
专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS
Comments 18 pages
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
专题命中 音频语音多模态 :any-to-any(abstract);分类 eess.AS
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
Journal ref EUSIPCO 2024 Proceedings, ISBN: 978-9-4645-9361-7
专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
Comments EMNLP 2024 Main Conference
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV
Comments 16 pages, 8 figures
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL
Comments EMNLP 2024
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV
Comments 7 pages, 4 figures
专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS
Comments PhD thesis
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS
Comments Seed-Music technical report, 20 pages, 5 figures
专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS
专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS
Comments Submitted to IEEE ICASSP 2025
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV
Comments ACM MM 2024. Challenge webpage: https://deepfakes1m.github.io/
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
Journal ref IEEE Access-09 September 2024
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
Comments Accepted for ECCV 2024
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV
Comments 21 pages
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
Comments Preprint. 19 figures, 7 tables
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV
Comments arXiv admin note: substantial text overlap with arXiv:2203.13412
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.MM
Comments Accepted by ACM MM 2024
专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS
Comments This work has been submitted to The Journal of the Acoustical Society of America of the for possible publication
专题命中 音频语音多模态 :any-to-any(abstract);分类 eess.AS
Comments Accepted to ISCSLP 2024. arXiv admin note: text overlap with arXiv:2406.05325