Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV、cs.MM
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV、cs.MM
机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队)
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);audio-visual(abstract);分类 cs.CV
Comments Technical Report. Project Page: https://klingavatar.github.io/
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、cs.MM
机构 * Virginia Tech(维吉尼亚理工大学)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI
机构 * ADAPT Centre(ADAPT中心) ; Dublin City University (DCU)(都柏林城市大学) ; Trinity College Dublin (TCD)(三一学院都柏林)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
Comments Accepted at WMT2025 (ENNLP) for oral presented
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
专题命中 音频语音多模态 :multimodal(abstract)
Comments 11 pages, 6 figures, to appear in IEEE TVCG (VIS 2024); correct figure
Journal ref IEEE Transactions on Visualization and Computer Graphics, 31(1), 2025, 941-951