VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS
Comments Accepted to ICASSP 2025
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS
Comments Accepted to ICASSP 2025
机构 * Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) ; Department of Automation Tsinghua University(清华大学自动化系)
专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS
机构 * Stanford University(斯坦福大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
Comments Project page: languageofmotion.github.io
机构 * Lund University(隆德大学) ; Arm(安谋科技) ; Sony(索尼) ; Tenstorrent
专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS
Comments IPIN 2024
机构 * Imperial College London(帝国理工学院) ; Technical University of Munich(慕尼黑工业大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
机构 * Imperial College London(帝国理工学院) ; Technical University of Munich(慕尼黑工业大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
机构 * Bielefeld University(比勒费尔德大学) ; Indian Institute of Technology BHU(印度理工学院( varanasi )) ; Bremen University(不来梅大学)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI
Comments Accepted at CoRL 2024: Workshop on Lifelong Learning for Home Robots
机构 * Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
Comments Outstanding paper at the ACL 2024 main conference
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Apple(苹果公司)
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
Comments 26 pages, 7 figures, accepted at NeurIPS 2024
机构 * Idiap Research Institute(伊迪亚普研究所)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
Comments 8 pages, 13 figures, 4 tables
机构 * University of Maryland, College Park(马里兰大学帕克分校)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
Comments Accepted by WACV 2025 in Round 1. First two authors contributed equally
机构 * University of Alicante(阿利坎特大学) ; TU Wien(维也纳技术大学) ; Queen Mary University of London(伦敦大学玛丽皇后学院)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV
Comments Proceedings edited by Jorge Calvo-Zaragoza, Alexander Pacha and Elona Shatri
机构 * Adobe Inc.(奥多比公司) ; Purdue University(普渡大学) ; University of Maryland(马里兰大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
Comments 14 pages, 7 figures, 2 tables
Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 1st Workshop on Human Motion Generation, 2024, Seattle, Washington, USA
机构 * School of Computer Science, Nanjing University of Information Science and Technology(南京信息工程大学计算机科学学院) ; Jiangsu Collaborative Innovation Center of Atmospheric Environment and Equipment Technology, Nanjing University of Information Science and Technology(南京信息工程大学江苏省大气环境与装备技术协同创新中心) ; College of Computer and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV
机构 * Shenzhen Research Institute of Shandong University(山东大学深圳研究院) ; Key Lab of Information Network Security Ministry of Public Security(公安部信息网络安全重点实验室)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI
机构 * Peking University Shenzhen Graduate School(北京大学深圳研究生院)
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV
Comments Accepted by ACM MM 2024
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
Comments Accepted at EMNLP'24 (Findings)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
Comments under review
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
Comments This work has been submitted to the IEEE for possible publication
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
Comments This work has been submitted to the IEEE for possible publication
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI
专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS
Comments 18 pages
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
专题命中 音频语音多模态 :any-to-any(abstract);分类 eess.AS
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
Journal ref EUSIPCO 2024 Proceedings, ISBN: 978-9-4645-9361-7
专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
Comments EMNLP 2024 Main Conference