Speak, Edit, Repeat: High-Fidelity Voice Editing and Zero-Shot TTS with Cross-Attentive Mamba
机构 * MTS AI(MTS人工智能公司) ; ITMO University(ITMO大学)
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * MTS AI(MTS人工智能公司) ; ITMO University(ITMO大学)
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
机构 * CUHK MMLab(香港中文大学多媒体实验室) ; SenseTime Research(商汤科技研究院) ; CPII under InnoHK(创新香港下的CPII)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
机构 * MERaLiON Team(MERaLiON团队) ; Institute for Infocomm Research (I 2 R), A*STAR, Singapore(信息通信研究所(I2R),A*STAR,新加坡)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、cs.AI、eess.AS
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments This paper is accepted to Interspeech 2025. This publication is part of the project Responsible AI for Voice Diagnostics (RAIVD) with file number NGF.1607.22.013 of the research programme NGF AiNed Fellowship Grants which is financed by the Dutch Research Council (NWO)
Journal ref https://www.isca-archive.org/interspeech_2025/gao25c_interspeech.html
机构 * Institute of Computing Technology, Chinese Academy of Sciences \& University of Chinese Academy of Sciences Beijing China ; Institute of Computing Technology, Chinese Academy of Sciences Beijing China ; Hangzhou Dianzi University Hangzhou China ; Macquarie University Sydney Australia ; University of Adelaide Adelaide Australia ; University of Chinese Academy of Sciences Beijing China ; Institute of Computing Technology, Chinese Academy of Sciences \& University of Chinese Academy of Sciences ; Institute of Computing Technology, Chinese Academy of Sciences ; Hangzhou Dianzi University ; Macquarie University ; University of Adelaide ; University of Chinese Academy of Sciences
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
机构 * College of William and Mary(威廉与玛丽学院) ; University of Toronto(多伦多大学) ; University Health Network(大学健康网络) ; KU Leuven(鲁汶大学) ; Bucknell University(巴克内尔大学) ; University of Cincinnati(辛辛那提大学) ; University of Alabama at Birmingham(伯明翰大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments ACL 2025 Industry Track (Oral)
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tongyi Speech Lab(通义语音实验室) ; Tianjin University(天津大学) ; Zhejiang University(浙江大学) ; Shanghai Jiao Tong University, Shanghai Innovation Institute(上海交通大学上海创新研究院)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments Accepted at ACMMM 2025
机构 * Compumacy for Artificial Intelligence solutions(人工智能解决方案公司) ; Department of Behavioural Health- Saint Elizabeths Hospital(行为健康部门-圣伊丽莎白医院)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
机构 * National University of Singapore(新加坡国立大学) ; Renmin University of China(中国人民大学) ; Zhejiang University(浙江大学)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、eess.AS
Comments 6 figures, 4 tables
机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg, Germany(模式识别实验室,弗里德里希-亚历山大-埃森纳赫大学) ; Smart Imaging Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg, Germany(智能成像实验室,弗里德里希-亚历山大-埃森纳赫大学) ; GITA Lab, Universidad de Antioquia UdeA, Medellín, Colombia(GITA实验室,安托法加斯塔大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments conference to TSD 2025
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted by IJCAI 2025
机构 * Deezer Research(DeepZ研究)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments Accepted to ACL 2025 Findings
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments 9 pages, 3 figures, Accepted at the 39th AAAI Conference on Artificial Intelligence (AAAI 2025)
Journal ref Proceedings of the 39th AAAI Conference on Artificial Intelligence (AAAI 2025)
机构 * Beijing Institute of Technology(北京理工大学) ; Peking University(北京大学) ; Nanyang Technological University(南洋理工大学)
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
机构 * Microsoft USA(微软公司)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
机构 * Peking University(北京大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS
Comments ICML 2025
机构 * KT Corporation(KT公司) ; Department of Electrical and Computer Engineering(电气与计算机工程系) ; Sungkyunkwan University(成均馆大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
机构 * TU Darmstadt(图宾根大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS
机构 * X-LANCE Lab, School of Computer Science, MoE Key Lab of Artificial Intelligence, Shanghai Jiao Tong University(X-LANCE实验室,计算机科学学院,人工智能国家重点实验室,上海交通大学) ; ByteDance(字节跳动)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.MM、eess.AS
Comments ACL 2025 Findings
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments Accepted to ACL 2025 Findings
机构 * Xiaomi Corporation(小米公司)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
机构 * University of Washington(华盛顿大学) ; Stanford University(斯坦福大学) ; The Ohio State University(俄亥俄州立大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Waterloo(多伦多大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
机构 * University of Washington(华盛顿大学)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、eess.AS
Comments NeurIPS 2024. Project page: https://dragonliu1995.github.io/VATT-home
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、eess.AS
机构 * Tencent AI Lab(腾讯AI实验室) ; Beijing Institute of Technology(北京理工大学) ; University of California, Berkeley(加州大学伯克利分校) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
机构 * Shanghai Jiao Tong University(上海交通大学) ; ShanghaiTech University(上海科技大学)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments to be published in NAACL 25
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM
Comments ICLR 2025. 10 pages, 5 figures (main paper)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI、eess.AS