SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec
机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) ; Kuaishou Technology(快手科技) ; Tianjin Key Laboratory of Cognitive Computing and Application, College of Intelligence and Computing, Tianjin University(认知计算与应用重点实验室,智能计算学院,天津大学) ; Department of Automation, BNRist, Tsinghua University(自动化系,北研所,清华大学) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Science(深圳先进技术研究院,中国科学院)
专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI、eess.AS