Spatiotemporal Emotional Synchrony in Dyadic Interactions: The Role of Speech Conditions in Facial and Vocal Affective Alignment
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI
机构 * IBM Research(IBM研究院) ; Tel-Aviv University(特拉维夫大学)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI、eess.AS
Comments Accepted for Interspeech 2025 (with additional results)
机构 * University of Cambridge(剑桥大学) ; ALTA Institute(ALTA研究院)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS
Comments submitted to Interspeech
机构 * Politecnico di Torino(托里尼理工大学) ; Kore University of Enna(恩纳科雷大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
Comments Currently under review. See the official website: https://salt-research.github.io/DeepDialogue
机构 * X-LANCE Lab(X-LANCE实验室) ; MoE Key lab of Artificial Intelligence(人工智能关键实验室) ; School of Computer Science(计算机科学学院) ; Shanghai Jiao Tong University(上海交通大学) ; Jiangsu Key Lab of Language Computing(江苏语言计算关键实验室) ; Shenzhen Research Institute of Big Data(深圳大数据研究 institute)
专题命中 音频语音多模态 :any-to-any(abstract);分类 cs.AI、eess.AS
Comments 5 pages, 3 figures, 2 tables. Demo page: https://cantabile-kwok.github.io/vec2wav2/
机构 * International Digital Economy Academy(国际数字经济学院) ; IDEA&Emdoor Collaborative Laboratory(IDEA与Emdoor协同实验室) ; Emdoor Information Co., Ltd(Emdoor信息有限公司) ; Shenzhen Yijiayiban Information Technology Co., Ltd(深圳艺佳iban信息技术有限公司)
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
Comments Accepted by INTERSPEECH 2025. 5 pages
机构 * Stanford University(斯坦福大学) ; University of Cambridge(剑桥大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
Comments 15 pages; 3 figures
机构 * School of Informatics, Xiamen University(厦门大学信息学院)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI
Comments Accepected by ACL 2025
机构 * CentraleSupélec(中央理工学院) ; IETR(信息与电信研究实验室) ; UMR CNRS 6164(法国国家科学研究中心6164号研究单位)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM、eess.AS
Comments 13 pages, 6 figures, https://samsad35.github.io/VQ-MAE-AudioVisual/
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM
Comments The code and datasets are available at https://github.com/ZeyueT/VidMuse/
机构 * Beijing Normal University(北京师范大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
机构 * UCL Knowledge Lab, Institute of Education, University College London, UK(伦敦大学学院教育研究所知识实验室) ; AI Centre, Dept. of Computer Science, University College London, UK(伦敦大学学院人工智能中心)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI
Comments Accepted for 26th International Conference on Artificial Intelligence in Education (AIED 2025), 22 - 26 July 2025, Palermo, Italy. 17 pages, 1 figure
机构 * Tencent AI Lab(腾讯AI实验室)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI、eess.AS
Comments Accepted by AAAI 2025
机构 * TCL AI Lab(TCL人工智能实验室)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS
Comments 8 pages
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST)) ; Chung-Ang University(中央大学)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS
Comments EMNLP 2023, 14 pages, 13 figures
机构 * IIIT-Hyderabad(印度国际信息技术学院海得拉巴分校) ; Whissle Inc.(惠斯勒公司)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、eess.AS
机构 * Huazhong University of Science and Technology(华中科技大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI
机构 * POSTECH(浦项科技大学) ; KAIST(韩国科学技术院) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS
Comments https://voicecraft-dub.github.io/
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM、eess.AS
Comments Accepted by IEEE Journal of Selected Topics in Signal Processing (JSTSP)
机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院) ; University of Cambridge(剑桥大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
机构 * Australian National University(澳大利亚国立大学) ; CSIRO Data61
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS
机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) ; Microsoft Research(微软研究院)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
Comments 5 pages, 2 figures, Accepted at ICASSP 2025
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
Comments Single Column, 13 page
机构 * Hong Kong University of Science and Technology(香港科技大学) ; The University of Hong Kong(香港大学) ; Huawei Noah’s Ark Lab(华为诺亚方舟实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Sun Yat-sen University(中山大学) ; Southern University of Science and Technology(南方科技大学)
专题命中 音频语音多模态 :omni-modal(abstract);分类 cs.CV、cs.CL
Comments Accepted by CVPR 2025. Project Page: https://emova-ollm.github.io/
机构 * School of Data Science, Shenzhen Research Institute of Big Data, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院、深圳大数据研究院) ; Bytedance(字节跳动)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS
Comments ACL 2021 Findings
机构 * University of Surrey(萨里大学) ; Imperial College London(帝国理工学院)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI、eess.AS
Comments Accepted to NeurIPS 2024
机构 * Nanyang Technological University(南洋理工大学) ; NVIDIA(英伟达) ; Tsinghua University(清华大学) ; Johns Hopkins University(约翰斯·霍普金斯大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
Comments ICLR 2025