SOAF: Scene Occlusion-aware Neural Acoustic Field
机构 * Australian National University(澳大利亚国立大学) ; CSIRO Data61
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Australian National University(澳大利亚国立大学) ; CSIRO Data61
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS
机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) ; Microsoft Research(微软研究院)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
Comments 5 pages, 2 figures, Accepted at ICASSP 2025
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
Comments Single Column, 13 page
机构 * Hong Kong University of Science and Technology(香港科技大学) ; The University of Hong Kong(香港大学) ; Huawei Noah’s Ark Lab(华为诺亚方舟实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Sun Yat-sen University(中山大学) ; Southern University of Science and Technology(南方科技大学)
专题命中 音频语音多模态 :omni-modal(abstract);分类 cs.CV、cs.CL
Comments Accepted by CVPR 2025. Project Page: https://emova-ollm.github.io/
机构 * School of Data Science, Shenzhen Research Institute of Big Data, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院、深圳大数据研究院) ; Bytedance(字节跳动)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS
Comments ACL 2021 Findings
机构 * University of Surrey(萨里大学) ; Imperial College London(帝国理工学院)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI、eess.AS
Comments Accepted to NeurIPS 2024
机构 * Nanyang Technological University(南洋理工大学) ; NVIDIA(英伟达) ; Tsinghua University(清华大学) ; Johns Hopkins University(约翰斯·霍普金斯大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
Comments ICLR 2025
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
Comments Checkpoint and dataset available at: https://github.com/soham97/mellow
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; The Chinese University of Hong Kong(香港中文大学) ; Tencent Youtu Lab(腾讯优图实验室) ; StepFun(阶跃星辰)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
Comments Accepted by ICASSP 2025
机构 * The University of Queensland(昆士兰大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI
Comments Companion Proceedings of the ACM Web Conference 2025 (WWW Companion'25)
机构 * National Institute of Technology, Tiruchirapalli(印度特里奇拉巴利国家理工学院)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI
Comments AAAI-25 DEFACTIFY 4.0 Workshop AI generated text detection (1st Rank)
机构 * Huawei Translation Services Center(华为翻译服务中心)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI
机构 * Yonsei University(延世大学) ; NCSOFT Corporation(NCsoft公司)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments NAACL 2025 Findings. Project page at https://jun297.github.io/EgoSpeak/
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; National University of Singapore(新加坡国立大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI
机构 * MIT(麻省理工学院) ; EleutherAI ; UCSB(加利福尼亚大学圣巴巴拉分校) ; SynthLabs ; Princeton University(普林斯顿大学) ; Stanford University(斯坦福大学) ; Harvard University(哈佛大学) ; Allen Institute for AI(艾伦人工智能研究所) ; Google DeepMind(谷歌DeepMind) ; ML Commons ; Contextual AI ; HuggingFace ; University College London(伦敦大学学院)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI
机构 * National Taiwan University(台湾大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
Comments Work in progress
机构 * Queen Mary University of London(伦敦玛丽女王大学) ; Xidian University(西安电子科技大学)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM、eess.AS
机构 * Stony Brook University(石溪大学) ; Department of Computer Science(计算机科学系) ; Department of Linguistics(语言学系) ; Institute for Advanced Computational Science(高级计算科学研究所)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI
Comments John Murzaku and Adil Soubki contributed equally to this work
Journal ref NAACL 2025
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS
机构 * Stony Brook University(石溪大学) ; Bytedance(字节跳动) ; Apple(苹果公司)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI
机构 * Sharif University of Technology(谢里夫理工大学) ; Qatar Computing Research Institute(卡塔尔计算研究所)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI
Comments Proceedings of the 18th International Workshop on Semantic Evaluation (SemEval-2024)
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Pengcheng Laboratory(鹏城实验室) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
Comments Accepted by ICASSP 2025
机构 * The Ohio State University(俄亥俄州立大学) ; IBM Research(IBM研究院)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
Comments 5 pages, 3 figures, 3 tables
机构 * IIIT Hyderabad(印度国际信息技术学院海得拉巴分校) ; TCS Research(塔塔咨询服务公司研究院)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI、eess.AS
Comments Accepted at IEEE ICASSP 2025
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI
Comments https://huggingface.co/MERaLiON/MERaLiON-AudioLLM-Whisper-SEA-LION
机构 * Universitat Pompeu Fabra(庞培法布拉大学) ; MARL-IDM, New York University(纽约大学MARL-IDM)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS
Comments Accepted in ICASSP 2025
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM、eess.AS
Comments Accepted to ICASSP 2025