Mellow: a small audio language model for reasoning
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
Comments Checkpoint and dataset available at: https://github.com/soham97/mellow
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
Comments Checkpoint and dataset available at: https://github.com/soham97/mellow
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; The Chinese University of Hong Kong(香港中文大学) ; Tencent Youtu Lab(腾讯优图实验室) ; StepFun(阶跃星辰)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
Comments Accepted by ICASSP 2025
机构 * The University of Queensland(昆士兰大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI
Comments Companion Proceedings of the ACM Web Conference 2025 (WWW Companion'25)
机构 * National Institute of Technology, Tiruchirapalli(印度特里奇拉巴利国家理工学院)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI
Comments AAAI-25 DEFACTIFY 4.0 Workshop AI generated text detection (1st Rank)
机构 * Huawei Translation Services Center(华为翻译服务中心)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI
机构 * Yonsei University(延世大学) ; NCSOFT Corporation(NCsoft公司)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments NAACL 2025 Findings. Project page at https://jun297.github.io/EgoSpeak/
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; National University of Singapore(新加坡国立大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI
机构 * MIT(麻省理工学院) ; EleutherAI ; UCSB(加利福尼亚大学圣巴巴拉分校) ; SynthLabs ; Princeton University(普林斯顿大学) ; Stanford University(斯坦福大学) ; Harvard University(哈佛大学) ; Allen Institute for AI(艾伦人工智能研究所) ; Google DeepMind(谷歌DeepMind) ; ML Commons ; Contextual AI ; HuggingFace ; University College London(伦敦大学学院)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI
机构 * National Taiwan University(台湾大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
Comments Work in progress
机构 * Queen Mary University of London(伦敦玛丽女王大学) ; Xidian University(西安电子科技大学)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM、eess.AS
机构 * Stony Brook University(石溪大学) ; Department of Computer Science(计算机科学系) ; Department of Linguistics(语言学系) ; Institute for Advanced Computational Science(高级计算科学研究所)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI
Comments John Murzaku and Adil Soubki contributed equally to this work
Journal ref NAACL 2025
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
机构 * Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑智能科学与技术研究院)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS
机构 * Stony Brook University(石溪大学) ; Bytedance(字节跳动) ; Apple(苹果公司)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI
机构 * Sharif University of Technology(谢里夫理工大学) ; Qatar Computing Research Institute(卡塔尔计算研究所)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI
Comments Proceedings of the 18th International Workshop on Semantic Evaluation (SemEval-2024)
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Pengcheng Laboratory(鹏城实验室) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
Comments Accepted by ICASSP 2025
机构 * The Ohio State University(俄亥俄州立大学) ; IBM Research(IBM研究院)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
Comments 5 pages, 3 figures, 3 tables
机构 * IIIT Hyderabad(印度国际信息技术学院海得拉巴分校) ; TCS Research(塔塔咨询服务公司研究院)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI、eess.AS
Comments Accepted at IEEE ICASSP 2025
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI
Comments https://huggingface.co/MERaLiON/MERaLiON-AudioLLM-Whisper-SEA-LION
机构 * Universitat Pompeu Fabra(庞培法布拉大学) ; MARL-IDM, New York University(纽约大学MARL-IDM)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS
Comments Accepted in ICASSP 2025
机构 * Indian Institute of Technology, Jodhpur(焦特布尔印度理工学院) ; KTH Royal Institute of Technology(瑞典皇家理工学院)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM、eess.AS
Comments Accepted to ICASSP 2025
机构 * Institute for AI, Peking University(北京大学人工智能研究院) ; Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院) ; Huawei Noah’s Ark LAB(华为诺亚方舟实验室) ; Baichuan Inc.(百川智能) ; Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团)
专题命中 音频语音多模态 :any-to-any(abstract);分类 cs.CL、cs.AI
机构 * Inner Mongolia University(内蒙古大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
Comments Accepted by ICASSP 2025
机构 * Alibaba Group(阿里巴巴集团)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI、eess.AS
Comments Tech report, work in progress
机构 * Emory University(埃默里大学)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS
机构 * Columbia University(哥伦比亚大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS
Comments 23 pages, 8 figures, 3 tables, accepted for publication in Neural Computing and Applications
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI
Comments 3 pages, 2 figures, appearing at AAAI 2025 Demos Track
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS
Comments Accepted by COLING 2025