M3-SLU: Evaluating Speaker-Attributed Reasoning in Multimodal Large Language Models
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI
Comments Submitted to LREC 2026. 11 pages, 5 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI
Comments Submitted to LREC 2026. 11 pages, 5 figures
机构 * Microsoft Azure Research(微软Azure研究) ; Microsoft Research India(微软印度研究) ; University of Virginia(弗吉尼亚大学) ; Microsoft M365 Research(微软M365研究)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
Comments Published at ACM SoCC 2025; 14 pages, 20 figures
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
Comments 5 pages, 2 figures, 2 tables
机构 * Nlpie Research University of Zurich(Nlpie研究所 瑞士苏黎世大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Southern Methodist University(南方 Methodist 大学) ; The City University of Hong Kong(香港城市大学) ; The Hong Kong Polytechnic University(香港理工大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of Connecticut(康涅狄格大学) ; Tsinghua University(清华大学) ; University of Texas at Arlington(德克萨斯大学阿灵顿分校) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tibet University(西藏大学)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL