arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-15 至 2025-08-15 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2506.23009 2025-08-15 cs.CV 83%

MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models

Jian Chen, Wenye Ma, Penghang Liu, Wei Wang, Tengwei Song, Ming Li, Chenguang Wang, Jiayu Qin, Ruiyi Zhang, Changyou Chen

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06117 2025-08-15 cs.CL cs.AI 62%

Fleurs-SLU: A Massively Multilingual Benchmark for Spoken Language Understanding

Fabian David Schmidt, Ivan Vulić, Goran Glavaš, David Ifeoluwa Adelani

机构 * Center For Artificial Intelligence and Data Science, University of Würzburg(人工智能与数据科学中心,乌尔姆大学) Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学) Mila, McGill University and Canada CIFAR AI Chair(Mila,麦吉尔大学及加拿大CIFAR人工智能主席)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10830 2025-08-15 cs.SD eess.AS 57%

Advances in Speech Separation: Techniques, Challenges, and Future Trends

Kai Li, Guo Chen, Wendi Sang, Yi Luo, Zhuo Chen, Shuai Wang, Shulin He, Zhong-Qiu Wang, Andong Li, Zhiyong Wu, Xiaolin Hu

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) School of Computer Technology and Application, Qinghai University(计算机技术与应用学院,青海大学) ByteDance(字节跳动) Nanjing University(南京大学) Southern University of Science and Technology(南方科技大学) Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

Comments 34 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10580 2025-08-15 cs.MM cs.SD 57%

Ensembling Synchronisation-based and Face-Voice Association Paradigms for Robust Active Speaker Detection in Egocentric Recordings

Jason Clarke, Yoshihiko Gotoh, Stefan Goetze

机构 * Speech and Hearing (SPandH), School of Computer Science, The University of Sheffield, UK(语音与听力(SPandH)、计算机科学学院、谢菲尔德大学、英国) South Westphalia University of Applied Sciences, Iserlohn, Germany(西南弗兰肯应用科学大学、伊塞尔洛恩、德国)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.MM

Comments Accepted to SPECOM 2025, 13 pages, 4 figures. To appear in the Proceedings of the 27th International Conference on Speech and Computer (SPECOM) 2025, October 13-14, 2025, Szeged, Hungary

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10130 2025-08-15 q-bio.NC 50%

Linking GFAP Levels to Speech Anomalies in Acute Brain Injury: A Simulation Based Study

Shamaley Aravinthan, Bin Hu

专题命中 音频语音多模态 :multimodal(abstract)

Comments 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏