arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-05 至 2025-09-05 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 3 篇

2509.04215 2025-09-05 cs.SD cs.IR cs.MM 79%

PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music

Hayeon Bang, Eunjin Choi, Seungheon Doh, Juhan Nam

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

Comments Accepted for publication at the 26th International Society for Music Information Retrieval Conference (ISMIR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04392 2025-09-05 cs.SD 50%

Denoising GER: A Noise-Robust Generative Error Correction with LLM for Speech Recognition

Yanyan Liu, Minqiang Xu, Yihao Chen, Liang He, Lei Fang, Sian Fang, Lin Liu

机构 * School of Computer Science and Technology(计算机科学与技术学院) Xinjiang University(新疆大学) Hefei iFly Digital Technology Co. Ltd.(合肥iFly数字技术有限公司) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 音频语音多模态 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04356 2025-09-05 cs.HC cs.RO 50%

SRWToolkit: An Open Source Wizard of Oz Toolkit to Create Social Robotic Avatars

Atikkhan Faridkhan Nilgar, Kristof Van Laerhoven, Ayub Kinoti

机构 * University of Siegen(施皮格恩大学) Honda Research Institute Europe GmbH(本田欧洲研究院) Dedan Kimathi University of Technology(德丹·基马蒂技术大学)

专题命中 音频语音多模态 :multimodal(abstract)

Journal ref 2025 International Conference on Social Robotics (ICSR)

详情

展开后加载摘要…

URL PDF HTML 收藏