arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-10 至 2025-10-10 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2510.08492 2025-10-10 cs.LG cs.CV 83%

Better Together: Leveraging Unpaired Multimodal Data for Stronger Unimodal Models

Sharut Gupta, Shobhita Sundaram, Chenyu Wang, Stefanie Jegelka, Phillip Isola

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) TU Munich(慕尼黑技术大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

Comments 63 pages, 29 tables, and 47 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08004 2025-10-10 cs.SD cs.MM eess.AS 81%

Personality-Enhanced Multimodal Depression Detection in the Elderly

Honghong Wang, Jing Deng, Rong Zheng

机构 * Beijing Fosafer Information Technology Co., Ltd.(北京福萨弗信息科技有限公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM、eess.AS

Comments 6 pages,2 figures,accepted by ACM Multimedia Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07881 2025-10-10 cs.CL 57%

CS3-Bench: Evaluating and Enhancing Speech-to-Speech LLMs for Mandarin-English Code-Switching

Heyang Liu, Yuhao Wang, Ziyang Cheng, Ronghua Wu, Qunshan Gu, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07592 2025-10-10 eess.AS 57%

SALAD-VAE: Semantic Audio Compression with Language-Audio Distillation

Sebastian Braun, Hannes Gamper, Dimitra Emmanouilidou

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

Comments submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05191 2025-10-10 cs.SD cs.AI 57%

Provable Speech Attributes Conversion via Latent Independence

Jonathan Svirsky, Ofir Lindenbaum, Uri Shaham

机构 * Bar Ilan University(巴伊兰大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏