arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-06 至 2025-08-06 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 7 篇

2508.02849 2025-08-06 eess.AS cs.AI cs.CL cs.SD 85%

SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec

Chunyu Qiang, Haoyu Wang, Cheng Gong, Tianrui Wang, Ruibo Fu, Tao Wang, Ruilong Chen, Jiangyan Yi, Zhengqi Wen, Chen Zhang, Longbiao Wang, Jianwu Dang, Jianhua Tao

机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) Kuaishou Technology(快手科技) Tianjin Key Laboratory of Cognitive Computing and Application, College of Intelligence and Computing, Tianjin University(认知计算与应用重点实验室,智能计算学院,天津大学) Department of Automation, BNRist, Tsinghua University(自动化系,北研所,清华大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Science(深圳先进技术研究院,中国科学院)

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02905 2025-08-06 cs.CV cs.SD eess.AS 81%

How Would It Sound? Material-Controlled Multimodal Acoustic Profile Generation for Indoor Scenes

Mahnoor Fatima Saad, Ziad Al-Halah

机构 * University of Utah(犹他大学)

专题命中 音频语音多模态 :multimodal(title);audio-visual(abstract);分类 cs.CV、eess.AS

Comments Accepted to ICCV 2025. Project Page: https://mahnoor-fatima-saad.github.io/m-capa.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00265 2025-08-06 cs.CV 80%

Multimodal Referring Segmentation: A Survey

Henghui Ding, Song Tang, Shuting He, Chang Liu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai University of Finance and Economics(上海财经大学) ByteDance Inc(字节跳动公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

Comments Project Page: https://github.com/henghuiding/Awesome-Multimodal-Referring-Segmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08328 2025-08-06 eess.AS 74%

Multimodal Representation Loss Between Timed Text and Audio for Regularized Speech Separation

Tsun-An Hsieh, Heeyoul Choi, Minje Kim

专题命中 音频语音多模态 :multimodal(title);分类 eess.AS

Journal ref Interspeech 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03166 2025-08-06 cs.SD cs.LG eess.AS 74%

MiSTR: Multi-Modal iEEG-to-Speech Synthesis with Transformer-Based Prosody Prediction and Neural Phase Reconstruction

Mohammed Salah Al-Radhi, Géza Németh, Branislav Gerazov

专题命中 音频语音多模态 :multi-modal(title);分类 eess.AS

Comments 5 pages, 2 figures, 1 table. Accepted for presentation at Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21254 2025-08-06 cs.CV cs.AI cs.MM cs.SD eess.AS 70%

Vision-to-Music Generation: A Survey

Zhaokai Wang, Chenxi Bao, Le Zhuo, Jingrui Han, Yang Yue, Yihong Tang, Victor Shea-Jay Huang, Yue Liao

机构 * Shanghai Jiao Tong University(上海交通大学) Music Tech Lab, DynamiX(音乐科技实验室,DynamiX) Shanghai AI Laboratory(上海人工智能实验室) Beijing Film Academy(北京电影学院) Tsinghua University(清华大学) McGill University(麦吉尔大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

Journal ref ISMIR 2025 "A Survey on Vision to Music Generation: Methods, Datasets, Evaluation, and Challenges"

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22053 2025-08-06 cs.SD cs.MA cs.MM eess.AS 62%

AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation

Yan Rong, Jinting Wang, Guangzhi Lei, Shan Yang, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tencent AI Lab(腾讯人工智能实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏