arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-05 至 2025-12-05 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 2 篇

2512.04720 2025-12-05 cs.SD 82%

M3-TTS: Multi-modal DiT Alignment & Mel-latent for Zero-shot High-fidelity Speech Synthesis

M3-TTS: 多模态DiT对齐与梅尔-潜在空间用于零样本高质量语音合成

Xiaopeng Wang, Chunyu Qiang, Ruibo Fu, Zhengqi Wen, Xuefei Liu, Yukun Liu, Yuzhe Liang, Kang Yin, Yuankun Xie, Heng Xie, Chenxing Li, Chen Zhang, Changsheng Li

机构 * Beijing Institute of Technology(北京理工大学) Kuaishou Technology(快手科技) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract)

AI总结 M3-TTS通过多模态扩散变换器实现零样本高质量语音合成,采用联合扩散层和梅尔-变体编码器,实现高效且自然的语音生成。

Comments Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04814 2025-12-05 cs.SD cs.CV 74%

Shared Multi-modal Embedding Space for Face-Voice Association

用于人脸-语音关联的共享多模态嵌入空间

Christopher Simic, Korbinian Riedhammer, Tobias Bocklet

专题命中 音频语音多模态 :multi-modal(title);分类 cs.CV

AI总结 本文提出了一种基于共享多模态嵌入空间的人脸-语音关联方法,通过自适应角边距损失实现跨语言的高效识别

Comments Ranked 1st in Fame 2026 Challenge, ICASSP

详情

展开后加载摘要…

URL PDF HTML 收藏