arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-30 至 2025-12-30 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2506.05191 2025-12-30 cs.CV 85%

MokA: Multimodal Low-Rank Adaptation for MLLMs

MokA:多模态低秩适应用于大规模语言模型

Yake Wei, Yu Miao, Dongzhan Zhou, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 MokA通过多模态低秩适应提升大规模语言模型的多模态微调效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.13673 2025-12-30 cs.MM cs.CV cs.IR cs.LG eess.AS 82%

Recent Advances and Challenges in Deep Audio-Visual Correlation Learning

深度音频视觉相关性学习的最新进展与挑战

Luís Vilaça, Yi Yu, Paula Viana

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

AI总结 本文综述了深度音频-视觉相关性学习的最新进展,分析了现有模型、优化方法及未来研究方向。

Comments 8 pages, 1 figure

Journal ref ACM Computing Surveys, 57(12), 1-46, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02005 2025-12-30 cs.CV 70%

Learning Visual Affordance from Audio

从音频学习视觉可及性

Lidong Lu, Guo Chen, Zhu Wei, Yicheng Liu, Tong Lu

机构 * Nanjing University(南京大学) China Mobile Communications Company Limited Research Institute(中国移动通信有限公司研究院)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 AVAGFormer通过融合音频和视觉信号,实现了从音频学习视觉可及性的任务,提升了交互区域的识别性能。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22491 2025-12-30 cs.CL cs.AI 62%

ManchuTTS: Towards High-Quality Manchu Speech Synthesis via Flow Matching and Hierarchical Text Representation

曼juTTS: 通过流匹配和分层文本表示实现高质量曼ju语音合成

Suhua Wang, Zifan Wang, Xiaoxin Sun, D. J. Wang, Zhanbo Liu, Xin Li

机构 * Department of Computer Science, Changchun Humanities and Sciences College(计算机科学系,长春人文科学学院) School of Information Science and Technology, Northeast Normal University(信息科学与技术学院,东北师范大学) College of Optical Science and Engineering, Zhejiang University(光学科学与工程学院,浙江大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 ManchuTTS通过流匹配和分层文本表示,解决曼ju语音合成中的黏着性和数据稀缺问题,实现高质量语音生成。

详情

展开后加载摘要…

URL PDF HTML 收藏