arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-06 至 2026-01-06 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2412.05436 2026-01-06 cs.SD cs.MM eess.AS 81%

pyAMPACT: A Score-Audio Alignment Toolkit for Performance Data Estimation and Multi-modal Processing

pyAMPACT:一种用于表演数据估计和多模态处理的评分-音频对齐工具包

Johanna Devaney, Daniel McKemie, Alex Morgan

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.MM、eess.AS

AI总结 pyAMPACT是一种用于表演数据估计和多模态处理的工具,通过符号与音频的对齐实现性能数据的估计及多模态分析

Comments Proceedings of the 2025 International Computer Music Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06372 2026-01-06 cs.SD cs.AI 79%

SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models

SpeakerLM:基于多模态大语言模型的端到端多功能说话人辨识与识别

Han Yin, Yafeng Chen, Chong Deng, Luyao Cheng, Hui Wang, Chao-Hong Tan, Qian Chen, Wen Wang, Xiangang Li

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 SpeakerLM通过多模态大语言模型实现端到端的说话人辨识与识别,结合灵活的说话人注册机制,提升多说话人场景下的识别性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21408 2026-01-06 cs.CV 57%

VALLR: Visual ASR Language Model for Lip Reading

VALLR:基于唇语的视觉ASR语言模型

Marshall Thomas, Edward Fish, Richard Bowden

机构 * University of Surrey(萨里大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 VALLR提出了一种两阶段的视觉ASR语言模型,通过音素序列预测和语言模型重构实现高效率和高精度的唇语识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09921 2026-01-06 cs.CV 57%

TalkingEyes: Pluralistic Speech-Driven 3D Eye Gaze Animation

TalkingEyes: 多元化的语音驱动3D眼动动画

Yixiang Zhuang, Chunshan Ma, Yao Cheng, Xuan Cheng, Jing Liao, Juncong Lin

机构 * School of Informatics, Xiamen University(厦门大学信息学院) China Mobile (Hangzhou) Information Technology Co., Ltd.(中国移动(杭州)信息技术有限公司) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 本文提出TalkingEyes,通过语音驱动生成多样化且自然的3D眼动动画,结合头部和面部运动,解决语音与眼动弱相关性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏