arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-19 至 2026-01-19 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2506.05879 2026-01-19 cs.HC 82%

Human-AI Alignment of Multimodal Large Language Models with Speech-Language Pathologists in Parent-Child Interactions

与语言病理学家在亲子互动中的人机对齐多模态大语言模型

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract)

AI总结 本研究通过多模态大语言模型与语言病理学家的对齐,开发了支持亲子互动分析的系统,实现了85%的感知线索提取准确率和75%的判断精确率,并提出了行为观察-判断系统的构建指南。

Comments This is an earlier version of the work released in May 2025. The version accepted at CHI 2026 is available as a separate preprint at arXiv:2511.04366

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01166 2026-01-19 cs.SD 78%

Hearing More with Less: Multi-Modal Retrieval-and-Selection Augmented Conversational LLM-Based ASR

听更清晰,用更少:多模态检索与选择增强的对话式LLM基于ASR

Bingshen Mu, Hexin Liu, Hongfei Xue, Kun Wei, Lei Xie

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 本文提出MARS方法,通过多模态检索与选择提升对话式LLM-ASR的准确性,仅用1.5K小时数据即可超越训练于179K小时数据的顶级系统。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12537 2026-01-19 cs.CL cs.AI eess.AS 67%

What Makes a Good Speech Tokenizer for LLM-Centric Speech Generation? A Systematic Study

什么使LLM为中心的语音生成中的良好语音分词器?系统研究

Xiaoran Fan, Zhichao Sun, Yangfan Gao, Jingfei Xiong, Hang Yan, Yifei Cao, Jiajun Sun, Shuo Li, Zhihao Zhang, Zhiheng Xi, Yuhao Zhou, Senjie Jin, Changhao Jiang, Junjie Ye, Ming Zhang, Rui Zheng, Zhenhua Han, Yunke Zhang, Demei Yan, Shaokang Dong, Tao Ji, Tao Gui

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文研究了LLM为中心的语音生成中语音分词器设计的影响,通过引入多令牌预测和说话人感知生成,提升了语音生成的质量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11262 2026-01-19 cs.SD cs.IR cs.LG 50%

Scalable Music Cover Retrieval Using Lyrics-Aligned Audio Embeddings

基于歌词对齐音频嵌入的可扩展音乐封面检索

Joanne Affolter, Benjamin Martin, Elena V. Epure, Gabriel Meseguer-Brocal, Frédéric Kaplan

机构 * Deezer Research, Paris, France(DeepZoom研究机构,法国巴黎) EPFL, Lausanne, Switzerland(瑞士洛桑联邦理工学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 LIVI通过利用歌词信息提升音乐封面检索的准确性和效率,减少对复杂模型的依赖。

Comments Published at ECIR 2026 (European Conference of Information Retrieval)

详情

展开后加载摘要…

URL PDF HTML 收藏