arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

1710.01093 2018-04-26 cs.CV cs.CL eess.AS 67%

Which phoneme-to-viseme maps best improve visual-only computer lip-reading?

Helen L. Bear, Richard W. Harvey, Barry-John Theobald, Yuxuan Lan

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.CL、eess.AS

Journal ref Helen L. Bear, Richard W. Harvey, Barry-John Theobald, and Yuxuan Lan. Which phoneme-to-viseme maps best improve visual-only computer lip-reading? Advances in Visual Computing 2014. p230-239

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.01683 2017-09-07 cs.HC 67%

Affect Recognition in Ads with Application to Computational Advertising

Abhinav Shukla, Shruti Shriya Gullapuram, Harish Katti, Karthik Yadati, Mohan Kankanhalli, Ramanathan Subramanian

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract)

Comments Accepted at the ACM International Conference on Multimedia (ACM MM) 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1701.02477 2017-01-11 cs.CL cs.AI cs.CV cs.LG 67%

Multi-task Learning Of Deep Neural Networks For Audio Visual Automatic Speech Recognition

Abhinav Thanda, Shankar M Venkatesan

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1203.4422 2012-03-21 stat.ML cs.LG 67%

Semi-Supervised Single- and Multi-Domain Regression with Multi-Domain Training

Tomer Michaeli, Yonina C. Eldar, Guillermo Sapiro

专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract)

Comments 24 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13726 2024-09-24 cs.CL cs.AI cs.HC cs.LG 66%

Multilingual Dyadic Interaction Corpus NoXi+J: Toward Understanding Asian-European Non-verbal Cultural Characteristics and their Influences on Engagement

Marius Funk, Shogo Okada, Elisabeth André

专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.CL、cs.AI

Comments 8 pages. 6 figures. International Conference on Multimodal Interaction, November 4-8, 2024, San Jose, Costa Rica

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.03007 2022-02-08 cs.CV cs.SD eess.AS eess.IV 66%

Learning Sound Localization Better From Semantically Similar Samples

Arda Senocak, Hyeonggon Ryu, Junsik Kim, In So Kweon

专题命中 音频语音多模态 :audio-visual(abstract,comments);分类 cs.CV、eess.AS

Comments Accepted to ICASSP 2022. SOTA performance in Audio-Visual Sound Localization. 5 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.05622 2020-11-05 cs.SD cs.CV eess.AS 66%

VoxCeleb2: Deep Speaker Recognition

Joon Son Chung, Arsha Nagrani, Andrew Zisserman

专题命中 音频语音多模态 :audio-visual(abstract,comments);分类 cs.CV、eess.AS

Comments To appear in Interspeech 2018. The audio-visual dataset can be downloaded from http://www.robots.ox.ac.uk/~vgg/data/voxceleb2 . 1806.05622v2: minor fixes; 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.03802 2022-05-10 cs.CV 65%

Past and Future Motion Guided Network for Audio Visual Event Localization

Tingxiu Chen, Jianqin Yin, Jin Tang

专题命中 音频语音多模态 :audio-visual(abstract,comments);分类 cs.CV;multi-modal(comments)

Comments event localization, multi-modal learning, audio-visual learning, audio attention, motion extraction

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26925 2026-08-28 cs.CL eess.AS 新提交 62%

Mapping Written Words to Spoken Words in a Different Language Using Only Visual Grounding

仅使用视觉 grounding 将不同语言的书面词映射到口语词

Gabriel Pirlogeanu, Dan Oneata, Horia Cucu, Herman Kamper

机构 * Politehnica Bucharest(布加勒斯特理工大学) Stellenbosch University(斯坦陵布什大学) Trinity College Dublin(都柏林圣三一学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 本研究针对低资源场景下的语音数据构建问题,提出一种基于自监督语音表示的对齐方法,可从视觉 grounding 数据中直接学习跨语言词到语音的映射,效果优于以往的注意力模型。

Comments 9 pages, 5 figures, 5 tables, preprint, submitted to IEEE Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26432 2026-08-28 cs.SD cs.AI cs.CL 新提交 62%

SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning

SpeechGym:一种用于通过强化学习训练语音智能体的原生音频 Gym

Jiajun Fan, Jingyuan Li, Prashanth Gurunath Shivakumar, Jia-Hong Huang, Qi Luo, M. Maruf, Ivan Bulyko, Ge Liu, Roger Ren

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon AGI Foundations(亚马逊AGI基础研究部)

专题命中 音频语音多模态 :omni-modal(abstract);分类 cs.CL、cs.AI

AI总结 研究针对语音智能体训练中梯度无法流动、难以强化学习的问题,提出原生音频环境 SpeechGym,用每轮过程奖励解决稀疏性问题,使开放权重模型在语音基准上任务成功率翻倍且排名提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26194 2026-08-28 cs.CL cs.AI cs.IR 新提交 62%

A Reranker for Orchestrating Heterogeneous Speech and Text Retrievers

用于协调异构语音和文本检索器的重排序器

Inho Kim, Sumyeong Ahn

机构 * Korea Institute of Energy Technology(韩国能源技术研究院)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态RAG数据库场景,提出STeReO重排序器,构建专用数据集训练后,可有效聚合异构检索结果,显著提升下游问答性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26148 2026-08-28 cs.CL cs.SD eess.AS 新提交 62%

Towards Interpretable Depression Detection: Linking Acoustic Features to DSM-5 Indicators

面向可解释的抑郁检测:将声学特征与DSM-5指标关联

Jonas Länzlinger, Katharina O. E. Müller, Burkhard Stiller, Bruno Rodrigues

机构 * University of St. Gallen HSG(圣加仑大学) University of Zurich UZH(苏黎世大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 该研究提出透明关联框架,将语音声学特征映射到DSM-5抑郁指标,在DAIC-WOZ上初步验证了声学特征与相关指标的关联,实现可解释且隐私保护的抑郁检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06165 2026-08-26 cs.SD cs.AI cs.MM 版本更新 62%

Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset

基于预训练特征、数据增强及新SheetSage-A2S数据集的音频转乐谱转录

Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoru Mo, Yaolong Ju

机构 * University College Dublin(都柏林大学学院) Guangxi Normal University(广西师范大学) Great Bay University(大湾区大学) Shenzhen University(深圳大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 该研究针对流行音乐音频转乐谱研究不足的问题,构建了SheetSage-A2S数据集,结合预训练模型MuQ与数据增强改进A2S方法,在古典与流行音乐基准上均取得优于现有技术的性能。

Comments Accepted at the 34th ACM International Conference on Multimedia (MM '26) 2026-08-25: Edit to drop TeX commands in abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14249 2026-08-26 cs.SD cs.AI eess.AS 版本更新 62%

Do Joint Language-Audio Embeddings Encode Perceptual Timbre Semantics?

联合语言-音频嵌入是否编码感知音色语义?

Qixin Deng, Bryan Pardo, Thrasyvoulos N Pappas

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Computer Science(计算机科学系) Northwestern University(西北大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文评估MS-CLAP等联合语言-音频嵌入模型捕捉感知音色语义的能力,发现LAION-CLAP对齐表现较强但整体有限,混响诱导音色语义的编码一致性优于均衡诱导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22196 2026-08-25 eess.AS cs.CL 新提交 62%

Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction

基于说话人 diarization 的转录校正缓解级联多说话人自动语音识别中的说话人泄漏

Hermann Yepdjio Nkouanga, Minwei Luo, Maggie Wigness, Suresh Singh

机构 * Portland State University(波特兰州立大学) US Army Research Laboratory(美国陆军研究实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 该研究针对级联多说话人自动语音识别中的说话人泄漏问题,提出基于剪枝的校正范式,利用预训练说话人 diarization 模型剪枝转录片段,在多语料库上实现 cpW ER 最高相对降低 29%,提升了转录可靠性。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18904 2026-08-25 cs.SD cs.AI cs.CL eess.AS 交叉投稿 62%

MetaSICL: Globalizing Auditory LLMs for Underserved Speakers and Languages via Meta Speech In-Context Learning

MetaSICL: 通过元语音上下文学习适应听觉大语言模型

Haolong Zheng, Siyin Wang, Zengrui Jin, Mark Hasegawa-Johnson

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出MetaSICL方法,利用高资源语音数据通过元学习增强听觉大语言模型的上下文学习能力,在低资源场景下优于直接微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16205 2026-08-25 cs.CR cs.AI cs.CL cs.LG 62%

Reasoning as a Weapon: Adaptive Dual-Path Jailbreak Attack on Large Language Models

Shi Lin, Peng Qian, Hongming Yang, Renjie Sun, Dezhang Kong, Xun Wang

机构 * Zhejiang Gongshang University(浙江工商大学) Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20387 2026-08-24 cs.CL cs.AI 新提交 62%

Poly-InstructTTS: Learning In-the-Wild Expressive Speech Synthesis from Open-Ended Instructions

Poly-InstructTTS:基于开放式指令学习野外场景下的高表现力语音合成

Junhui Zhang, Qianhui Xu, Qingxiang Guo, Dawei Yang, Ling Miao, Qiangqiang Wang, Yang Song

机构 * ZuoYeBang Technology(作业帮科技)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 针对现有TTS模型难以通过自然语言指令控制细粒度表现力的问题,本文提出Poly-InstructTTS模型,构建1000小时指令标注语料库,采用多模态流水线等技术实现高表现力语音合成,相关成果可在项目页面获取。

Comments Accepted to Interspeech 2026. Demo page: https://zhangjh915.github.io/PolyInstructTTS-demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06040 2026-08-19 cs.SD cs.AI eess.AS 版本更新 62%

Audio Physical Dynamics Inspired Deepfake Detection for Voice Authentication Systems

基于物理的深度伪造检测用于语音认证系统

Alireza Mohammadi, Keshav Sood, Dhananjay Thiruvady, Asef Nazari

机构 * School of Information Technology, Deakin University(信息科技学院,德金大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出一种结合物理指导的深度伪造检测与边缘学习不确定性的框架,用于提升网络语音认证系统的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15734 2026-08-18 eess.AS cs.MM cs.SD 新提交 62%

CineDub: Scaling End-to-End Video Dubbing to Multi-Speaker Dialogues with Coherent Sound Effects

CineDub:将端到端视频配音扩展至带连贯音效的多说话人对话场景

Yusheng Dai, Kangdi Wang, Baolong Gao, Yuxuan Jiang, Weiqiang Wang, Qiuhong Ke, Jianfei Cai

机构 * Monash University(莫纳什大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.MM、eess.AS

AI总结 本研究提出基于扩散模型的统一架构CineDub,无需人脸裁剪或说话人分割即可实现精准多说话人对话配音,还引入两项训练策略并发布两个野外基准,在相关任务中取得最优性能。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26329 2026-08-18 eess.AS cs.CL cs.LG cs.SD 62%

TAU: A Benchmark for Cultural Sound Understanding Beyond Semantics

Yi-Cheng Lin, Yu-Hua Chen, Jia-Kai Dong, Yueh-Hsuan Huang, Szu-Chi Chen, Yu-Chen Chen, Chih-Yao Chen, Yu-Jung Lin, Yu-Ling Chen, Zih-Yu Chen, I-Ning Tsai, Hsiu-Hsuan Wang, Ho-Lam Chung, Ke-Han Lu, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) University of Toronto(多伦多大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments 5 pages; submitted to ICASSP 2026

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2026, pp. 15542-15546

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07665 2026-08-18 cs.CL eess.AS 62%

Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models

Yi-Cheng Lin, Wei-Chih Chen, Hung-yi Lee

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Journal ref 2024 IEEE Spoken Language Technology Workshop (SLT), Macao, 2024, pp. 871-878

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13101 2026-08-14 cs.CL eess.AS 新提交 62%

CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model

CASA:结合语音编码器与大语言模型的内容-语音口语评估

Nhan Phan, Ilona Lähteenmäki, Anna von Zansen, Olli-Pekka Pauna, Yaroslav Getman, Tamás Grósz, Mikko Kurimo

机构 * Aalto University(阿尔托大学) University of Helsinki(赫尔辛基大学) Walton Institute(沃尔顿研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 该研究提出结合Whisper-medium与Qwen3.5-2B的CASA架构,在Speak & Improve Corpus 2025上RMSE达0.358,参数量减半,可分离语音表达与内容,还分析了声学与内容信息的贡献及性能稳定性。

Comments To be submitted to ICASSP 2027. Code is available at https://github.com/aalto-speech/casa

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04111 2026-08-10 cs.CV cs.CL cs.LO 版本更新 62%

GEB-Bench: Abstract Structures Told in Many Voices

GEB-Bench:多视角呈现的抽象结构

Tong Zhang, Zhiyuan Shi, Yun Peng, Tao Xie

机构 * Fudan University(复旦大学) Peking University(北京大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本研究推出GEB-Bench基准,评估12种模型发现其在结构识别与跨视角映射间存在差距,仅前沿模型能缩小该差距,且表面复杂性会增加模型负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04586 2026-08-07 cs.CL cs.AI 版本更新 62%

Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders

通过资源感知型语音编码器混合模型打破多对多语音到文本翻译中的多语言性诅咒

Yexing Du, Kaiyuan Liu, Youcheng Pan, Bo Yang, Chengpeng Fu, Yu Wang, Ming Liu

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 针对多对多语音到文本翻译中的多语言性诅咒问题,提出资源感知型MoSE框架与五阶段课程学习策略,其4B参数模型在45种语言的全方向翻译任务上实现最优性能,显著提升低资源语言表现且不损害高资源性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03942 2026-08-05 cs.SD cs.CL cs.MM 版本更新 62%

MIDI-LLM: Improving Text-to-MIDI Music Generation via Adapting Large Language Models

MIDI-LLM:通过适配大语言模型改进文本到MIDI的音乐生成

Shih-Lun Wu, Dave Carlton, Ryan Miyakawa, Yoon Kim, Chris Donahue, Cheng-Zhi Anna Huang

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.MM

AI总结 该研究提出MIDI-LLM,通过适配Llama 3.2(1B)采用两阶段训练改进文本到MIDI生成,在用户研究中证实其在人机音乐协同创作中的有效性。

Comments Accepted to International Society for Music Information Retrieval (ISMIR) Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24430 2026-07-28 cs.HC cs.CL eess.AS 新提交 62%

Let Me Look at You: Advanced Facial Expression Modeling for Conversational Speech Synthesis

让我看着你:用于对话语音合成的高级面部表情建模

Yifan Hu, Shuwei He, Rui Liu, Haizhou Li

机构 * Inner Mongolia University(内蒙古大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 研究针对对话语音合成中面部表情线索常被忽视及缺乏多模态数据集的问题,提出基于大语言模型的FacialTalker框架,含AUTokenizer和DualDPO策略,构建VSDD-1K数据集,实验表明该框架在表情感知和语音合成质量上表现出色。

Comments 10 pages, 5 figures, 5 tables. Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23808 2026-07-28 cs.CL cs.AI 新提交 62%

Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages

Indic DiarBench:印度语言的多语言联合语音分离与自动语音识别基准

Deovrat Mehendale, Aditya Mehndiratta, Dhruv Rathi, Kaushal Bhogale, Mitesh M. Khapra

机构 * Sarvam AI(萨尔瓦姆人工智能公司) AI4Bharat, IIT Madras(印度理工学院马德拉斯分校人工智能促进印度发展实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 介绍涵盖印度22种在册语言的Indic DiarBench基准数据集,含约108小时多说话者音频,经人工校正注释。通过评估领先系统建立基线,该数据集作为开放资源推动印度语言多语言语音技术研究。

Comments 5 pages, 2 figures, Interspeech 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02770 2026-07-27 cs.CL cs.AI 版本更新 62%

Gemma 4 Technical Report

Gemma 4技术报告

Gemma Team, Sherif El Abd, Vaibhav Aggarwal, Robin Algayres, Alek Andreev, Olivier Bachem, Ian Ballantyne, Cormac Brick, Victor Cărbune, Michelle Casbon, Mayank Chaturvedi, Aditya Chawla, Victor Cotruta, Alice Coucke, Phil Culliton, Robert Dadashi, Lucas Dixon, Mohamed Elhawaty, Utku Evci, Clément Farabet, Johan Ferret, Filippo Galgani, Sertan Girgin, Jean-Bastien Grill, Maarten Grootendorst, Jiaxian Guo, Cassidy Hardin, Yanzhang He, Steven M. Hernandez, Omri Homburger, Léonard Hussenot, Juyeong Ji, Armand Joulin, Aishwarya Kamath, Parnian Kassraie, Olivier Lacombe, Preethi Lahoti, Gaël Liu, Gus Martins, Luciano Martins, Tatiana Matejovicova, Ramona Merhej, Nikola Momchev, Sneha Mondal, Ryan Mullins, Sindhu Raghuram Panyam, Shreya Pathak, Sarah Perrin, André Susano Pinto, Etienne Pot, Angéline Pouget, Alexandre Ramé, Sabela Ramos, Douglas Reid, David Rim, Morgane Rivière, Karsten Roth, Louis Rouillard, Omar Sanseviero, Pier Giuseppe Sessa, Shane Settle, Danila Sinopalnikov, Sara Smoot, Piotr Stanczyk, Andreas Steiner, Lawrence Stewart, Ilya Tolstikhin, Michael Tschannen, Anton Tsitsulin, Nino Vieillard, Renjie Wu, Pingmei Xu, Haichuan Yang, Edouard Yvinec, Biao Zhang, Li Zhang, Joe Zou, Nicolas Aagnes, Abdelrahman Abdelhamed, Jakub Adamek, Shivani Agrawal, Shubham Agrawal, Ibrahim Alabdulmohsin, Jean Baptiste Alayrac, Uri Alon, Chandramouli Amarnath, Ankesh Anand, Chrysovalantis Anastasiou, Setareh Ariafar, François-Xavier Aubet, Kyriakos Axiotis, Federico Barbero, Joelle Barral, Alexei Bendebury, Urs Bergmann, Stanley Bileschi, Kat Black, Mathieu Blondel, Sebastian Borgeaud, Arthur Bražinskas, Ryan Burnell, Robert Busa-Fekete, Mu Cai, Daniele Calandriello, Glenn Cameron, Charlotte Caucheteux, Rahma Chaabouni, Garima Chadha, Jetha Chan, Blake Jianhang Chen, Jesse Chen, Lin Chen, Xu Chen, Derek Cheng, Tzu-hsiang Chien, Nikolai Chinaev, Yi Chou, Zhaohui Chu, Benjamin Coleman, Pooja Consul, Sam Conway-Rahman, Scott Crowell, Dylan Cutler, Vivek Dani, Samira Daruki, Anil Das, Daniel Deutsch, Nishanth Dikkala, Li Ding, Qiuhan Ding, Shenil Dodhia, Konstantin Donhauser, Tulsee Doshi, Anca Dragan, Alex Druinsky, Sahil Dua, Zoltan Egyed, Danielle Eisenbud, Daniel Eppens, Cindy Fan, Bahare Fatemi, Yassir Fathullah, Vlad Feinberg, Milen Ferev, Sebastian Flennerhag, Takumi Fujimoto, João Gabriel Oliveira, Isaac Galatzer-Levy, João Gante, Simon Geisler, Soham Ghosal, Antonious M. Girgis, Tamara von Glehn, Alec Go, Alhaad Gokhale, Alex Grills, Yiming Gu, Mayank Gupta, Pramod Gupta, Guru Guruganesh, Raia Hadsell, Hamza Harkous, Jitendra Harlalka, Demis Hassabis, Anja Hauth, Joe Heyward, Arian Hosseini, Chih-Yang Hsia, I-Hung Hsu, Xiaopeng Huang, Yangsibo Huang, Kevin Hui, Adrian Hutter, Te I, Fotis Iliopoulos, Advait Jain, Ganesh Jawahar, Ziwei Ji, Qilin Jin, Melvin Johnson, Kandarp Joshi, Arun Kandoor, Wang-Cheng Kang, Koray Kavukcuoglu, Mehran Kazemi, Kathleen Kenealy, Amr Khalifa, Phoebe Kirk, Ivan Korotkov, Suraj Kothawade, Vitaly Kovalev, Neel Kovelamudi, Adam Kraft, Ravin Kumar, Vivek Kumar, Harish Kuppam, Justin Lannin, Chen-Yu Lee, Seungji Lee, Dmitry Lepikhin, Alon Levkovitch, Dongdong Li, Qiujia Li, Valentin Liévin, Ethan Lin, Ziqian Lin, Casper Liu, Tianlin Liu, Tianqi Liu, Xin Liu, Ivan Lobov, Mayank Lunayach, Min Ma, Gagan Madan, Andrii Maksai, Eric Malmi, Michal Matuszak, Daniel McDuff, Gaurav Menghani, Maciej Mikuła, Daniil Mirylenka, Karolis Misiunas, Vedant Misra, Andreea Mitran, Kareem Mohamed, Maksim Mukha, Eric Noland, James O'Donnell, Brendan O'Donoghue, Kate Olszewska, Bernett Orlando, Wanqiong Pan, Rina Panigrahy, Unnati Parekh, Nicolas Perez-Nieves, Chunjong Park, Eric Paskie, Liqian Peng, Bryce Petrini, Slav Petrov, Jonas Pfeiffer, Bilal Piot, Martyna Plomecka, Siim Poder, Octavio Ponce, Arijit Pramanik, David Racz, Anish Rajan, Michelle Ramanovich, Anand Rao, Marvin Ritter, Vitor Rodrigues, Evan Rosen, Mikołaj Rybiński, Noveen Sachdeva, Michaël E. Sander, Rohit Sathyanarayana, Sagar Savla, Samuel Schmidgall, Tal Schuster, George Scrivener, Benoit Seguin, Andrew Sellergren, Aliaksei Severyn, Izhak Shafran, Dhruv Shah, Bobak Shahriari, Yuan Shangguan, Ashish Shenoy, Pradeep Shenoy, Rakesh Shivanna, Pauline Sho, Lucas Spangher, Wojciech Stokowiec, Tim Strother, Yao Su, Yinghao Sun, Mukund Sundararajan, Andrea Tacchetti, Mor Hazan Taege, Pouya Tafti, Jean Tarbouriech, Chetan Tekur, Shantanu Thakoor, Rahul Thapa, Madeleine Traverse, Lenart Treven, Tao Tu, Chien Te Tung, Çağlar Ünlü, Petar Veličković, Malini Pooni Venkat, Sagar Gubbi Venkatesh, Vidya Venkiteswaran, Francesco Visin, Alex Vitvitskyi, Kiran Vodrahalli, Weiyi Wang, Xin Wang, Tris Warkentin, Jan Wassenberg, John Wieting, Cindy Wu, Lechao Xiao, Hao Xu, Yuhui Xu, Fuzhao Xue, Arun Yadav, Jun Yan, Antoine Yang, Lin Yang, Ming-Hsuan Yang, Ziyu Ying, Jae Hyeon Yoo, Morteza Zadimoghaddam, Sajjad Zafar, Fred Zhang, Jiageng Zhang, Jianyi Zhang, Xiaofan Zhang, Chao Zhao, David Zhou, Chen Zou

机构 * Google DeepMind(谷歌DeepMind)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 介绍新一代Gemma 4开源多模态语言模型,通过密集和专家混合架构提升计算效率与推理能力,提出统一无编码器架构,集成思考模式,改进多方面性能,在多基准测试中有显著提升。

Comments 17 pages, 2 figures, technical report, updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28445 2026-07-23 cs.SD cs.AI cs.CL cs.LG 版本更新 62%

LoRA-Tuned Large Language Models for Dementia Detection via Multi-View Speech-Derived Features

基于多视角语音特征的LoRA微调大语言模型用于痴呆检测

Jonghyeon Park, Olivier Jiyoun Jung, Myungwoo Oh

机构 * NAVER Cloud(NAVER云) Division of Communication and Media, Ewha Womans University(通信与媒体系,成均馆大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出LoRA微调LLM,通过统一提示整合ASR转录、话语主题、时间流畅度和音韵序列四种语音特征,实现多视角推理,在ADReSSo上F1达90.14%。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏