arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2509.14784 2026-01-27 eess.AS 57%

MELA-TTS: Joint transformer-diffusion model with representation alignment for speech synthesis

MELA-TTS:联合变压器-扩散模型与表征对齐用于语音合成

Keyu An, Zhiyu Zhang, Changfeng Gao, Yabin Li, Zhendong Peng, Haoxu Wang, Zhihao Du, Han Zhao, Zhifu Gao, Xiangang Li

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 MELA-TTS通过联合变压器-扩散模型与表征对齐,实现端到端文本到语音合成,提升连续特征建模效率和跨模态一致性。

Comments accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18010 2026-01-27 eess.AS cs.SD 57%

AmbER$^2$: Dual Ambiguity-Aware Emotion Recognition Applied to Speech and Text

AmbER$^2$: 双重模糊感知情感识别应用于语音和文本

Jingyao Wu, Grace Lin, Yinuo Song, Rosalind Picard

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 AmbER$^2$通过双重模糊感知框架提升语音和文本情感识别的准确性与鲁棒性。

Comments Accepted in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03310 2026-01-27 eess.AS 57%

TASU: Text-Only Alignment for Speech Understanding

TASU:用于语音理解的纯文本对齐

Jing Peng, Yi Yang, Xu Li, Yu Xi, Quanwei Tang, Yangui Fang, Junjie Li, Kai Yu

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 TASU通过纯文本数据实现语音理解的跨模态对齐,提升了零样本语音识别性能,并在多个基准测试中优于现有模型。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13651 2026-01-21 cs.CV 57%

Face-Voice Association with Inductive Bias for Maximum Class Separation

人脸-语音关联与最大类别分离的归纳偏置

Marta Moscati, Oleksandr Kats, Mubashir Noman, Muhammad Zaigham Zaheer, Yufang Hou, Markus Schedl, Shah Nawaz

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨) MBZUAI IT:U Interdisciplinary Transformation University Austria(IT:U跨学科转型大学奥地利) Linz Institute of Technology(林茨技术学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于最大类别分离作为归纳偏置的人脸-语音关联方法,通过实验验证其在多模态学习中的有效性。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12844 2026-01-21 cs.CL 57%

Rapport du Projet de Recherche TRAIMA

TRAIMA研究项目报告

Julie Rançon, Jean-François Cerisier, Emilie Remond, Aurélien Nguyen, Andrew Peterson, Ladjel Bellatreche

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 TRAIMA项目旨在建立多模态教学互动自动处理的方法论框架,通过分析课堂互动中的解释性序列,探索机器学习在多模态数据转录和分类中的应用。

Comments in French language

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12700 2026-01-21 eess.AS cs.SD 57%

Improving Audio Question Answering with Variational Inference

通过变分推断改进音频问答

Haolin Chen

机构 * Idiap Research Institute, Martigny, Switzerland(日内瓦研究所) École Polytechnique Fédérale de Lausanne, Lausanne, Switzerland(洛桑联邦理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文通过改进的变分推断优化器提升音频问答任务的预测准确性与校准性。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12289 2026-01-21 cs.SD cs.LG eess.AS 57%

ParaMETA: Towards Learning Disentangled Paralinguistic Speaking Styles Representations from Speech

ParaMETA: 向学习解耦的语音语义说话风格表示迈进

Haowei Lou, Hye-young Paik, Wen Hu, Lina Yao

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 ParaMETA通过统一框架学习解耦的语音语义说话风格表示,实现多任务处理和生成任务中的细粒度风格控制。

Comments 9 pages, 7 figures, Accepted to AAAI-26 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19670 2026-01-16 cs.CL 57%

CoSense-LLM: Semantics at the Edge with Cost- and Uncertainty-Aware Cloud-Edge Cooperation

CoSense-LLM:在成本和不确定性意识下实现边缘语义的云边协作

Hasan Akgul, Mari Eplik, Javier Rojas, Aina Binti Abdullah, Pieter van der Merwe

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 CoSense-LLM通过边缘优先设计,在成本和不确定性意识下实现云边协作,以提供紧凑的语义标记和隐私保护。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13433 2026-01-15 cs.SD eess.AS 57%

MATS: An Audio Language Model under Text-only Supervision

MATS: 一种基于纯文本监督的音频语言模型

Wen Wang, Ruibing Hou, Hong Chang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, China(中国科学院智能信息处理重点实验室(中国科学院)) University of Chinese Academy of Sciences, China(中国科学院大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 MATS通过纯文本监督训练,实现音频理解能力,无需依赖音频数据,展现出与大规模音频-语言对训练模型相当的性能。

Comments Accepted by ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08342 2026-01-14 cs.CL 57%

Detecting Mental Manipulation in Speech via Synthetic Multi-Speaker Dialogue

通过合成多说话对话检测心理操控

Run Chen, Wen Liang, Ziwei Gong, Lin Ai, Julia Hirschberg

机构 * Columbia University(哥伦比亚大学) Red Hat(红帽公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出首个通过合成多说话对话检测心理操控的研究,揭示语音与文本在检测准确性上的差异,强调多模态对话系统中模态意识的重要性。

Comments Accepted to IWSDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07999 2026-01-14 cs.SD eess.AS 57%

VoxCog: Towards End-to-End Multilingual Cognitive Impairment Classification through Dialectal Knowledge

VoxCog: 通过方言知识实现端到端多语言认知障碍分类

Tiantian Feng, Anfeng Xu, Jinkook Lee, Shrikanth Narayanan

机构 * Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California(明斯希德电气与计算机工程系,南加州大学) Dornsife College of Letters, Arts and Sciences, University of Southern California(多恩斯菲学院,南加州大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 VoxCog通过整合方言知识,实现了端到端的多语言认知障碍分类,其语音基础模型在AD和MCI检测中表现出优于多模态集成和大语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04960 2026-01-09 cs.CL cs.SD 57%

A Unified Spoken Language Model with Injected Emotional-Attribution Thinking for Human-like Interaction

具有注入情感归因思维的统一口语语言模型用于人样交互

Qing Wang, Zehan Li, Yaodong Song, Hongjie Chen, Jian Kang, Jie Lian, Jie Li, Yongxiang Li, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI),中国电信,中国)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出一种通过注入情感归因思维提升情感智能的统一口语语言模型,实现人样交互中的情感感知与响应生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21408 2026-01-06 cs.CV 57%

VALLR: Visual ASR Language Model for Lip Reading

VALLR:基于唇语的视觉ASR语言模型

Marshall Thomas, Edward Fish, Richard Bowden

机构 * University of Surrey(萨里大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 VALLR提出了一种两阶段的视觉ASR语言模型,通过音素序列预测和语言模型重构实现高效率和高精度的唇语识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09921 2026-01-06 cs.CV 57%

TalkingEyes: Pluralistic Speech-Driven 3D Eye Gaze Animation

TalkingEyes: 多元化的语音驱动3D眼动动画

Yixiang Zhuang, Chunshan Ma, Yao Cheng, Xuan Cheng, Jing Liao, Juncong Lin

机构 * School of Informatics, Xiamen University(厦门大学信息学院) China Mobile (Hangzhou) Information Technology Co., Ltd.(中国移动(杭州)信息技术有限公司) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 本文提出TalkingEyes,通过语音驱动生成多样化且自然的3D眼动动画,结合头部和面部运动,解决语音与眼动弱相关性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23881 2026-01-01 cs.SD cs.AI cs.CR 57%

Breaking Audio Large Language Models by Attacking Only the Encoder: A Universal Targeted Latent-Space Audio Attack

通过仅攻击编码器打破音频大语言模型:一种通用的目标潜在空间音频攻击

Roee Ziv, Raz Lapid, Moshe Sipper

机构 * Ben Gurion University of the Negev(贝纳乔大学奈夫分校) Deepkeep

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种针对音频大语言模型编码器的通用潜在空间攻击方法,通过操纵音频潜在表示实现目标输出,展示了编码器层面的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21215 2025-12-25 eess.AS 57%

USE: A Unified Model for Universal Sound Separation and Extraction

USE: 一种统一的通用声音分离与提取模型

Hongyu Wang, Chenda Li, Xin Zhou, Shuai Wang, Yanmin Qian

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

AI总结 本文提出USE模型,通过统一框架结合声音分离与目标声音提取,提升两者性能,实验显示在SS和TSE任务中分别取得1.4 dB SDR提升和86%准确率。

Comments Accepted as an oral presentation by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18772 2025-12-23 cs.CV 57%

In-Context Audio Control of Video Diffusion Transformers

上下文音频控制视频扩散变换器

Wenze Liu, Weicai Ye, Minghong Cai, Quande Liu, Xintao Wang, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Kling Team, Kuaishou Technology(快手科技Kling团队)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 本文提出ICAC框架,通过三维注意力机制实现音频驱动的视频生成,解决时间同步信号在视频扩散模型中的整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10624 2025-12-12 cs.CL 57%

AgriGPT-Omni: A Unified Speech-Vision-Text Framework for Multilingual Agricultural Intelligence

AgriGPT-Omni: 一种统一的语音-视觉-文本框架用于多语言农业智能

Bo Yang, Lanfei Feng, Yunkui Chen, Yu Zhang, Jianyu Zhang, Xiao Xu, Nueraili Aierken, Shijian Li

机构 * Zhejiang University(浙江大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 AgriGPT-Omni提出了一种统一的语音-视觉-文本框架,通过数据合成、多阶段训练和三模态基准,提升多语言农业智能的性能和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18708 2025-12-12 cs.CL 57%

The Spatial Semantics of Iconic Gesture

图标手势的空间语义

Andy Lücking, Alexander Henlein, Alexander Mehler

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出了一种空间手势语义学,通过区分图标性三个层面,探讨手势与言语意义的结合方式。

Comments 52 pages, 38 figures, in review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05397 2025-12-09 cs.HC cs.AI 57%

Simulating Life Paths with Digital Twins: AI-Generated Future Selves Influence Decision-Making and Expand Human Choice

用数字双胞胎模拟人生路径:AI生成的未来自我影响决策并拓展人类选择

Rachel Poonsiriwong, Chayapatr Archiwaranguprok, Constanze Albrecht, Peggy Yin, Nattavudh Powdthavee, Hal Hershfield, Monchai Lertsutthiwong, Kavin Winson, Pat Pataranutaporn

机构 * MIT Media Lab(MIT媒体实验室) Stanford University(斯坦福大学) Nanyang Technological University(南洋理工大学) University of California, Los Angeles(加州大学洛杉矶分校) KASIKORN Labs(KASIKORN实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究利用AI生成的未来自我虚拟形象,通过模拟人生路径拓展人类选择,发现平衡呈现和新增选项能有效影响决策,提升自主性认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05508 2025-12-08 cs.SD cs.AI cs.LG 57%

Lyrics Matter: Exploiting the Power of Learnt Representations for Music Popularity Prediction

歌词很重要:利用学习到的表示力预测音乐流行度

Yash Choudhary, Preeti Rao, Pushpak Bhattacharyya

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔) Department of Electrical Engineering, IIT Bombay(印度理工学院班加罗尔电气工程系) CFILT, Department of Computer Science, IIT Bombay(印度理工学院班加罗尔计算机科学系)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型提取歌词嵌入,结合音频和社交数据,提升音乐流行度预测精度,实验显示在SpotGenTrack数据集上MAE和MSE分别提升9%和20%。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01234 2025-12-03 cs.HC cs.AI 57%

Proactive Agentic Whiteboards: Enhancing Diagrammatic Learning

主动代理白板:增强图示学习

Suveen Ellawela, Sashenka Gamage, Dinithi Dissanayake

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 DrawDash通过实时语音驱动的视觉辅助,主动完成和优化教育图表,以减少教师认知负担并提升图示教学效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23404 2025-12-01 cs.LG cs.AI 57%

LFM2 Technical Report

LFM2 技术报告

Alexander Amini, Anna Banaszak, Harold Benoit, Arthur Böök, Tarek Dakhran, Song Duong, Alfred Eng, Fernando Fernandes, Marc Härkönen, Anne Harrington, Ramin Hasani, Saniya Karwa, Yuri Khrustalev, Maxime Labonne, Mathias Lechner, Valentine Lechner, Simon Lee, Zetian Li, Noel Loo, Jacob Marks, Edoardo Mosca, Samuel J. Paech, Paul Pak, Rom N. Parnichkun, Alex Quach, Ryan Rogers, Daniela Rus, Nayan Saxena, Bettina Schlager, Tim Seyde, Jimmy T. H. Smith, Aditya Tadimeti, Neehal Tumma

机构 * Liquid AI

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 LFM2 是一种高效部署且具备强大任务能力的液体基础模型家族,通过紧凑的混合主干和优化训练流程,在多种基准测试中表现出色,支持多模态和检索变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16897 2025-12-01 eess.AS 57%

Balancing Speech Understanding and Generation Using Continual Pre-training for Codec-based Speech LLM

通过持续预训练平衡基于编码器的语音LLM的语音理解和生成

Jiatong Shi, Chunlei Zhang, Jinchuan Tian, Junrui Ni, Hao Zhang, Shinji Watanabe, Dong Yu

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 本文提出通过持续预训练框架平衡基于编码器的语音LLM的语音理解和生成,实现端到端的语音翻译系统,无需中间转录和翻译步骤。

Comments Accepted by ASRU2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20686 2025-11-27 cs.AI cs.CY cs.LG 57%

AssurAI: Experience with Constructing Korean Socio-cultural Datasets to Discover Potential Risks of Generative AI

AssurAI: 韩国社会文化数据集构建经验以发现生成式AI的潜在风险

Chae-Gyun Lim, Seung-Ho Han, EunYoung Byun, Jeongyun Han, Soohyun Cho, Eojin Joo, Heehyeon Kim, Sieun Kim, Juhoon Lee, Hyunsoo Lee, Dongkun Lee, Jonghwan Hyeon, Yechan Hwang, Young-Jun Lee, Kyeongryul Lee, Minhyeong An, Hyunjun Ahn, Jeongwoo Son, Junho Park, Donggyu Yoon, Taehyung Kim, Jeemin Kim, Dasom Choi, Kwangyoung Lee, Hyunseung Lim, Yeohyun Jung, Jongok Hong, Sooyohn Nam, Joonyoung Park, Sungmin Na, Yubin Choi, Jeanne Choi, Yoojin Hong, Sueun Jang, Youngseok Seo, Somin Park, Seoungung Jo, Wonhye Chae, Yeeun Jo, Eunyoung Kim, Joyce Jiyoung Whang, HwaJung Hong, Joseph Seering, Uichin Lee, Juho Kim, Sunna Choi, Seokyeon Ko, Taeho Kim, Kyunghoon Kim, Myungsik Ha, So Jung Lee, Jemin Hwang, JoonHo Kwak, Ho-Jin Choi

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 AssurAI通过构建高质量的韩语多模态数据集,评估生成式AI的安全性,发现潜在风险,促进更安全的AI发展。

Comments 16 pages, HuggingFace: https://huggingface.co/datasets/TTA01/AssurAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20474 2025-11-26 cs.CV cs.LG 57%

Modular Deep Learning Framework for Assistive Perception: Gaze, Affect, and Speaker Identification

模块化深度学习框架用于辅助感知:注视、情绪和说话人识别

Akshit Pramod Anchan, Jewelith Thomas, Sritama Roy

机构 * School of Computer Science and Engineering (SCOPE)(计算机科学与工程学院) Vellore Institute of Technology (VIT)(韦洛雷理工学院) School of Electronics Engineering (SENSE)(电子工程学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出模块化深度学习框架,用于实现注视、情绪和说话人识别的高精度辅助感知技术。

Comments 10 pages, 9 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09439 2025-11-24 eess.AS cs.SD 57%

Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?

Omni-R1:你真的需要音频来微调你的音频大语言模型吗?

Andrew Rouditchenko, Saurabhchand Bhati, Edson Araujo, Samuel Thomas, Hilde Kuehne, Rogerio Feris, James Glass

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Goethe University of Frankfurt(法兰克福歌德大学) IBM Research AI(IBM人工智能研究部) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

AI总结 Omni-R1通过强化学习方法GRPO微调多模态大语言模型,实现了在音频问答任务上的新SOTA性能,同时发现文本推理能力提升对音频性能有显著贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14764 2025-11-20 cs.IR cs.AI 57%

Image-Seeking Intent Prediction for Cross-Device Product Search

Mariya Hendriksen, Svitlana Vakulenko, Jordan Massiah, Gabriella Kazai, Emine Yilmaz

机构 * University of Oxford(牛津大学) Vienna University of Economics and Business(维也纳经济与商业大学) Amazon(亚马逊公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

Comments Oral at RecSys Gen AI for E-commerce 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14255 2025-11-19 cs.CL 57%

AfriSpeech-MultiBench: A Verticalized Multidomain Multicountry Benchmark Suite for African Accented English ASR

Gabrial Zencha Ashungafac, Mardhiyah Sanni, Busayo Awobade, Alex Gichamba, Tobi Olatunji

机构 * Intron Health(Intron健康)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

Comments Accepted As a Conference Paper IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10596 2025-11-19 cs.CY cs.AI cs.HC 57%

GenAI Voice Mode in Programming Education

Sven Jacobs, Natalie Kiesler

机构 * University of Siegen(锡根大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

Comments Accepted for the 25th International Conference on Computing Education Research (Koli Calling '25)

详情

展开后加载摘要…

URL PDF HTML 收藏