arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2604.15037 2026-05-05 cs.AI cs.CL cs.SD 62%

From Reactive to Proactive: Assessing the Proactivity of Voice Agents via ProVoice-Bench

从被动到主动:通过ProVoice-Bench评估语音代理的主动性

Ke Xu, Yuhao Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ProVoice-Bench评估框架,通过四个新任务评估语音代理的主动性,揭示当前模型在过度触发和推理能力上的不足,为开发更自然的主动代理提供方向。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24179 2026-04-29 cs.CL cs.AI 62%

MemeScouts@LT-EDI 2026: Asking the Right Questions -- Prompted Weak Supervision for Meme Hate Speech Detection

MemeScouts@LT-EDI 2026:问对问题——针对弱监督的提示方法用于表情包仇恨言论检测

Ivo Bueno, Lea Hirlimann, Enkelejda Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种提示弱监督方法,通过分解表情包理解为基于问题的标注函数,提升多语言多模态仇恨言论检测效果,尤其在中文和印地语中表现突出。

Comments Accepted at Sixth Workshop on Language Technology for Equality, Diversity and Inclusion at ACL2026 (LT-EDI@ACL26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25383 2026-04-29 cs.SD cs.AI eess.AS 62%

ML-SAN: Multi-Level Speaker-Adaptive Network for Emotion Recognition in Conversations

ML-SAN:多级说话人自适应网络用于对话中的情绪识别

Kexue Wang, Yinfeng Yu, Liejun Wang

机构 * Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学具身智能联合研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(丝绸之路多语种认知计算国际联合研究实验室) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出ML-SAN多级说话人自适应网络,通过三级适应过程解决说话人身份信息混淆问题,提升多轮对话中情绪识别的准确性和鲁棒性。

Comments Main paper (12 pages). Accepted for publication by International Conference on Intelligent Computing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23632 2026-04-28 cs.CV cs.MM cs.SD 62%

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

Hallo-Live: 实时流式联合音频-视频虚拟形象生成与异步双流及以人类为中心的偏好蒸馏

Chunyu Li, Jiaye Li, Ruiqiao Mei, Haoyuan Xia, Hao Zhu, Jingdong Wang, Siyu Zhu

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) Baidu(百度)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Hallo-Live框架,通过异步双流扩散与人类中心偏好蒸馏实现高保真实时音频视频虚拟形象生成,达到高吞吐量与低延迟,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23284 2026-04-28 cs.CL cs.AI 62%

Au-M-ol: A Unified Model for Medical Audio and Language Understanding

Au-M-ol:医疗音频与语言理解的统一模型

Meizhu Liu, Nistha Mitra, Paul Li, Amine Abdaoui, Adam Ledyard, Tao Sheng

机构 * Oracle AI Science(Oracle AI科学) Neuramill

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Au-M-ol模型,通过整合音频处理与大语言模型,提升医疗语音识别等任务的性能,实验显示其将词错误率降低56%,在噪声和专业术语等挑战下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22817 2026-04-28 eess.AS cs.CL cs.LG cs.SD 62%

In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions

In-Sync: 语音感知大语言模型在ASR中的适应性改进:基于词级时间戳预测

Xulin Fan, Vishal Sunder, Samuel Thomas, Mark Hasegawa-Johnson, Brian Kingsbury, George Saon

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM Research(IBM研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出通过词级时间戳预测提升ASR性能,采用轻量训练策略增强对齐鲁棒性,实验证明在多个数据集上提升了时间戳准确性和整体ASR表现。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14294 2026-04-22 cs.SD cs.AI eess.AS 62%

DASB - Discrete Audio and Speech Benchmark

DASB - 离散音频与语音基准

Pooneh Mousavi, Jarod Duret, Darius Petermann, Artem Ploujnikov, Luca Della Libera, Anastasia Kuznetsova, Cem Subakan, Mirco Ravanelli

机构 * Concordia University(康科迪亚大学) Mila-Quebec AI Institute(蒙特利尔AI研究院) Avignon Université(阿维尼昂大学) Université de Montréal(蒙特利尔大学) Université Laval(拉瓦尔大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) Indiana University(印第安纳大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出DASB基准,用于评估离散音频token在语音、通用音频和音乐领域的表现,发现离散表示不如连续表示鲁棒,需精细调参,语义token优于声学token,但与连续特征仍有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15804 2026-04-22 cs.CL eess.AS 62%

Qwen3.5-Omni Technical Report

Qwen3.5-Omni 技术报告

Qwen Team

机构 * Qwen Team(通义实验室)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、eess.AS

AI总结 Qwen3.5-Omni在多模态能力上取得突破,支持256k上下文长度和多语言理解,通过混合注意力MoE架构实现高效推理,并引入ARIA提升语音合成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02908 2026-04-21 cs.CV cs.HC cs.MM 62%

SentiAvatar: Towards Expressive and Interactive Digital Humans

SentiAvatar:迈向表达性和互动性的数字人类

Chuhao Jin, Rui Zhang, Qingzhe Gao, Haoyu Shi, Dayu Wu, Yichen Jiang, Yihan Wu, Ruihua Song

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 Gallagher人工智能学院) SentiPulse College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出SentiAvatar框架,通过构建SuSu虚拟角色,解决多模态数据不足、语义到动作映射和动作语调同步问题,实现高精度实时交互。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20981 2026-04-16 cs.CV cs.AI 62%

Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models

时间回声:解锁视频到音频生成模型中的长度泛化

Christian Simon, Masato Ishii, Wei-Yao Wang, Koichi Saito, Akio Hayakawa, Dongseok Shim, Zhi Zhong, Shuyang Cui, Shusuke Takahashi, Takashi Shibuya, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MMHNet模型,通过层级结构和非因果Mamba实现长音频生成,提升生成长度至5分钟以上,证明短训练长测试的可行性,优于现有视频到音频生成方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11096 2026-04-14 cs.CL cs.AI cs.SD 62%

Efficient Training for Cross-lingual Speech Language Models

多语言语音语言模型的高效训练

Yan Zhou, Qingkai Fang, Yun Hong, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(中国科学院计算技术研究所智能信息处理重点实验室) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CSLM,通过离散语音标记实现多语言语音大模型的高效训练,采用持续预训练策略提升模态对齐质量,减少延迟,展现良好的语言扩展能力。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08384 2026-04-10 eess.AS cs.AI 62%

TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs

TASU2:用于语音大语言模型对齐和低资源适应的可控CTC模拟

Jing Peng, Chenghao Wang, Yi Yang, Lirong Qian, Junjie Li, Yu Xi, Shuai Wang, Kai Yu

机构 * X-LANCE Lab, Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系X-LANCE实验室) MoE Key Lab of Artificial Intelligence(教育部人工智能重点实验室) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) AISpeech Ltd(思必驰科技股份有限公司) Nanjing University(南京大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 TASU2通过可控CTC模拟生成文本监督,提升语音大语言模型的对齐和低资源适应性能,优于TASU和文本细调等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07571 2026-04-07 cs.CL cs.MM 62%

A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification

一种通过语音标记增强预训练语言模型用于分类的简单方法

Nicolas Calbucura, Jose Guillen, Valentin Barriere

机构 * Universidad de Chile, DCC(智利大学计算机科学系) Universidad Tecnica Santa Maria(圣玛利亚理工大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.MM

AI总结 本文提出一种简单方法,通过语音信息增强预训练语言模型以提高分类任务性能,采用多模态词袋表示和自监督语言建模目标,实验证明在论证谬误检测和情感计算任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27538 2026-03-31 cs.CV cs.CL 62%

LongCat-Next: Lexicalizing Modalities as Discrete Tokens

LongCat-Next:将模态词典化为离散标记

Meituan LongCat Team, Bin Xiao, Chao Wang, Chengjiang Li, Chi Zhang, Chong Peng, Hang Yu, Hao Yang, Haonan Yan, Haoze Sun, Haozhe Zhao, Hong Liu, Hui Su, Jiaqi Zhang, Jiawei Wang, Jing Li, Kefeng Zhang, Manyuan Zhang, Minhao Jing, Peng Pei, Quan Chen, Taofeng Xue, Tongxin Pan, Xiaotong Li, Xiaoyang Li, Xiaoyu Zhao, Xing Hu, Xinyang Lin, Xunliang Cai, Yan Bai, Yan Feng, Yanjie Li, Yao Qiu, Yerui Sun, Yifan Lu, Ying Luo, Yipeng Mei, Yitian Chen, Yuchen Xie, Yufang Liu, Yufei Chen, Yulei Qian, Yuqi Peng, Zhihang Yu, Zhixiong Han, Changran Wang, Chen Chen, Dian Zheng, Fengjiao Chen, Ge Yang, Haowei Guo, Haozhe Wang, Hongyu Li, Huicheng Jiang, Jiale Hong, Jialv Zou, Jiamu Li, Jianping Lin, Jiaxing Liu, Jie Yang, Jing Jin, Jun Kuang, Juncheng She, Kunming Luo, Kuofeng Gao, Lin Qiu, Linsen Guo, Mianqiu Huang, Qi Li, Qian Wang, Rumei Li, Siyu Ren, Wei Wang, Wenlong He, Xi Chen, Xiao Liu, Xiaoyu Li, Xu Huang, Xuanyu Zhu, Xuezhi Cao, Yaoming Zhu, Yifei Cao, Yimeng Jia, Yizhen Jiang, Yufei Gao, Zeyang Hu, Zhenlong Yuan, Zijian Zhang, Ziwen Wang

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 LongCat-Next提出了一种统一框架DiNA,通过共享离散空间实现多模态一致建模,引入dNaViT实现任意分辨率的标记化与反标记化,构建出单一自回归目标处理文本、视觉和音频的多模态模型,突破离散视觉建模的性能瓶颈。

Comments LongCat-Next Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16292 2026-03-19 cs.CL cs.AI 62%

Attention-guided Evidence Grounding for Spoken Question Answering

基于注意力的证据 grounding 用于语音问答

Ke Yang, Bolin Chen, Yuejie Li, Yueying Hua, Jianhao Nie, Yueping He, Bowen Li, Chengjun Mao

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于注意力的证据 grounding 方法,通过 SpeechLLM 的内部跨模态注意力机制定位关键证据,减少幻觉并提升效率,优于传统 cascaded 系统。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07323 2026-03-17 cs.SD cs.AI eess.AS 62%

Speech Recognition on TV Series with Video-guided Post-ASR Correction

电视剧中基于视频引导的后ASR校正

Haoyuan Yang, Yue Zhang, Liqiang Jing, John H. L. Hansen

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出视频引导后ASR校正框架,利用视频大模态模型捕捉视频上下文以提升ASR在电视剧等复杂环境中的转录准确性。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12149 2026-03-13 cs.CV cs.CL 62%

Linking Perception, Confidence and Accuracy in MLLMs

将感知、信心与准确性联系起来在多模态大语言模型中

Yuetian Du, Yucheng Wang, Rongyu Zhang, Zhijie Xu, Boyu Yang, Ming Kong, Jie Liu, Qiang Zhu

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出信心驱动强化学习和信心感知测试时扩展,通过校准模型信心提升感知灵敏度和测试效果,实现多模态大语言模型的性能提升。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20900 2026-03-13 cs.SD cs.CL cs.LG eess.AS 62%

Text-only adaptation in LLM-based ASR through text denoising

基于文本去噪的LLM语音识别领域适应

Andrés Carofilis, Sergio Burdisso, Esaú Villatoro-Tello, Shashi Kumar, Kadri Hacioglu, Srikanth Madikeri, Pradeep Rangappa, Manjunath K E, Petr Motlicek, Shankar Venkatesan, Andreas Stolcke

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出通过文本去噪方法实现LLM语音识别领域适应,有效保持跨模态对齐并提升性能,实测在两个数据集上达到22.1%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08249 2026-03-10 eess.AS cs.CL eess.IV 62%

Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios with Synthetic Visual Data

在零音频视频资源场景中利用合成视觉数据进行音频视觉语音识别的提升

Pol Buitrago, Pol Gàlvez, Oriol Pareras, Javier Hernando

机构 * Barcelona Supercomputing Center (BSC), Spain(巴塞罗那超级计算中心(BSC)) Universitat Politècnica de Catalunya (UPC), Spain(巴塞罗那理工大学(UPC))

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出了一种在缺乏真实音频视频资源的情况下,通过合成视觉数据提升音频视觉语音识别性能的方法,实现了在资源匮乏语言上的高效识别。

Comments 6 pages, 3 figures, Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02593 2026-03-10 cs.CL cs.MA cs.NE cs.SD eess.AS 62%

Spoken Conversational Agents with Large Language Models

基于大语言模型的语音对话代理

Chao-Han Huck Yang, Andreas Stolcke, Larry Heck

机构 * NVIDIA Research(NVIDIA研究)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 本文探讨了如何通过大语言模型构建语音对话代理,涵盖从级联到端到端系统的路径,以及跨模态对齐和联合训练等关键技术,同时讨论了隐私、安全和评估中的开放问题。

Comments Accepted to EMNLP 2025 Tutorial

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22321 2026-03-10 cs.SD cs.AI eess.AS 62%

SUBARU: A Practical Approach to Power Saving in Hearables Using SUB-Nyquist Audio Resolution Upsampling

SUBARU:一种用于助听器的实用节能方法,利用SUB-Nyquist音频分辨率上采样

Tarikul Islam Tamiti, Sajid Fardin Dipto, Luke Benjamin Baja-Ricketts, David C Vergano, Anomadarshi Barua

机构 * George Mason University(乔治·马歇尔大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 SUBARU通过子奈奎斯特采样和低位分辨率ADC实现助听器的节能,降低功耗3.31倍,并在移动平台上实现高效的语音增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05270 2026-03-06 eess.AS cs.AI 62%

Visual-Informed Speech Enhancement Using Attention-Based Beamforming

基于视觉信息的语音增强使用注意力束形成

Chihyun Liu, Jiaxuan Fan, Mingtung Sun, Michael Anthony, Mingsian R. Bai, Yu Tsao

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出一种结合视觉信息和注意力机制的神经束形成网络,用于提升语音增强在低信噪比和复杂环境下的性能。

Comments 15 pages, 14 figures

Journal ref IEEE Transactions on Audio, Speech and Language Processing, vol. 33, Volume: 33, pp. 4941-4955, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09984 2026-03-06 cs.CV cs.AI cs.SD 62%

InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions

InterActHuman: 多概念人类动画与布局对齐的音频条件

Zhenzhi Wang, Jiaqi Yang, Jianwen Jiang, Chao Liang, Gaojie Lin, Zerong Zheng, Ceyuan Yang, Yuan Zhang, Mingyuan Gao, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 InterActHuman通过引入布局对齐的音频条件,实现多概念人类动画,支持多身份的精确控制与高质量视频生成。

Comments ICLR 2026 Camera Ready Version. TL;DR: The first multi-person dialogue video generation method from pairs of reference image and audio via explicit layout-aligned condition injection. Project page https://zhenzhiwang.github.io/interacthuman/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01418 2026-03-03 cs.CV cs.MM cs.SD 62%

UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation

UniTalking: 一种统一的音频-视频框架用于说话肖像生成

Hebeizi Li, Zihao Liang, Benyuan Sun, Zihao Yin, Xiao Sha, Chenliang Wang, Yi Yang

机构 * Central Media Technology Institute, Huawei(华为中央媒体技术研究所) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

AI总结 UniTalking提出了一种统一的端到端扩散框架,用于生成高质量的语音和唇同步视频,通过多模态Transformer块和个性化语音克隆技术,提升了视觉保真度和训练效率。

Comments Accepted at CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04134 2026-03-03 cs.CV cs.SD eess.AS 62%

UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation

UniCUE: 中国手语提示语音视频到语音生成统一识别与生成框架

Jinting Wang, Shan Yang, Chenxing Li, Dong Yu, Li Liu

机构 * HKUST-GZ(香港科技大学-珠海校区)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS

AI总结 UniCUE提出首个统一框架,直接从CS视频生成语音,无需中间文本,通过整合姿态感知视觉处理器、语义对齐池和VisioPhonetic适配器,提升语音生成精度。

Comments 13 pages, 12 figures

Journal ref AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17568 2026-03-03 cs.CR cs.AI cs.SD eess.AS 62%

JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models

JALMBench: 对音频语言模型中越权攻击的基准测试

Zifan Peng, Yule Liu, Zhen Sun, Mingchen Li, Zeren Luo, Jingyi Zheng, Wenhan Dong, Xinlei He, Xuechao Wang, Yingjie Xue, Shengmin Xu, Xinyi Huang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学互联网架构国家重点实验室) University of North Texas(北卡罗来纳州立大学) University of Science and Technology of China(中国科学技术大学) Fujian Normal University(福建师范大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 JALMBench通过评估11,316个文本样本和245,355个音频样本,分析LALMs对越权攻击的安全性,揭示模态和架构对安全性的影响,强调需专门设计的防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05115 2026-02-27 cs.GR cs.CV cs.SD eess.AS 62%

RAP: Real-time Audio-driven Portrait Animation with Video Diffusion Transformer

RAP: 基于音频的实时人物动画与视频扩散变换器

Fangyu Du, Taiqing Li, Qian Qiao, Tan Yu, Ziwei Zhang, Dingcheng Zhen, Xu Jia, Yang Yang, Shunshun Yin, Siyuan Liu

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

AI总结 RAP通过混合注意力机制和静态-动态训练-推理范式,在实时约束下实现高质量音频驱动人物动画,提升音频-视觉同步与视觉保真度。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20163 2026-02-25 cs.SD cs.CL eess.AS 62%

Graph Modelling Analysis of Speech-Gesture Interaction for Aphasia Severity Estimation

语音-手势交互的图模型分析用于失语症严重程度估计

Navya Martin Kollapally, Christa Akers, Renjith Nelson Joseph

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出基于图神经网络的框架,通过分析语音和手势的交互来自动估计失语症严重程度。

Comments IJCAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16687 2026-02-19 cs.SD cs.CL eess.AS 62%

Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens

通过交错语义、音频和文本标记扩展开放离散音频基础模型

Potsawee Manakul, Woody Haosheng Gan, Martijn Bartelds, Guangzhi Sun, William Held, Diyi Yang

机构 * Stanford University(斯坦福大学) University of Southern California(南加州大学) University of Cambridge(剑桥大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出SODA模型,通过交错语义、音频和文本标记扩展开放离散音频基础模型,实现通用音频生成和跨模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16008 2026-02-19 cs.SD cs.AI cs.CL cs.LG 62%

MAEB: Massive Audio Embedding Benchmark

MAEB:大规模音频嵌入基准

Adnan El Assadi, Isaac Chung, Chenghao Xiao, Roman Solomatin, Animesh Jha, Rahul Chand, Silky Singh, Kaitlyn Wang, Ali Sartaz Khan, Marc Moussa Nasser, Sufen Fong, Pengfei He, Alan Xiao, Ayush Sunil Munot, Aditya Shrivastava, Artem Gazizov, Niklas Muennighoff, Kenneth Enevoldsen

机构 * Carleton University(卡尔顿大学) Durham University(杜伦大学) Stanford University(斯坦福大学) Aarhus University(奥胡斯大学) Indian Institute of Technology, Kharagpur(印度理工学院,卡里格普) Harvard University(哈佛大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 MAEB是一个涵盖多语言音频任务的基准,揭示了不同模型在音频与语言任务上的性能差异,展示了音频编码器在跨模态任务中的表现关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏