arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4597 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2604.02908 2026-04-21 cs.CV cs.HC cs.MM 62%

SentiAvatar: Towards Expressive and Interactive Digital Humans

SentiAvatar:迈向表达性和互动性的数字人类

Chuhao Jin, Rui Zhang, Qingzhe Gao, Haoyu Shi, Dayu Wu, Yichen Jiang, Yihan Wu, Ruihua Song

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 Gallagher人工智能学院) SentiPulse College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出SentiAvatar框架,通过构建SuSu虚拟角色,解决多模态数据不足、语义到动作映射和动作语调同步问题,实现高精度实时交互。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20981 2026-04-16 cs.CV cs.AI 62%

Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models

时间回声:解锁视频到音频生成模型中的长度泛化

Christian Simon, Masato Ishii, Wei-Yao Wang, Koichi Saito, Akio Hayakawa, Dongseok Shim, Zhi Zhong, Shuyang Cui, Shusuke Takahashi, Takashi Shibuya, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MMHNet模型,通过层级结构和非因果Mamba实现长音频生成,提升生成长度至5分钟以上,证明短训练长测试的可行性,优于现有视频到音频生成方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11096 2026-04-14 cs.CL cs.AI cs.SD 62%

Efficient Training for Cross-lingual Speech Language Models

多语言语音语言模型的高效训练

Yan Zhou, Qingkai Fang, Yun Hong, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(中国科学院计算技术研究所智能信息处理重点实验室) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CSLM,通过离散语音标记实现多语言语音大模型的高效训练,采用持续预训练策略提升模态对齐质量,减少延迟,展现良好的语言扩展能力。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08384 2026-04-10 eess.AS cs.AI 62%

TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs

TASU2:用于语音大语言模型对齐和低资源适应的可控CTC模拟

Jing Peng, Chenghao Wang, Yi Yang, Lirong Qian, Junjie Li, Yu Xi, Shuai Wang, Kai Yu

机构 * X-LANCE Lab, Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系X-LANCE实验室) MoE Key Lab of Artificial Intelligence(教育部人工智能重点实验室) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) AISpeech Ltd(思必驰科技股份有限公司) Nanjing University(南京大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 TASU2通过可控CTC模拟生成文本监督,提升语音大语言模型的对齐和低资源适应性能,优于TASU和文本细调等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07571 2026-04-07 cs.CL cs.MM 62%

A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification

一种通过语音标记增强预训练语言模型用于分类的简单方法

Nicolas Calbucura, Jose Guillen, Valentin Barriere

机构 * Universidad de Chile, DCC(智利大学计算机科学系) Universidad Tecnica Santa Maria(圣玛利亚理工大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.MM

AI总结 本文提出一种简单方法,通过语音信息增强预训练语言模型以提高分类任务性能,采用多模态词袋表示和自监督语言建模目标,实验证明在论证谬误检测和情感计算任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27538 2026-03-31 cs.CV cs.CL 62%

LongCat-Next: Lexicalizing Modalities as Discrete Tokens

LongCat-Next:将模态词典化为离散标记

Meituan LongCat Team, Bin Xiao, Chao Wang, Chengjiang Li, Chi Zhang, Chong Peng, Hang Yu, Hao Yang, Haonan Yan, Haoze Sun, Haozhe Zhao, Hong Liu, Hui Su, Jiaqi Zhang, Jiawei Wang, Jing Li, Kefeng Zhang, Manyuan Zhang, Minhao Jing, Peng Pei, Quan Chen, Taofeng Xue, Tongxin Pan, Xiaotong Li, Xiaoyang Li, Xiaoyu Zhao, Xing Hu, Xinyang Lin, Xunliang Cai, Yan Bai, Yan Feng, Yanjie Li, Yao Qiu, Yerui Sun, Yifan Lu, Ying Luo, Yipeng Mei, Yitian Chen, Yuchen Xie, Yufang Liu, Yufei Chen, Yulei Qian, Yuqi Peng, Zhihang Yu, Zhixiong Han, Changran Wang, Chen Chen, Dian Zheng, Fengjiao Chen, Ge Yang, Haowei Guo, Haozhe Wang, Hongyu Li, Huicheng Jiang, Jiale Hong, Jialv Zou, Jiamu Li, Jianping Lin, Jiaxing Liu, Jie Yang, Jing Jin, Jun Kuang, Juncheng She, Kunming Luo, Kuofeng Gao, Lin Qiu, Linsen Guo, Mianqiu Huang, Qi Li, Qian Wang, Rumei Li, Siyu Ren, Wei Wang, Wenlong He, Xi Chen, Xiao Liu, Xiaoyu Li, Xu Huang, Xuanyu Zhu, Xuezhi Cao, Yaoming Zhu, Yifei Cao, Yimeng Jia, Yizhen Jiang, Yufei Gao, Zeyang Hu, Zhenlong Yuan, Zijian Zhang, Ziwen Wang

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 LongCat-Next提出了一种统一框架DiNA,通过共享离散空间实现多模态一致建模,引入dNaViT实现任意分辨率的标记化与反标记化,构建出单一自回归目标处理文本、视觉和音频的多模态模型,突破离散视觉建模的性能瓶颈。

Comments LongCat-Next Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16292 2026-03-19 cs.CL cs.AI 62%

Attention-guided Evidence Grounding for Spoken Question Answering

基于注意力的证据 grounding 用于语音问答

Ke Yang, Bolin Chen, Yuejie Li, Yueying Hua, Jianhao Nie, Yueping He, Bowen Li, Chengjun Mao

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于注意力的证据 grounding 方法,通过 SpeechLLM 的内部跨模态注意力机制定位关键证据,减少幻觉并提升效率,优于传统 cascaded 系统。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07323 2026-03-17 cs.SD cs.AI eess.AS 62%

Speech Recognition on TV Series with Video-guided Post-ASR Correction

电视剧中基于视频引导的后ASR校正

Haoyuan Yang, Yue Zhang, Liqiang Jing, John H. L. Hansen

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出视频引导后ASR校正框架,利用视频大模态模型捕捉视频上下文以提升ASR在电视剧等复杂环境中的转录准确性。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12149 2026-03-13 cs.CV cs.CL 62%

Linking Perception, Confidence and Accuracy in MLLMs

将感知、信心与准确性联系起来在多模态大语言模型中

Yuetian Du, Yucheng Wang, Rongyu Zhang, Zhijie Xu, Boyu Yang, Ming Kong, Jie Liu, Qiang Zhu

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出信心驱动强化学习和信心感知测试时扩展,通过校准模型信心提升感知灵敏度和测试效果,实现多模态大语言模型的性能提升。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20900 2026-03-13 cs.SD cs.CL cs.LG eess.AS 62%

Text-only adaptation in LLM-based ASR through text denoising

基于文本去噪的LLM语音识别领域适应

Andrés Carofilis, Sergio Burdisso, Esaú Villatoro-Tello, Shashi Kumar, Kadri Hacioglu, Srikanth Madikeri, Pradeep Rangappa, Manjunath K E, Petr Motlicek, Shankar Venkatesan, Andreas Stolcke

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出通过文本去噪方法实现LLM语音识别领域适应,有效保持跨模态对齐并提升性能,实测在两个数据集上达到22.1%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08249 2026-03-10 eess.AS cs.CL eess.IV 62%

Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios with Synthetic Visual Data

在零音频视频资源场景中利用合成视觉数据进行音频视觉语音识别的提升

Pol Buitrago, Pol Gàlvez, Oriol Pareras, Javier Hernando

机构 * Barcelona Supercomputing Center (BSC), Spain(巴塞罗那超级计算中心(BSC)) Universitat Politècnica de Catalunya (UPC), Spain(巴塞罗那理工大学(UPC))

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出了一种在缺乏真实音频视频资源的情况下,通过合成视觉数据提升音频视觉语音识别性能的方法,实现了在资源匮乏语言上的高效识别。

Comments 6 pages, 3 figures, Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02593 2026-03-10 cs.CL cs.MA cs.NE cs.SD eess.AS 62%

Spoken Conversational Agents with Large Language Models

基于大语言模型的语音对话代理

Chao-Han Huck Yang, Andreas Stolcke, Larry Heck

机构 * NVIDIA Research(NVIDIA研究)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 本文探讨了如何通过大语言模型构建语音对话代理,涵盖从级联到端到端系统的路径,以及跨模态对齐和联合训练等关键技术,同时讨论了隐私、安全和评估中的开放问题。

Comments Accepted to EMNLP 2025 Tutorial

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22321 2026-03-10 cs.SD cs.AI eess.AS 62%

SUBARU: A Practical Approach to Power Saving in Hearables Using SUB-Nyquist Audio Resolution Upsampling

SUBARU:一种用于助听器的实用节能方法,利用SUB-Nyquist音频分辨率上采样

Tarikul Islam Tamiti, Sajid Fardin Dipto, Luke Benjamin Baja-Ricketts, David C Vergano, Anomadarshi Barua

机构 * George Mason University(乔治·马歇尔大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 SUBARU通过子奈奎斯特采样和低位分辨率ADC实现助听器的节能,降低功耗3.31倍,并在移动平台上实现高效的语音增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05270 2026-03-06 eess.AS cs.AI 62%

Visual-Informed Speech Enhancement Using Attention-Based Beamforming

基于视觉信息的语音增强使用注意力束形成

Chihyun Liu, Jiaxuan Fan, Mingtung Sun, Michael Anthony, Mingsian R. Bai, Yu Tsao

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出一种结合视觉信息和注意力机制的神经束形成网络,用于提升语音增强在低信噪比和复杂环境下的性能。

Comments 15 pages, 14 figures

Journal ref IEEE Transactions on Audio, Speech and Language Processing, vol. 33, Volume: 33, pp. 4941-4955, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09984 2026-03-06 cs.CV cs.AI cs.SD 62%

InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions

InterActHuman: 多概念人类动画与布局对齐的音频条件

Zhenzhi Wang, Jiaqi Yang, Jianwen Jiang, Chao Liang, Gaojie Lin, Zerong Zheng, Ceyuan Yang, Yuan Zhang, Mingyuan Gao, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 InterActHuman通过引入布局对齐的音频条件,实现多概念人类动画,支持多身份的精确控制与高质量视频生成。

Comments ICLR 2026 Camera Ready Version. TL;DR: The first multi-person dialogue video generation method from pairs of reference image and audio via explicit layout-aligned condition injection. Project page https://zhenzhiwang.github.io/interacthuman/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01418 2026-03-03 cs.CV cs.MM cs.SD 62%

UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation

UniTalking: 一种统一的音频-视频框架用于说话肖像生成

Hebeizi Li, Zihao Liang, Benyuan Sun, Zihao Yin, Xiao Sha, Chenliang Wang, Yi Yang

机构 * Central Media Technology Institute, Huawei(华为中央媒体技术研究所) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

AI总结 UniTalking提出了一种统一的端到端扩散框架,用于生成高质量的语音和唇同步视频,通过多模态Transformer块和个性化语音克隆技术,提升了视觉保真度和训练效率。

Comments Accepted at CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04134 2026-03-03 cs.CV cs.SD eess.AS 62%

UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation

UniCUE: 中国手语提示语音视频到语音生成统一识别与生成框架

Jinting Wang, Shan Yang, Chenxing Li, Dong Yu, Li Liu

机构 * HKUST-GZ(香港科技大学-珠海校区)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS

AI总结 UniCUE提出首个统一框架,直接从CS视频生成语音,无需中间文本,通过整合姿态感知视觉处理器、语义对齐池和VisioPhonetic适配器,提升语音生成精度。

Comments 13 pages, 12 figures

Journal ref AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17568 2026-03-03 cs.CR cs.AI cs.SD eess.AS 62%

JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models

JALMBench: 对音频语言模型中越权攻击的基准测试

Zifan Peng, Yule Liu, Zhen Sun, Mingchen Li, Zeren Luo, Jingyi Zheng, Wenhan Dong, Xinlei He, Xuechao Wang, Yingjie Xue, Shengmin Xu, Xinyi Huang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学互联网架构国家重点实验室) University of North Texas(北卡罗来纳州立大学) University of Science and Technology of China(中国科学技术大学) Fujian Normal University(福建师范大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 JALMBench通过评估11,316个文本样本和245,355个音频样本,分析LALMs对越权攻击的安全性,揭示模态和架构对安全性的影响,强调需专门设计的防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05115 2026-02-27 cs.GR cs.CV cs.SD eess.AS 62%

RAP: Real-time Audio-driven Portrait Animation with Video Diffusion Transformer

RAP: 基于音频的实时人物动画与视频扩散变换器

Fangyu Du, Taiqing Li, Qian Qiao, Tan Yu, Ziwei Zhang, Dingcheng Zhen, Xu Jia, Yang Yang, Shunshun Yin, Siyuan Liu

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

AI总结 RAP通过混合注意力机制和静态-动态训练-推理范式,在实时约束下实现高质量音频驱动人物动画,提升音频-视觉同步与视觉保真度。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20163 2026-02-25 cs.SD cs.CL eess.AS 62%

Graph Modelling Analysis of Speech-Gesture Interaction for Aphasia Severity Estimation

语音-手势交互的图模型分析用于失语症严重程度估计

Navya Martin Kollapally, Christa Akers, Renjith Nelson Joseph

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出基于图神经网络的框架,通过分析语音和手势的交互来自动估计失语症严重程度。

Comments IJCAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16687 2026-02-19 cs.SD cs.CL eess.AS 62%

Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens

通过交错语义、音频和文本标记扩展开放离散音频基础模型

Potsawee Manakul, Woody Haosheng Gan, Martijn Bartelds, Guangzhi Sun, William Held, Diyi Yang

机构 * Stanford University(斯坦福大学) University of Southern California(南加州大学) University of Cambridge(剑桥大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出SODA模型,通过交错语义、音频和文本标记扩展开放离散音频基础模型,实现通用音频生成和跨模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16008 2026-02-19 cs.SD cs.AI cs.CL cs.LG 62%

MAEB: Massive Audio Embedding Benchmark

MAEB:大规模音频嵌入基准

Adnan El Assadi, Isaac Chung, Chenghao Xiao, Roman Solomatin, Animesh Jha, Rahul Chand, Silky Singh, Kaitlyn Wang, Ali Sartaz Khan, Marc Moussa Nasser, Sufen Fong, Pengfei He, Alan Xiao, Ayush Sunil Munot, Aditya Shrivastava, Artem Gazizov, Niklas Muennighoff, Kenneth Enevoldsen

机构 * Carleton University(卡尔顿大学) Durham University(杜伦大学) Stanford University(斯坦福大学) Aarhus University(奥胡斯大学) Indian Institute of Technology, Kharagpur(印度理工学院,卡里格普) Harvard University(哈佛大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 MAEB是一个涵盖多语言音频任务的基准,揭示了不同模型在音频与语言任务上的性能差异,展示了音频编码器在跨模态任务中的表现关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14224 2026-02-17 cs.SD cs.CL cs.MM 62%

The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents

Interspeech 2026音频推理挑战:评估音频推理模型和代理的推理过程质量

Ziyang Ma, Ruiyang Xu, Yinghao Ma, Chao-Han Huck Yang, Bohan Li, Jaeyeon Kim, Jin Xu, Jinyu Li, Carlos Busso, Kai Yu, Eng Siong Chng, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Queen Mary University of London(伦敦大学Queen Mary) NVIDIA(NVIDIA公司) Carnegie Mellon University(卡内基梅隆大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) Microsoft Corporation(微软公司)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.MM

AI总结 Interspeech 2026音频推理挑战通过评估推理过程质量,探讨了音频推理模型和代理在事实性和逻辑性方面的表现及改进方向。

Comments The official website of the Audio Reasoning Challenge: https://audio-reasoning-challenge.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13455 2026-02-17 cs.CL cs.AI cs.HC 62%

Using Machine Learning to Enhance the Detection of Obfuscated Abusive Words in Swahili: A Focus on Child Safety

利用机器学习增强斯瓦希里语中隐晦侮辱性词汇的检测:聚焦儿童安全

Phyllis Nabangi, Abdul-Jalil Zakaria, Jema David Ndibwile

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究利用机器学习方法提升斯瓦希里语中隐晦侮辱性词汇的检测能力,旨在提高儿童网络环境的安全性。

Comments Accepted at the Second IJCAI AI for Good Symposium in Africa, hosted by Deep Learning Indaba, 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07969 2026-02-16 eess.AS cs.AI cs.LG cs.SD 62%

Tuberculosis Screening from Cough Audio: Baseline Models, Clinical Variables, and Uncertainty Quantification

咳嗽音频中肺结核筛查:基线模型、临床变量和不确定性量化

George P. Kafentzis, Efstratios Selisios

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出了一种标准化框架,用于通过咳嗽音频和临床数据检测肺结核,通过建立基线模型和量化不确定性,提供公平比较的参考点。

Comments Updated to published version in Sensors; DOI: 10.3390/s26041223

Journal ref Sensors 2026, 26(4), 1223

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12302 2026-02-16 cs.CL cs.CV 62%

Grandes Modelos de Linguagem Multimodais (MLLMs): Da Teoria à Prática

大规模多模态语言模型(MLLMs):从理论到实践

Neemias da Silva, Júlio C. W. Scholz, John Harrison, Marina Borges, Paulo Ávila, Frances A Santos, Myriam Delgado, Rodrigo Minetto, Thiago H Silva

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文介绍了多模态大语言模型(MLLMs)的理论基础和实践方法,探讨了预处理、提示工程及多模态管道构建技术,并提供了补充材料供进一步研究。

Comments in Portuguese language. Accepted book chapter - Webmedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07179 2026-02-10 cs.HC cs.AI cs.CL cs.CY cs.IT math.IT 62%

An Information-Theoretic Framework for Comparing Voice and Text Explainability

一种信息论框架用于比较语音和文本的可解释性

Mona Rajhans, Vishal Khawarey

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种信息论框架,用于比较语音和文本在AI系统可解释性中的效果,发现类比基于的交付在理解效率与信任校准之间取得最佳平衡。

Comments Accepted for publication at the 10th ACM International Conference on Intelligent Systems, Metaheuristics & Swarm Intelligence (ISMSI 2026), April 24-26, Cebu City, Phillipines

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06647 2026-02-09 cs.CL eess.AS 62%

Reading Between the Waves: Robust Topic Segmentation Using Inter-Sentence Audio Features

在波涛间阅读:利用跨句音频特征实现鲁棒性话题分割

Steffen Freisinger, Philipp Seeberger, Tobias Bocklet, Korbinian Riedhammer

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出利用跨句音频特征进行鲁棒性话题分割,通过多模态方法提升分割性能,并在多个数据集上验证了其有效性。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08176 2026-02-06 cs.SD cs.AI cs.LG eess.AS 62%

Leveraging Whisper Embeddings for Audio-based Lyrics Matching

利用Whisper嵌入进行基于音频的歌词匹配

Eleonora Mancini, Joan Serrà, Paolo Torroni, Yuki Mitsufuji

机构 * DISI, University of Bologna(博洛尼亚大学DISI) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出WEALY,利用Whisper嵌入实现基于音频的歌词匹配,通过可重复的流程和多模态扩展,展示了与最先进方法相当的性能,并为音乐信息检索提供了可靠基准。

Comments Accepted at ICASSP 2026 (IEEE International Conference on Acoustics, Speech and Signal Processing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03365 2026-02-05 cs.SD cs.AI cs.CR eess.AS 62%

When Good Sounds Go Adversarial: Jailbreaking Audio-Language Models with Benign Inputs

当良好声音变得对抗性:利用无害输入对音频-语言模型进行劫持

Hiskias Dingeto, Taeyoun Kwon, Dasol Choi, Bodam Kim, DongGeon Lee, Haon Park, JaeHoon Lee, Jongho Shin

机构 * Yonsei University, Seoul, South Korea(延世大学) Seoul National University, Seoul, South Korea(首尔国立大学) Pohang University of Science(坡桑科学大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 WhisperInject通过在无害音频中嵌入细微扰动,利用两阶段对抗性攻击框架劫持音频-语言模型,生成有害内容,展示了音频原生威胁的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏