arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 235 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 235 篇

2606.30646 2026-07-01 cs.SD cs.AI cs.CL eess.AS 新提交 82%

ASR-Agnostic Multimodal Spectrotemporal Modeling for Early Dementia Detection

ASR无关的多模态谱时建模用于早期痴呆检测

Chukwuemeka Ugwu, Oluwafemi Richard Oyeleke

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 提出一种不依赖语音识别的框架,直接从梅尔频谱图中提取谱时位移场作为数字生物标志物,结合CNN-ConvGRU声学嵌入和交叉注意力融合,在三种语言语料库上验证了多模态融合的语料依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28002 2026-06-29 cs.CL cs.AI eess.AS 新提交 82%

Dialogue to Detection: A Multimodal Hybrid NLP Pipeline for Insurance Fraud Detection

对话到检测:用于保险欺诈检测的多模态混合 NLP 流水线

Muhammad Shakeel Akram, Amal Htait, Abdul Hamid Sadka, Emma Meisingseth, Karishma Jaitly

机构 * Aston University(阿斯顿大学) Domestic & General

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 提出一种合成多模态框架,结合ASR、NER、LLM-RAG和说话人嵌入,通过规则风险评分检测保险欺诈中的叙述复用、结构不一致和跨案件语音重复。

Comments 10 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15117 2026-06-16 cs.MM cs.AI cs.CV cs.LG cs.SD 新提交 82%

Teacher-Student Structure for Domain Adaptation in Ensemble Audio-Visual Video Deepfake Detection

用于集成视听视频深度伪造检测中领域适应的师生结构

Elham Abolhasani, Maryam Ramezani, Hamid R. Rabiee

机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工学院计算机工程系)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出EAV-DFD方法,结合师生框架的领域适应机制,提升模型在未见领域上的泛化能力,在三个数据集上AUC分别提升4.09%、17.94%和0.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07577 2026-06-09 cs.AI cs.CV cs.SD eess.AS 新提交 82%

OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs

OmniMem: 面向流式音视频大语言模型的扰动感知记忆压缩

Guangzhi Sun, Yixuan Li, Yudong Yang, Chao Zhang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动) Department of Engineering, University of Cambridge(剑桥大学工程系)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、eess.AS

AI总结 提出OmniMem,一种针对音视频LLM的流式记忆压缩框架,通过模态感知分配和扰动感知选择压缩KV缓存,在保持长视频理解的同时减少内存,在多个基准上提升2-4%准确率。

Comments Code: https://github.com/bytedance/SALMONN/tree/omni_mem

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13957 2026-08-17 cs.SD cs.MM eess.AS 新提交 81%

H2H Music Improv: A Communication Model and Audio-Visual Dataset for Music Improvisation

H2H音乐即兴:一种音乐即兴的通信模型及视听数据集

Aleksandra Teng Ma, Anthony Cammarota, Jiayi Wang, Alexandria Smith, Cheng-Zhi Anna Huang, Jeffrey Albert, Alexander Lerch

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS

AI总结 该研究针对现有AI即兴系统缺乏通信意识的问题,通过与专业即兴者协作推导通信模型,并构建首个自由即兴的H2H视听数据集,为AI音乐伙伴设计提供新资源。

Comments Published in the Proceedings of the Society for Music Information Retrieval Conference (ISMIR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03264 2026-08-05 cs.MM cs.CV cs.SD 新提交 81%

Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation

听而能视:面向视听实例分割的状态感知聆听

Leiye Liu, Miao Zhang, Jiahong Jiang, Jingjing Li, Jialong Zhong, Kai Peng, Tingwei Liu, Wei Ji, Yongri Piao, Huchuan Lu

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出 Hear to See(H2S)模型,通过 ASP 和 ADM 机制解决视听实例分割中重叠声源匹配与异步动态跟踪问题,在 AVISeg 数据集上实现 SOTA 性能,mAP 达 48.54,较此前方法提升 7.8%。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25667 2026-07-29 cs.CL cs.AI 新提交 81%

MyMentorLLM: A psychotherapy GenAI environment with multimodal voice/text patients, trainees and experts for deliberate practice

MyMentorLLM:一个用于刻意练习的心理治疗生成式人工智能环境,具有多模态语音/文本患者、受训者和专家

Rodolfo Rizzi, Alessandro Grecucci, Massimo Stella

机构 * University of Trento(特伦托大学) University of Bari(巴里大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对心理治疗师培训可扩展性问题,提出MyMentorLLM多模态模拟环境用于CBT培训,生成2100个课程,分析情感等方面,发现不同语言模型督导质量有别,患者逼真度等需评估,证明CBT培训刻意练习模拟可行。

Comments 27 pages, 6 figures, 2 tables; 1 supplementary table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02862 2026-07-07 cs.CL eess.AS 新提交 81%

Jointly Improving Dialect Identification and ASR in Indian Languages using Multimodal Feature Fusion

使用多模态特征融合联合改进印度语言中的方言识别和自动语音识别

Saurabh Kumar, Amartyaveer, Prasanta Kumar Ghosh

机构 * Department of Electrical Engineering(电气工程系)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS

AI总结 针对印度低资源且方言差异大的语言,提出多模态框架联合改进方言识别和自动语音识别。用瓶颈编码器和RoBERTa编码器提取融合特征,经门控和注意力编码器处理,提升了识别准确率和降低错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02371 2026-07-03 cs.CV cs.AI 新提交 81%

VisionAId: An Offline-First Multimodal Android Assistant for People with Visual Impairment, Featuring Personalized Object Retrieval

VisionAId:一款面向视障人士的离线优先多模态安卓助手,具备个性化物品检索功能

Cristian-Gabriel Florea, Stelian Spînu

机构 * The Military Technical Academy ``Ferdinand I'', Bucharest, Romania(费迪南军事技术学院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出离线优先多模态安卓助手VisionAId,集成六种端上深度学习模型,通过少样本流水线实现个性化物品检索,结合AR标记、空间音频和距离比例触觉反馈引导用户。

Comments 8 pages, 4 figures. Project repository available at: github.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26107 2026-06-26 cs.CL cs.AI 新提交 81%

Low Resource Multimodal Translation of Nepali Spoken Words into Emotion-Conditioned Sign Language Avatars

低资源场景下尼泊尔口语词汇到情感条件手语虚拟人物的多模态翻译

Jatin Bhusal, Salma Tamang

机构 * Center for Human Mobility and Communications, Prateek Innovations(普拉蒂克创新公司人类移动与通信中心) Sunway International Business School, Birmingham City University(双威国际商学院,伯明翰城市大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出NEST-V1框架,通过共享声学编码器实现语音识别与情感分类,生成情感条件尼泊尔手语虚拟人物,在低资源场景下验证了技术可行性。

Comments 15 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22299 2026-06-23 cs.CV eess.AS 新提交 81%

Towards Accurate and Robust Surveillance Roadside IVD via Trackletized Audio-Visual Reasoning

面向准确鲁棒的监控路边IVD:基于轨迹化的视听推理

Xiwen Li, Xiaoya Tang, Bodong Zhang, Tolga Tasdizen

机构 * Kahlert School of Computing, University of Utah(犹他大学卡勒特计算学院) Scientific Computing and Imaging Institute, University of Utah(犹他大学科学计算与成像研究所) Department of Electrical and Computer Engineering, University of Utah(犹他大学电气与计算机工程系)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

AI总结 提出TAVR-IVD框架,通过多目标跟踪将车辆检测链接为轨迹,基于轨迹进行视听融合分类,提升信噪比、稳定时间决策、对齐车辆与麦克风空间先验,并在跨域场景下保持高效鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16137 2026-06-16 cs.CL cs.AI 新提交 81%

XAI-Grounded Explanation Generation for Speech Deepfake Detection with Training-Free Multimodal Large Language Models

基于XAI的语音深度伪造检测解释生成:使用免训练多模态大语言模型

Yupei Li, Qiyang Sun, Xiaoliang Wu, Chenxi Wang, Berrak Sisman, Björn W. Schuller

机构 * Imperial College London(帝国理工学院) Technical University of Munich(慕尼黑工业大学) University of Southampton(南安普顿大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对语音深度伪造检测缺乏可解释性的问题,提出一种免训练框架,融合XAI证据与多模态大语言模型,生成基于证据的特定解释,在PartialSpoof数据集上内部准确率提升超45%。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14788 2026-06-16 cs.SD cs.AI cs.LG eess.AS 新提交 81%

Unifying Acoustic Features and Text with Multimodal LLMs for Neurodegenerative Screening

统一声学特征与文本的多模态大语言模型用于神经退行性疾病筛查

Qingfeng Zhang, Yuanxiong Guo, Yanmin Gong

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS

AI总结 提出NeurMLLM框架,通过多模态大语言模型融合声谱图、MFCC和文本,实现阿尔茨海默病和帕金森病的精细分期,优于传统方法和现有LLM方法。

Comments IEEE International Conference on Healthcare Informatics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10738 2026-06-10 eess.AS cs.AI 新提交 81%

Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding

Spatial-Omni:通过FOA编码在多模态大语言模型中实现空间音频理解

Zhiyuan Zhu, Yixuan Chen, Yiwen Shao, Wenxiang Guo, Changhao Pan, Yu Zhang, Yuxiang Wang, Wei Liu, Houhua Zhang, Chengkuan Zeng, Wenbo Cheng, Yunxi Liu, Rui Yang, Steve Yves, Liefeng Bo, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯文心)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS

AI总结 提出Spatial-Omni,通过SO-Encoder将一阶Ambisonics空间音频注入现有全模态大语言模型,以轻量方式实现空间音频理解,并在构建的SO-Bench基准上超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09667 2026-06-09 eess.AS cs.CL cs.SD 新提交 81%

Cross-Modal Masking for Robust Silent Speech Synthesis Using sEMG and Lipreading

基于sEMG和唇读的鲁棒无声语音合成的跨模态掩蔽

Eder del Blanco, David Gimeno-Gómez, Eva Navas, Carlos-D. Martínez-Hinarejos, Inma Hernáez

机构 * Aholab research group within the HiTZ Center at University of the Basque Country (UPV/EHU)(巴斯克大学HiTZ中心内Aholab研究组) PRHLT research center, Universitat Politècnica de València (UPV)(瓦伦西亚理工大学PRHLT研究中心)

专题命中 音频语音多模态 :cross-modal(title);multimodal(abstract);分类 cs.CL、eess.AS

AI总结 提出掩蔽多模态语音合成框架,联合表面肌电图和唇读信号,通过训练时模态掩蔽提升鲁棒性,在多说话人设置下词错误率降低14个百分点。

Comments 12 pages, 7 figures and 6 tables. Submitted to Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07585 2026-06-09 cs.CV cs.AI 新提交 81%

Multimodal Group Emotion Recognition In-the-Wild Towards a Privacy-Safe Non-Individual Approach

面向隐私安全的非个体化方法的多模态群体情绪识别

Anderson Augusma

机构 * Université Grenoble Alpes(格勒诺布尔-阿尔卑斯大学) Univ. Grenoble Alpes(格勒诺布尔-阿尔卑斯大学) Univ. of Glasgow(格拉斯哥大学) Inria(法国国家信息与自动化研究所) Univ. Paris-Saclay(巴黎-萨克雷大学) TU Delft(代尔夫特理工大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出两种多模态框架(交叉注意力融合+帧注意力池化,以及变分编码器多解码器),利用集体音视频信号进行群体情绪识别,避免使用个体特征,在保护隐私的同时实现鲁棒性能。

Comments Doctoral thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18401 2026-08-20 cs.HC cs.CL cs.RO 新提交 80%

Multimodal Rapport Estimation in Real-World HRI

现实世界人机交互(HRI)中的多模态融洽度估计

Akihiro Sakuramoto, Takato Hayashi, Ryo Miyoshi, Yuki Okafuji, Shogo Okada

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本研究针对现实世界人机交互的融洽度估计问题,采用日本药店的62个多模态会话,对比零样本LLMs等模型,发现Gemini融合模型表现最优,且性能随互动时长、群体规模变化。

Comments 9 pages, 4 figures, 3 tables. Accepted at the 28th ACM International Conference on Multimodal Interaction (ICMI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15265 2026-07-17 cs.CV cs.AI cs.MM cs.SD 新提交 80%

SceneBind: Binding What and Where Across Vision, Audio and Language

SceneBind:跨视觉、音频和语言绑定“什么”与“哪里”

Mingfei Chen, Zijun Cui, Ruoke Zhang, Hyeonggon Ryu, Eli Shlizerman

机构 * University of Washington(华盛顿大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Hankuk University of Foreign Studies(韩国外国语大学)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 研究提出SceneBind全模态场景表示,结合全局语义与对象中心语义空间插槽解决空间结构缺失问题,还提出匹配方案。通过构建新数据集及训练协议进行训练评估,兼容预训练编码器,实现先进检索并能零样本转移到下游任务。

Comments Project website: https://scenebind.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15066 2026-08-18 eess.SP cs.MM eess.IV 新提交 79%

ParaJSCC: A Parameterized Framework for Reusable Multimodal Joint Source-Channel Coding

ParaJSCC:一种用于可复用多模态联合信源信道编码的参数化框架

Kemi Chen, Mingkai Chen, Youjia Chen, Qian Liu, Wei Gao, Tiesong Zhao

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 针对多模态内容重复访问的效率问题,提出ParaJSCC参数化框架,通过离线生成参数包按需传输,降低延迟与传输速率并保持重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16686 2026-08-18 cs.HC cs.CL cs.RO 新提交 79%

Closing the Affective Loop: Multimodal Speaker-Listener Emotion-Dynamics-Aware Empathetic Social Robots

闭合情感循环:具情感动态感知的多模态说话人-听话人共情社交机器人

Zi Haur Pang, Casey Kennington, Tatsuya Kawahara

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本研究提出AffectLoop系统,在Misty II机器人上实现多模态情感动态感知的说话人-听话人共情交互,经试点研究验证可提升共情响应与用户满意度。

Comments This paper has been accepted for presentation at APSIPA ASC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14651 2026-08-18 cs.AI cs.HC 新提交 79%

Evaluating Multimodal LLMs across Text and Audio Modalities for Accessible Disaster Assistance

评估面向无障碍灾害援助的跨文本与音频模态多模态大语言模型

Anuridhi Gupta, Samara Mansoor, Hemant Purohit

专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);分类 cs.AI

AI总结 本文评估了开放权重多模态大语言模型在灾害援助场景下跨文本与音频模态的响应一致性,发现其存在模态依赖的不公平性,为构建公平的灾害沟通AI工具提供了设计建议。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09475 2026-08-11 cs.CV 新提交 79%

Agreement-Based Audio-Visual Segmentation:Champion Report for the MeViS-Audio Track in the 8th LSVOS Challenge

基于一致性的视听分割:第八届LSVOS挑战赛MeViS音频赛道冠军报告

Yiwen Ren, Jianing Liu, Yingxin Wang, Kexin Zhang, Licheng Jiao, Lingling Li, Xu Liu

机构 * National 111 Project Base of Intelligent Information Processing(智能信息处理国家111计划基地)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 本文针对第八届LSVOS挑战赛MeViS音频赛道,提出分阶段视听分割方案,以Qwen3-ASR为基础,通过掩码一致性选择轨迹并修正查询,结合多模态得分判断目标存在性,最终取得赛道第一的成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09288 2026-08-11 cs.SD cs.AI 新提交 79%

DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation

DAVE:用于真实场景语音分离的解耦式视听增强框架

Wei Zhou, Wanyi Ning, Yinshang Guo, Qianxiao Fang, Haitao Qian, Yingpeng Li

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI

AI总结 本文提出用于真实场景语音分离的解耦式视听增强框架DAVE,构建含219411个混合样本的DAVE-Corpus,采用渐进式多目标优化与选择性增强链,在挑战赛中展现出良好鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08510 2026-08-11 cs.CL 新提交 79%

From Speech to Interaction: Analyzing Multimodal Systems in Cocktail-Party Scenarios

从语音到交互:鸡尾酒会场景下多模态系统的分析

Thai-Binh Nguyen, Zhaolin Li, Jan Niehues, Alexander Waibel

专题命中 音频语音多模态 :multimodal(title);audio-visual(abstract);分类 cs.CL

AI总结 本研究分析了CHiME-9 MCoRec任务中不同多模态系统解决鸡尾酒会场景的策略,发现最优系统实现57%相对错误减少,且高语音重叠并非性能差异的主要原因。

Comments Accepted at ICMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28129 2026-07-31 cs.CV cs.IR 新提交 79%

Face and Voice Cross-modal Association with Learning Convex Feature Embedding

基于凸特征嵌入学习的人脸与声音跨模态关联

Taewan Kim, Jiwoo Kang

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出结合跨模态注意力机制的凸特征嵌入方法,解决人脸与声音跨模态关联中的特征异质性问题,在VoxCeleb数据集的相关任务上较现有方法有显著提升。

Journal ref Multimedia Systems, vol. 31, no. 4, pp. 296, July 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27212 2026-07-31 cs.HC cs.CL 新提交 79%

Digital Harf: A Clinically Integrated Multimodal AI System for Pervasive Arabic Speech and Language Therapy

Digital Harf:用于普及型阿拉伯语言语和语言治疗的临床整合多模态AI系统

Asif Azad, Mohammad Sadat Hossain, MD Sadik Hossain Shanto, Sabri Boughorbel, Abdulrhman Aljouie, Bdour Alwuqaysi, Yahya Bokhari, Ayah Othman Sindi, Ehsan Hoque

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 Digital Harf是专为阿拉伯语自闭症儿童设计的多模态AI治疗平台,其核心Agentic合成数据引擎解决阿拉伯语治疗内容短缺问题,获专家高接受率,为代表性语言环境构建AI治疗系统提供了思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26355 2026-07-30 cs.CL 新提交 79%

Symphony of Bias: Exploring Gender Associations with Musical Instruments in Multimodal LLMs

偏见交响曲:探索多模态大语言模型(LLMs)与乐器的性别关联

Farhan Farsi, Shayan Bali, Mohammad Heydari Rad, Negar Heidary, Donya Rooein

机构 * Amirkabir University of Technology(阿米尔卡比尔理工大学) King’s College London(伦敦国王学院) University of Tehran(德黑兰大学) Bocconi University(博科尼大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本研究推出多模态数据集Symphony-Bias,评估多模态模型在乐器性别关联上的偏见,发现多数结果符合社会研究,契合度随文本、视觉、音频依次减弱。

Comments 32 pages, 23 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25903 2026-07-29 eess.AS 新提交 79%

CARE: A Multimodal Corpus for Studying Speech and Non-Verbal Communication Across Multiple Medical Conditions

CARE:一个用于研究多种医疗状况下言语和非言语交流的多模态语料库

David Gimeno-Gómez, Catarina Botelho, Carlos-D. Martínez-Hinarejos, Isabel Trancoso, Alberto Abad

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 针对多模态语音分析领域因现有数据集存在局限而发展受限的问题,引入CARE v1.0多模态英语数据集,涵盖多种医疗状况,提供丰富描述符和元数据,支持多种应用,推动该领域研究发展。

Comments Under review in npj Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19636 2026-07-23 eess.AS 新提交 79%

Multimodal Speaker Verification as a Threat to Speaker Anonymization

多模态说话人验证对说话人匿名化的威胁

Ashi Garg, Cristina Aggazzotti, Leibny Paola García-Perera, Nicholas Andrews

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 研究多话语、多模态环境下的说话人验证,通过对多个匿名话语的音频、韵律和语言信息进行聚合,比较不同聚合策略,发现多模态系统性能更优,帧级聚合EER最低,即便少量匿名话语结合音频和文本也能显著降低EER。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13614 2026-07-16 cs.HC cs.MM 新提交 79%

VIP-MINGLE: A Corpus for Videoconference and In-Person Multimodal Interaction in Group Language Engagement

VIP-MINGLE:用于群体语言交流中视频会议和面对面多模态交互的语料库

Andrew Chang, Abhinay K Bodi, Wenxin Deng, Junrui Huang, Venu G Kadamba, Sumanth B H Karanam, Dhiwahar A Kennady, David Poeppel, Dustin Freeman

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 介绍VIP-MINGLE多模态数据集,含59小时录音等,有两种环境下配对会话,涵盖多种数据。分析发现不同环境多模态行为分布有变化,该数据集是跨环境群体对话模型开发的关键资源。

Comments Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏