Multimodal Emotion Recognition with High-level Speech and Text Features
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS
Comments Accepted at ASRU 2021. Code available at https://github.com/mmakiuchi/multimodal_emotion_recognition
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS
Comments Accepted at ASRU 2021. Code available at https://github.com/mmakiuchi/multimodal_emotion_recognition
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS
Comments Accepted by the 2020 International Conference on Multimodal Interaction (ICMI'20)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL
Comments Published in the First Workshop on Computational Modeling of Human Multimodal Language - ACL 2018
StructBreak: 多模态大语言模型中结构性认知过载引发的安全故障
机构 * Key Laboratory of Trustworthy Distributed Computing and Service (MoE), Beijing University of Posts and Telecommunications(可信分布式计算与服务重点实验室(MoE),北京邮电大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 音频语音多模态 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.AI
AI总结 提出StructBreak框架,通过量化结构性认知过载(SCO)揭示一种高阶认知过载攻击范式,在六种主流MLLM上实现92%平均攻击成功率,并证明该攻击通过结构性通道绕过安全过滤器。
Comments 23 pages; accepted to Findings of ACL 2026. This paper contains examples of harmful content
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Code is available at https://github.com/dvlab-research/MGM-Omni
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.AI
Comments CMU Machine Learning Department PhD Thesis
专题命中 音频语音多模态 :multimodal(abstract);image-text(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
Comments WACV 2024
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 11 pages, Accepted by IEEE Transactions on Multimedia
Real-TurnTurk:用于话轮转换预测的多模态土耳其语语料库
机构 * Data Science and Innovation Ata Technology Platforms(阿塔技术平台数据科学与创新部) ; Digital Operations and Data(数字运营与数据部)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究构建多模态土耳其语对话数据集,采用遗传算法优化规则,实现话轮转换预测,填补土耳其语相关自然对话语料库的空白。
Comments Accepted to INTCEC 2026. This is the author's pre-print version. The final authenticated version will be available through the conference proceedings
H2H音乐即兴:一种音乐即兴的通信模型及视听数据集
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS
AI总结 该研究针对现有AI即兴系统缺乏通信意识的问题,通过与专业即兴者协作推导通信模型,并构建首个自由即兴的H2H视听数据集,为AI音乐伙伴设计提供新资源。
Comments Published in the Proceedings of the Society for Music Information Retrieval Conference (ISMIR) 2026
作为视听模态声场的物体
机构 * University of Maryland, College Park(马里兰大学帕克分校)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM
AI总结 本文针对现有碰撞声建模方法成本高或需大量数据的问题,提出AV-MSF表示,结合3D高斯溅射与模态参数实现少样本重建,在真实数据集上达最优渲染性能,还支持接触定位等下游应用。
Comments ECCV 2026, Project page: https://zisenshao.github.io/AV-MSF/
PhaseCoder: 无关麦克风几何的多模态大语言模型空间音频理解
机构 * Google DeepMind(谷歌DeepMind) ; Media Lab, MIT(媒体实验室,麻省理工学院) ; Google AR(谷歌AR)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS
AI总结 PhaseCoder是一种无需麦克风几何结构的Transformer空间音频编码器,能够生成空间嵌入并使LLM实现复杂空间推理和转录任务。
听而能视:面向视听实例分割的状态感知聆听
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出 Hear to See(H2S)模型,通过 ASP 和 ADM 机制解决视听实例分割中重叠声源匹配与异步动态跟踪问题,在 AVISeg 数据集上实现 SOTA 性能,mAP 达 48.54,较此前方法提升 7.8%。
Comments Accepted by ACM MM 2026
MyMentorLLM:一个用于刻意练习的心理治疗生成式人工智能环境,具有多模态语音/文本患者、受训者和专家
机构 * University of Trento(特伦托大学) ; University of Bari(巴里大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 研究针对心理治疗师培训可扩展性问题,提出MyMentorLLM多模态模拟环境用于CBT培训,生成2100个课程,分析情感等方面,发现不同语言模型督导质量有别,患者逼真度等需评估,证明CBT培训刻意练习模拟可行。
Comments 27 pages, 6 figures, 2 tables; 1 supplementary table
基于大语言模型的强化学习音频视觉语音增强
机构 * Department of Electrical Engineering, National Taiwan University, Taiwan(台湾大学电子工程系) ; Research Center for Information Technology Innovation, Academia Sinica, Taiwan(中央研究院资讯科技创新研究中心) ; Center for Hearing Research, University of California Irvine, USA(加州大学尔湾分校听力研究中心)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、eess.AS
AI总结 本文提出基于大语言模型的可解释奖励模型的音频视觉语音增强框架,利用语言模型生成语音增强的自然语言描述,并通过情感分析模型转换为评分作为PPO奖励,提升语音质量评估效果。
Comments 6 pages, 4 figures, Accepted by Interspeech 2026
使用多模态特征融合联合改进印度语言中的方言识别和自动语音识别
机构 * Department of Electrical Engineering(电气工程系)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS
AI总结 针对印度低资源且方言差异大的语言,提出多模态框架联合改进方言识别和自动语音识别。用瓶颈编码器和RoBERTa编码器提取融合特征,经门控和注意力编码器处理,提升了识别准确率和降低错误率。
VisionAId:一款面向视障人士的离线优先多模态安卓助手,具备个性化物品检索功能
机构 * The Military Technical Academy ``Ferdinand I'', Bucharest, Romania(费迪南军事技术学院)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 提出离线优先多模态安卓助手VisionAId,集成六种端上深度学习模型,通过少样本流水线实现个性化物品检索,结合AR标记、空间音频和距离比例触觉反馈引导用户。
Comments 8 pages, 4 figures. Project repository available at: github.com
多模态上下文学习用于低资源语言的语音识别
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 本文探讨了通过多模态上下文学习提升低资源语言语音识别性能的方法,分析了跨语言迁移学习对模型效率的影响,并提出结合更强声学模型与语音LLM的改进系统。
Comments ACL 2026 findings
VIB-AVSR:基于变分信息瓶颈的噪声鲁棒LLM视听语音识别
机构 * Imperial College London(帝国理工学院伦敦分校) ; NatWest AI Research(NatWest人工智能研究)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
AI总结 提出VIB-AVSR,通过在LLM骨干中插入变分信息瓶颈层来正则化表示,无需架构修改或额外数据,即可在多种噪声条件下提升AVSR鲁棒性。
Comments Accepted to INTERSPEECH 2026. Our code is available at https://github.com/PiyushArora1010/VIB-AVSR
低资源场景下尼泊尔口语词汇到情感条件手语虚拟人物的多模态翻译
机构 * Center for Human Mobility and Communications, Prateek Innovations(普拉蒂克创新公司人类移动与通信中心) ; Sunway International Business School, Birmingham City University(双威国际商学院,伯明翰城市大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 提出NEST-V1框架,通过共享声学编码器实现语音识别与情感分类,生成情感条件尼泊尔手语虚拟人物,在低资源场景下验证了技术可行性。
Comments 15 pages, 5 figures, 9 tables
面向准确鲁棒的监控路边IVD:基于轨迹化的视听推理
机构 * Kahlert School of Computing, University of Utah(犹他大学卡勒特计算学院) ; Scientific Computing and Imaging Institute, University of Utah(犹他大学科学计算与成像研究所) ; Department of Electrical and Computer Engineering, University of Utah(犹他大学电气与计算机工程系)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
AI总结 提出TAVR-IVD框架,通过多目标跟踪将车辆检测链接为轨迹,基于轨迹进行视听融合分类,提升信噪比、稳定时间决策、对齐车辆与麦克风空间先验,并在跨域场景下保持高效鲁棒。
Plug-and-Steer:解耦分离与选择的音视频目标说话人提取
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS
AI总结 提出Plug-and-Steer方法,通过解耦分离与目标选择,利用冻结的纯音频骨干网络和潜引导矩阵实现高保真音视频目标说话人提取。
Comments Accepted by Interspeech 2026; demo available https://plugandsteer.github.io
基于XAI的语音深度伪造检测解释生成:使用免训练多模态大语言模型
机构 * Imperial College London(帝国理工学院) ; Technical University of Munich(慕尼黑工业大学) ; University of Southampton(南安普顿大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 针对语音深度伪造检测缺乏可解释性的问题,提出一种免训练框架,融合XAI证据与多模态大语言模型,生成基于证据的特定解释,在PartialSpoof数据集上内部准确率提升超45%。
Comments Accepted at Interspeech 2026
统一声学特征与文本的多模态大语言模型用于神经退行性疾病筛查
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS
AI总结 提出NeurMLLM框架,通过多模态大语言模型融合声谱图、MFCC和文本,实现阿尔茨海默病和帕金森病的精细分期,优于传统方法和现有LLM方法。
Comments IEEE International Conference on Healthcare Informatics, 2026
UniT:统一多模态思维链测试时扩展
机构 * Stanford University(斯坦福大学) ; Meta Superintelligence Labs(Meta超级智能实验室) ; Nanyang Technological University(南洋理工大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 提出UniT框架,通过多轮推理、验证和细化实现统一多模态模型的测试时扩展,实验表明短推理轨迹可泛化到长链,顺序思维链比并行采样更高效。
Comments CVPR 2026
Spatial-Omni:通过FOA编码在多模态大语言模型中实现空间音频理解
机构 * Zhejiang University(浙江大学) ; Tencent Hunyuan(腾讯文心)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS
AI总结 提出Spatial-Omni,通过SO-Encoder将一阶Ambisonics空间音频注入现有全模态大语言模型,以轻量方式实现空间音频理解,并在构建的SO-Bench基准上超越现有模型。
基于sEMG和唇读的鲁棒无声语音合成的跨模态掩蔽
机构 * Aholab research group within the HiTZ Center at University of the Basque Country (UPV/EHU)(巴斯克大学HiTZ中心内Aholab研究组) ; PRHLT research center, Universitat Politècnica de València (UPV)(瓦伦西亚理工大学PRHLT研究中心)
专题命中 音频语音多模态 :cross-modal(title);multimodal(abstract);分类 cs.CL、eess.AS
AI总结 提出掩蔽多模态语音合成框架,联合表面肌电图和唇读信号,通过训练时模态掩蔽提升鲁棒性,在多说话人设置下词错误率降低14个百分点。
Comments 12 pages, 7 figures and 6 tables. Submitted to Transactions on Audio, Speech and Language Processing
面向隐私安全的非个体化方法的多模态群体情绪识别
机构 * Université Grenoble Alpes(格勒诺布尔-阿尔卑斯大学) ; Univ. Grenoble Alpes(格勒诺布尔-阿尔卑斯大学) ; Univ. of Glasgow(格拉斯哥大学) ; Inria(法国国家信息与自动化研究所) ; Univ. Paris-Saclay(巴黎-萨克雷大学) ; TU Delft(代尔夫特理工大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出两种多模态框架(交叉注意力融合+帧注意力池化,以及变分编码器多解码器),利用集体音视频信号进行群体情绪识别,避免使用个体特征,在保护隐私的同时实现鲁棒性能。
Comments Doctoral thesis
Dr. SHAP-AV:通过Shapley归因解码音频-视觉语音识别中的相对模态贡献
机构 * Imperial College London, UK(伦敦帝国学院,英国) ; NatWest AI Research, UK(英国NatWest人工智能研究)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
AI总结 本文提出Dr.SHAP-AV框架,通过Shapley值分析音频-视觉语音识别中模态贡献,揭示噪声环境下模型对视觉的依赖及音频贡献的稳定性,推动模态加权机制和Shapley归因作为标准诊断工具。
Comments Accepted to INTERSPEECH 2026 [Long Paper track]. Project website: https://umbertocappellazzo.github.io/Dr-SHAP-AV
JAEGER:模拟物理环境中的联合3D音频-视觉定位与推理
机构 * Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学) ; Tencent AI Lab(腾讯AI实验室)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI
AI总结 提出JAEGER框架,通过集成RGB-D观测和多通道一阶环境声学,将音频-视觉大语言模型扩展到3D空间,实现联合空间定位与推理,并引入神经强度向量(Neural IV)提升声源方向估计的鲁棒性。
Comments Accepted to ICML 2026