arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-21 至 2026-01-21 共收录 16 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 16 篇

2407.18552 2026-01-21 cs.MM cs.CL cs.CV cs.LG cs.SD eess.AS 85%

Multimodal Emotion Recognition using Audio-Video Transformer Fusion with Cross Attention

基于音频-视频Transformer融合与交叉注意力的多模态情感识别

Joe Dhanith P R, Shravan Venkatraman, Vigya Sharma, Santhosh Malarvannan

机构 * School of Computer Science and Engineering, Vellore Institute of Technology (VIT) University(计算机科学与工程学院,维洛雷理工学院(VIT大学))

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本文提出AVT-CA模型,通过音频-视频Transformer融合与交叉注意力机制,提升多模态情感识别的准确率和F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11995 2026-01-21 cs.MM cs.AI cs.IR cs.LG cs.SD 84%

Learning Audio-Visual Embeddings with Inferred Latent Interaction Graphs

通过推断的潜在交互图学习音频-视觉嵌入

Donghuo Zeng, Hao Niu, Yanan Wang, Masato Taya

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出通过推断的潜在交互图学习音频-视觉嵌入,以提升嵌入学习的鲁棒性和语义一致性。

Comments 16 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21650 2026-01-21 cs.LG 82%

Physic-HM: Restoring Physical Generative Logic in Multimodal Anomaly Detection via Hierarchical Modulation

Physic-HM: 通过分层调制恢复多模态异常检测中的物理生成逻辑

Xiao Liu, Junchen Jin, Yanjie Zhao, Zhixuan Xing

机构 * Chongqing University(重庆大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract)

AI总结 Physic-HM通过引入物理归纳偏置,解决多模态异常检测中过程逻辑缺失的问题,实现高维与低维数据的协同建模,提升异常检测性能。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13143 2026-01-21 cs.LG 82%

FastAV: Efficient Token Pruning for Audio-Visual Large Language Model Inference

FastAV: 面向音频视觉大语言模型推理的高效令牌修剪

Chaeyoung Jung, Youngjoon Jang, Seungwoo Lee, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract)

AI总结 FastAV通过两阶段令牌修剪策略,针对音频视觉大语言模型实现高效推理,减少FLOPs超过40%并保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13098 2026-01-21 cs.HC 82%

Exploring the Impacts of Background Noise on Auditory Stimuli of Audio-Visual eHMIs for Hearing, Deaf, and Hard-of-Hearing People

探索背景噪声对听觉刺激在音频视觉eHMIs中的影响:面向听障、聋人及听力障碍人群

Wenge Xu, Foroogh Hajiseyedjavadi, Debargha Dey, Tram Thi Minh Tran, Mark Colley

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract)

AI总结 研究探讨了背景噪声对聋人及听力障碍者在音频视觉eHMI中听觉刺激的影响,发现嘈杂环境会损害行人穿越体验,而增加铃声或语音提示可改善体验。

Comments This is the author's version of the paper accepted at CHI Conference on Human Factors in Computing Systems (CHI '26), April 13-17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11968 2026-01-21 cs.MM cs.SD eess.AS 81%

MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio

MuseAgent-1: 交互式 grounded 多模态理解音乐谱面与表演音频

Qihao Zhao, Yunqi Cao, Yangyu Huang, Hui Yi Leong, Fan Zhang, Kim-Hui Yap, Wei Hu

机构 * Nanyang Technological University(南洋理工大学) Beijing University of Chemical Technology(北京化工大学) Microsoft(微软公司) University of Chicago(芝加哥大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM、eess.AS

AI总结 MuseAgent-1 是一个专注于音乐的多模态代理,通过结构化符号表示和多步骤推理,提升对音乐谱面和表演音频的交互式理解能力。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12354 2026-01-21 eess.AS cs.LG cs.SD 79%

Bone-conduction Guided Multimodal Speech Enhancement with Conditional Diffusion Models

骨传导引导的多模态语音增强与条件扩散模型

Sina Khanagha, Bunlong Lay, Timo Gerkmann

机构 * Signal Processing Group, University of Hamburg, Germany(汉堡大学信号处理组)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 本文提出一种基于条件扩散模型的多模态语音增强框架,通过整合骨传导传感器与空气传导麦克风,有效提升极端噪声环境下的语音增强性能。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11590 2026-01-21 cs.DC cs.AI 79%

EPD-Serve: A Flexible Multimodal EPD Disaggregation Inference Serving System On Ascend

EPD-Serve: 一种灵活的多模态EPD解耦推理服务系统在Ascend上

Fan Bai, Pai Peng, Zhengzhi Tang, Zhe Wang, Gong Chen, Xiang Lu, Yinuo Li, Huan Lin, Weizhe Lin, Yaoyuan Wang, Xiaosong Li

机构 * Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 EPD-Serve通过阶段级解耦和异构硬件协同,提升多模态模型推理系统的吞吐量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14227 2026-01-21 cs.SD 78%

Transformer Architectures for Respiratory Sound Analysis and Multimodal Diagnosis

用于呼吸声分析和多模态诊断的Transformer架构

Theodore Aptekarev, Vladimir Sokolovsky, Gregory Furman

机构 * Ben Gurion University of the Negev(本· Gurion 农业大学)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文提出基于Transformer的AST和VLM模型,用于呼吸声分析和多模态诊断,AST在哮喘检测中达到97%准确率,VLM整合临床信息提升诊断能力。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13866 2026-01-21 q-bio.NC 67%

Audio Outperforms Text for Visual Decoding

音频在视觉解码中表现优于文本

Zhengdi Zhang, Hao Zhang, Wenjun Xia

专题命中 音频语音多模态 :multimodal(abstract);image-text(abstract)

AI总结 本研究提出利用听觉表示替代文本描述,发现听觉模态在视觉解码中更高效且准确,揭示了听觉语义在解码视觉认知中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13651 2026-01-21 cs.CV 57%

Face-Voice Association with Inductive Bias for Maximum Class Separation

人脸-语音关联与最大类别分离的归纳偏置

Marta Moscati, Oleksandr Kats, Mubashir Noman, Muhammad Zaigham Zaheer, Yufang Hou, Markus Schedl, Shah Nawaz

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨) MBZUAI IT:U Interdisciplinary Transformation University Austria(IT:U跨学科转型大学奥地利) Linz Institute of Technology(林茨技术学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于最大类别分离作为归纳偏置的人脸-语音关联方法,通过实验验证其在多模态学习中的有效性。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12844 2026-01-21 cs.CL 57%

Rapport du Projet de Recherche TRAIMA

TRAIMA研究项目报告

Julie Rançon, Jean-François Cerisier, Emilie Remond, Aurélien Nguyen, Andrew Peterson, Ladjel Bellatreche

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 TRAIMA项目旨在建立多模态教学互动自动处理的方法论框架,通过分析课堂互动中的解释性序列,探索机器学习在多模态数据转录和分类中的应用。

Comments in French language

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12700 2026-01-21 eess.AS cs.SD 57%

Improving Audio Question Answering with Variational Inference

通过变分推断改进音频问答

Haolin Chen

机构 * Idiap Research Institute, Martigny, Switzerland(日内瓦研究所) École Polytechnique Fédérale de Lausanne, Lausanne, Switzerland(洛桑联邦理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文通过改进的变分推断优化器提升音频问答任务的预测准确性与校准性。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12289 2026-01-21 cs.SD cs.LG eess.AS 57%

ParaMETA: Towards Learning Disentangled Paralinguistic Speaking Styles Representations from Speech

ParaMETA: 向学习解耦的语音语义说话风格表示迈进

Haowei Lou, Hye-young Paik, Wen Hu, Lina Yao

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 ParaMETA通过统一框架学习解耦的语音语义说话风格表示,实现多任务处理和生成任务中的细粒度风格控制。

Comments 9 pages, 7 figures, Accepted to AAAI-26 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13355 2026-01-21 cs.HC 50%

Remote Triggers: Misophonia, Technology Non-Use, and Design for Inclusive Digital Spaces

远程触发:对声音厌恶、技术不使用与包容性数字空间的设计

Tawfiq Ammari, Samantha Gilgan

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本研究探讨声音厌恶者在数字空间中的体验,提出设计干预以减少技术不使用和排斥问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11328 2026-01-21 cs.HC 50%

ProjecTA: A Semi-Humanoid Robotic Teaching Assistant with In-Situ Projection for Guided Tours

ProjecTA:一种配备现场投影的半人形教学助手用于导览

Hanqing Zhou, Yichuan Zhang, Zihan Zhang, Wei Zhang, Chao Wang, Pengcheng An

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 ProjecTA通过现场投影与手势协调,减少认知负荷并提升学习体验,为移动学习提供新的设计方向。

Comments 35 pages, 12 figures, 2 appendixes, 3 supplementary meterials, to appear at ACM CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏