arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-17 至 2026-02-17 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 12 篇

2602.13640 2026-02-17 cs.RO cs.AI 83%

Hierarchical Audio-Visual-Proprioceptive Fusion for Precise Robotic Manipulation

层次化音频-视觉-本体感知融合用于精确机器人操作

Siyuan Li, Jiani Lu, Yu Song, Xianren Li, Bo An, Peng Liu

机构 * Harbin Institute of Technology, China(哈尔滨工业大学) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出层次化多模态融合框架,通过整合音频、视觉和本体感知信息,提升机器人精确操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05847 2026-02-17 cs.AI cs.CV 81%

OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention

OmniVideo-R1: 通过查询意图和模态注意力强化音频视觉推理

Zhangquan Chen, Jiale Tao, Ruihuang Li, Yihao Hu, Ruitao Chen, Zhantao Yang, Xinlei Yu, Haodong Jing, Manyuan Zhang, Shuai Shao, Biao Wang, Qinglin Lu, Ruqi Huang

机构 * tencent(腾讯)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI

AI总结 OmniVideo-R1通过查询意图和模态注意力机制,提升多模态推理能力,在多个基准上超越现有基线模型。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13263 2026-02-17 cs.CL cs.SD eess.AS 81%

Multimodal Consistency-Guided Reference-Free Data Selection for ASR Accent Adaptation

多模态一致性引导的参考自由数据选择用于ASR口音适应

Ligong Lei, Wenwen Lu, Xudong Pang, Zaokere Kadeer, Aishan Wumaier

机构 * School of Computer Science and Technology(计算机科学与技术学院) Xinjiang University(新疆大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS

AI总结 本文提出一种多模态一致性引导的参考自由数据选择方法,用于提升ASR在口音适应中的性能,通过减少噪声伪标签和优化查询相关性,实现更高效的口音适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13787 2026-02-17 cs.SD eess.AS 74%

Enhancing spatial hearing with cochlear implants: exploring the role of AI, multimodal interaction and perceptual training

通过 cochlear implants 增强空间听觉:探索人工智能、多模态交互和感知训练的作用

Lorenzo Picinali, Robert Baumgartner, Valerie Gaveau, Antonino Greco, Stefanie Liebe, Paul Oomen, Christoph Braun

机构 * Acoustics Research Institute, Austrian Academy of Sciences(奥地利科学院声学研究所) Centre de Recherche en Neurosciences de Lyon Inserm(里昂神经科学研究中心(Inserm)) Department of Neural Dynamics and Magnetoencephalography, Hertie Institute for Clinical Brain Research, University of Tübingen(图宾根大学神经动力学与脑磁图部门) Centre for Integrative Neuroscience, University of Tübingen(图宾根大学整合神经科学中心) NEMO Labs Nonprofit Kft., Budapest(布达佩斯NEMO实验室(非营利公司))

专题命中 音频语音多模态 :multimodal(title);分类 eess.AS

AI总结 本文提出多学科合作框架,通过人工智能、多模态交互和感知训练提升耳蜗植入物用户的空间听觉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14655 2026-02-17 cs.CL cs.AI 73%

Breaking Data Efficiency Dilemma: A Federated and Augmented Learning Framework For Alzheimer's Disease Detection via Speech

突破数据效率困境:一种联邦学习与增强学习框架用于通过语音检测阿尔茨海默病

Xiao Wei, Bin Wen, Yuqin Lin, Kai Li, Mingyang gu, Xiaobao Wang, Longbiao Wang, Jianwu Dang

机构 * Tianjin Key Laboratory of Cognitive Computing and Application(认知计算与应用天津重点实验室) College of Intelligence and Computing, Tianjin University(智能计算学院,天津大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) College of Computer and Data Science, Fuzhou University(计算机与数据科学学院,福州大学) Huiyan Technology (Tianjin) Co., Ltd(慧研科技(天津)有限公司)

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 FAL-AD通过联邦学习与数据增强框架,实现阿尔茨海默病语音检测中的数据效率提升,达到91.52%的多模态准确率。

Comments 5 pages, 1 figures, accepted by ICASSP 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13954 2026-02-17 cs.SD cs.AI 70%

Eureka-Audio: Triggering Audio Intelligence in Compact Language Models

Eureka-Audio: 在紧凑语言模型中触发音频智能

Dan Zhang, Yishu Lei, Jing Hu, Shuwei He, Songhe Deng, Xianlong Luo, Danxiang Zhu, Shikun Feng, Rui Liu, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

专题命中 音频语音多模态 :cross-modal(abstract);omni-modal(abstract);分类 cs.AI

AI总结 Eureka-Audio通过紧凑架构和统一端到端设计,在低参数量下实现高性能音频理解,匹配甚至超越大模型表现。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09424 2026-02-17 cs.CL cs.AI cs.LG eess.AS 67%

The Speech-LLM Takes It All: A Truly Fully End-to-End Spoken Dialogue State Tracking Approach

语音大语言模型一网打尽:一种真正端到端的语音对话状态跟踪方法

Nizar El Ghazal, Antoine Caubrière, Valentin Vielzeuf

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文提出利用语音大语言模型实现端到端语音对话状态跟踪,通过比较不同上下文管理策略,发现完整语音对话输入能获得最佳性能,同时压缩历史信息能保持准确性与效率的平衡。

Comments Accepted for presentation at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14127 2026-02-17 cs.SD 67%

MUKA: Multi Kernel Audio Adaptation Of Audio-Language Models

MUKA:多核音频适应音频-语言模型

Reda Bensaid, Amine Ouasfi, Yassir Bendou, Ilyass Moummad, Vincent Gripon, François Leduc-Primeau, Adnane Boukhayma

机构 * Inria, University Rennes, IRISA, CNRS(Inria、里昂大学、IRISA、CNRS)

专题命中 音频语音多模态 :multimodal(abstract);multimodal foundation model(abstract)

AI总结 MUKA通过结合细粒度表示与全局语义表示,实现音频-语言模型的少样本适应,展现了在适应性和效率上的平衡性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14224 2026-02-17 cs.SD cs.CL cs.MM 62%

The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents

Interspeech 2026音频推理挑战:评估音频推理模型和代理的推理过程质量

Ziyang Ma, Ruiyang Xu, Yinghao Ma, Chao-Han Huck Yang, Bohan Li, Jaeyeon Kim, Jin Xu, Jinyu Li, Carlos Busso, Kai Yu, Eng Siong Chng, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Queen Mary University of London(伦敦大学Queen Mary) NVIDIA(NVIDIA公司) Carnegie Mellon University(卡内基梅隆大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) Microsoft Corporation(微软公司)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.MM

AI总结 Interspeech 2026音频推理挑战通过评估推理过程质量,探讨了音频推理模型和代理在事实性和逻辑性方面的表现及改进方向。

Comments The official website of the Audio Reasoning Challenge: https://audio-reasoning-challenge.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13455 2026-02-17 cs.CL cs.AI cs.HC 62%

Using Machine Learning to Enhance the Detection of Obfuscated Abusive Words in Swahili: A Focus on Child Safety

利用机器学习增强斯瓦希里语中隐晦侮辱性词汇的检测:聚焦儿童安全

Phyllis Nabangi, Abdul-Jalil Zakaria, Jema David Ndibwile

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究利用机器学习方法提升斯瓦希里语中隐晦侮辱性词汇的检测能力,旨在提高儿童网络环境的安全性。

Comments Accepted at the Second IJCAI AI for Good Symposium in Africa, hosted by Deep Learning Indaba, 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13790 2026-02-17 cs.CL 57%

How Do Lexical Senses Correspond Between Spoken German and German Sign Language?

德语口语中的词义如何与德国手语对应?

Melis Çelikkol, Wei Zhao

机构 * Institute for Computational Linguistics, University of Heidelberg(计算语言学研究所,海德堡大学) Department of Computing Science, University of Aberdeen(计算机科学系,阿伯丁大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本研究通过分析德语和德国手语的词义对应关系,构建了首个跨模态词义对应标注数据集,利用语义相似性方法提高了词义映射的识别效果。

Comments EACL'26 (Student Research Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13330 2026-02-17 cs.CV 57%

Zwitscherkasten -- DIY Audiovisual bird monitoring

Zwitscherkasten -- DIY音频视觉鸟类监测

Dominik Blum, Elias Häring, Fabian Jirges, Martin Schäffer, David Schick, Florian Schulenberg, Torsten Schön

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 Zwitscherkasten是一种利用边缘设备进行音频和视觉数据采集的DIY鸟类监测系统,通过深度学习实现实时无创的鸟类物种识别,支持生物多样性监测和公民科学应用。

Comments Project Report of the Applied Artificial Intelligence Degree Program at Technische Hochschule Ingolstadt

详情

展开后加载摘要…

URL PDF HTML 收藏