arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-28 至 2026-01-28 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 9 篇

2510.22603 2026-01-28 eess.AS cs.CV cs.SD 84%

Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs

利用大语言模型缓解音频视觉语音识别中的注意力下沉和大规模激活

Anand, Umberto Cappellazzo, Stavros Petridis, Maja Pantic

机构 * University of British Columbia, Canada(不列颠哥伦比亚大学) Imperial College London, UK(伦敦帝国学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS

AI总结 本文提出了一种简单有效的去相关损失,通过减少BOS与其它token的余弦相似性,缓解音频视觉语音识别中的注意力下沉和大规模激活问题,同时在高下采样率下降低词错误率。

Comments IEEE ICASSP 2026. The code is available at https://github.com/umbertocappellazzo/Llama-AVSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06893 2026-01-28 cs.CV cs.CL cs.MM cs.SC 82%

A New Hybrid Intelligent Approach for Multimodal Detection of Suspected Disinformation on TikTok

一种用于TikTok上疑似虚假信息多模态检测的新混合智能方法

Jared D. T. Guerrero-Sosa, Andres Montoro-Montarroso, Francisco P. Romero, Jesus Serrano-Guerrero, Jose A. Olivas

机构 * University of Castilla-La Mancha(卡斯蒂利亚-拉曼查大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本研究提出一种结合深度学习与模糊逻辑的混合方法,用于检测TikTok视频中的疑似虚假信息,通过多模态特征分析与可解释性检测提升虚假信息识别的准确性与实用性。

Journal ref Multimedia Tools and Applications 85 (2026) 37

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07253 2026-01-28 eess.AS cs.CV cs.SD 81%

Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models

Omni-AVSR:迈向基于大语言模型的统一多模态语音识别

Umberto Cappellazzo, Xubo Liu, Pingchuan Ma, Stavros Petridis, Maja Pantic

机构 * Imperial College London, UK(伦敦帝国理工学院) University of Surrey, UK(萨里大学)

专题命中 音频语音多模态 :multimodal(title);audio-visual(abstract);分类 cs.CV、eess.AS

AI总结 Omni-AVSR通过统一多模态语音识别框架,结合高效多粒度训练与参数高效适应,实现跨任务协同,降低资源消耗并提升鲁棒性。

Comments Accepted to IEEE ICASSP 2026 (camera-ready version). Project website (code and model weights): https://umbertocappellazzo.github.io/Omni-AVSR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19673 2026-01-28 cs.SD cs.AI 79%

A Benchmark for Audio Reasoning Capabilities of Multimodal Large Language Models

多模态大语言模型音频推理能力的基准测试

Iwona Christop, Mateusz Czyżnikiewicz, Paweł Skórzewski, Łukasz Bondaruk, Jakub Kubiak, Marcin Lewandowski, Marek Kubis

机构 * Adam Mickiewicz University(亚当·密克维茨大学) Samsung R&D Institute Poland(三星波兰研发中心)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Audio Reasoning Tasks基准测试,用于评估多模态模型在结合不同音频任务进行推理方面的能力。

Comments 31 pages, 2 figures, accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19130 2026-01-28 eess.AS 79%

Beyond Lips: Integrating Gesture and Lip Cues for Robust Audio-visual Speaker Extraction

超越嘴唇:整合手势和嘴唇线索以实现鲁棒的音频视觉说话人提取

Zexu Pan, Xinyuan Qian, Shengkui Zhao, Kun Zhou, Bin Ma

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

AI总结 本文提出SeLG模型,通过融合嘴唇和手势信息,利用交叉注意力和对比学习提升音频视觉说话人提取的鲁棒性。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22263 2026-01-28 eess.AS 79%

Empowering Multimodal Respiratory Sound Classification with Counterfactual Adversarial Debiasing for Out-of-Distribution Robustness

通过反事实对抗去偏来增强多模态呼吸声分类以实现分布外鲁棒性

Heejoon Koo, Miika Toikkanen, Yoon Tae Kim, Soo Yong Kim, June-Woo Kim

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 本文提出反事实对抗去偏框架,通过抑制元数据依赖和增强元数据不变表示,提升多模态呼吸声分类在分布外鲁棒性上的性能。

Comments Accepted by ICASSP 2026 (2026 IEEE International Conference on Acoustics, Speech, and Signal Processing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19063 2026-01-28 cs.CL cs.SD 57%

Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback

通过AI反馈强化学习优化语音对话系统的对话质量

Siddhant Arora, Jinchuan Tian, Jiatong Shi, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

AI总结 本文提出多奖励RLAIF框架,通过结合语义、音频质量和情感一致性奖励,提升语音对话系统的对话质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12619 2026-01-28 cs.LG cs.AI cs.DC 57%

BootSeer: Analyzing and Mitigating Initialization Bottlenecks in Large-Scale LLM Training

BootSeer:分析和缓解大规模大语言模型训练中的初始化瓶颈

Rui Li, Xiaoyun Zhi, Jinxin Chi, Menghan Yu, Lixin Huang, Jia Zhu, Weilun Zhang, Xing Ma, Wenjia Liu, Zhicheng Zhu, Daowen Luo, Zuquan Song, Xin Yin, Chao Xiang, Shuguang Wang, Wencong Xiao, Gene Cooperman

机构 * Northeastern University(东北大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 BootSeer通过优化容器镜像加载、依赖安装和模型检查点恢复,显著减少大规模LLM训练的启动开销。

Comments 18 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19281 2026-01-28 cs.HC 50%

Gazeify Then Voiceify: Physical Object Referencing Through Gaze and Voice Interaction with Displayless Smart Glasses

通过眼动和语音交互实现无显示屏智能眼镜的物理物体指认

Zheng Zhang, Mengjie Yu, Tianyi Wang, Kashyap Todi, Ajoy Savio Fernandes, Yue Liu, Haijun Xia, Tovi Grossman, Tanya Jonker

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 无显示屏智能眼镜通过眼动和语音交互实现物理物体指认,结合先进分割与视觉-语言模型,提升交互准确性和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏