arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-27 至 2026-01-27 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 14 篇

2508.01659 2026-01-27 cs.SD eess.AS 88%

From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs

从对比到共同性:用于增强多模态大语言模型中音频-文本跨模态理解的音频共同性描述

Yuhang Jia, Xu Zhang, Yujie Guo, Yang Chen, Shiwan Zhao

机构 * TMCC, College of Computer Science, Nankai University, Tianjin, China(TMCC,计算机科学学院,南开大学,天津,中国)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title,abstract);分类 eess.AS

AI总结 本文提出音频共同性描述方法,旨在增强多模态大语言模型中音频与文本的跨模态理解,通过捕捉音频片段间的共享语义以改善模型的泛化能力与任务特定性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17645 2026-01-27 cs.SD cs.CL cs.CV cs.MM eess.AS 85%

AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking

AVMeme Exam: 一个多模态、多语言、多文化的基准测试,用于评估LLM的上下文和文化知识与思维

Xilin Jiang, Qiaolin Wang, Junkai Wu, Xiaomin He, Zhongweiyang Xu, Yinghao Ma, Minshuo Piao, Kaiyi Yang, Xiuwen Zheng, Riki Shimizu, Yicong Chen, Arsalan Firoozi, Gavin Mischler, Sukru Samet Dindar, Richard Antonello, Linyang He, Tsun-An Hsieh, Xulin Fan, Yulun Wu, Yuesheng Ma, Chaitanya Amballa, Weixiong Chen, Jiarui Hai, Ruisi Li, Vishal Choudhari, Cong Han, Yinghao Aaron Li, Adeen Flinker, Mounya Elhilali, Emmanouil Benetos, Mark Hasegawa-Johnson, Romit Roy Choudhury, Nima Mesgarani

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 AVMeme Exam 通过多模态、多语言、多文化的基准测试,评估LLM在上下文和文化理解方面的局限性,揭示模型在无文本音乐和文化思维上的不足。

Comments avmemeexam.github.io/public

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17530 2026-01-27 cs.CL 83%

Revealing the Truth with ConLLM for Detecting Multi-Modal Deepfakes

用ConLLM揭示真相以检测多模态深度伪造

Gautam Siddharth Kashyap, Harsh Joshi, Niharika Jain, Ebad Shabbir, Jiechao Gao, Nipun Joshi, Usman Naseem

机构 * Macquarie University(麦考瑞大学) Bharati Vidyapeeth’s College Of Engineering(巴里蒂大学工程学院) Vivekananda Institute of Professional Studies (VIPS)(维维kananda专业研究学院) DSEU-Okhla Center for SDGC(SDGC研究中心) Stanford University(斯坦福大学) Cornell University(康奈尔大学)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);audio-visual(abstract);分类 cs.CL

AI总结 ConLLM通过对比学习和大语言模型推理,有效提升多模态深度伪造检测的准确率和泛化能力。

Comments Accepted at EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18393 2026-01-27 cs.SD cs.CL eess.AS 81%

OCR-Enhanced Multimodal ASR Can Read While Listening

增强OCR的多模态ASR可边听边读

Junli Chen, Changli Tang, Yixuan Li, Guangzhi Sun, Chao Zhang

机构 * Department of Electrical Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国)

专题命中 音频语音多模态 :multimodal(title);audio-visual(abstract);分类 cs.CL、eess.AS

AI总结 Donut-Whisper通过结合双编码器和交叉注意力模块,利用视觉信息提升中英文语音识别性能,实现显著的WER和CER降低。

Comments 4 pages, 2 figures. Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17880 2026-01-27 cs.CV 79%

Quran-MD: A Fine-Grained Multilingual Multimodal Dataset of the Quran

Quran-MD: 一部涵盖多语言多模态的《古兰经》细粒度数据集

Muhammad Umar Salman, Mohammad Areeb Qazi, Mohammed Talha Alam

机构 * MBZUAI(穆扎伊人工智能研究所)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 Quran-MD 是一个包含多语言多模态的《古兰经》数据集,涵盖文本、语言和音频层面,用于提升语音识别、语义检索和个性化教学系统等应用。

Comments 6 pages, 2 tables and 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17638 2026-01-27 cs.CR 78%

FOCA: Multimodal Malware Classification via Hyperbolic Cross-Attention

FOCA:基于双模态的恶意软件分类方法

Nitin Choudhury, Bikrant Bikram Pratap Maurya, Orchid Chetia Phukan, Arun Balaji Buduru

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 FOCA通过双曲空间中的交叉注意力机制和双曲投影模块,实现音频和视觉模态的恶意软件分类,展现出优越的分类性能。

Comments Accepted to the International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18451 2026-01-27 cs.CV cs.AI cs.LG cs.MM cs.SD 67%

3DGesPolicy: Phoneme-Aware Holistic Co-Speech Gesture Generation Based on Action Control

3DGesPolicy: 基于动作控制的音素感知整体语义手势生成

Xuanmeng Sha, Liyun Zhang, Tomohiro Mashita, Naoya Chiba, Yuki Uranishi

机构 * The University of Osaka(大阪大学) Osaka Electro-Communication University(大阪电讯大学) Osaka University(大阪大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 3DGesPolicy通过基于动作控制的框架,结合音素感知和多模态信号融合,实现了更自然且高度语音对齐的整体语义手势生成。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16387 2026-01-27 cs.CL cs.AI cs.SD eess.AS 67%

Probing the Hidden Talent of ASR Foundation Models for L2 English Oral Assessment

探测ASR基础模型在二语英语口语评估中的隐藏潜能

Fu-An Chao, Bi-Cheng Yan, Berlin Chen

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文通过探测Whisper模型的隐藏能力,展示了其在二语英语口语评估中的潜力,通过轻量级分类器和辅助线索提升性能。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05749 2026-01-27 cs.SD 67%

MSF-SER: Enriching Acoustic Modeling with Multi-Granularity Semantics for Speech Emotion Recognition

MSF-SER:通过多粒度语义增强语音情感识别的声学建模

Haoxun Li, Yuqing Sun, Hanlei Shi, Yu Liu, Leyuan Qu, Taihao Li

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(杭州高等研究所,中国科学院大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 MSF-SER通过多粒度语义融合提升语音情感识别的声学建模效果,解决传统方法在情感表达细节和高层解释性线索方面的不足。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18456 2026-01-27 cs.SD eess.AS 57%

Geneses: Unified Generative Speech Enhancement and Separation

Geneses: 一体化的生成式语音增强与分离

Kohei Asai, Wataru Nakata, Yuki Saito, Hiroshi Saruwatari

机构 * The University of Tokyo, Japan(东京大学) National Institute of Advanced Industrial Science and Technology (AIST), Japan(日本先进工业科学和技术研究院)

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

AI总结 Geneses通过多模态扩散Transformer和潜在流匹配实现统一的高质量语音增强与分离,优于传统方法并具备更强的复杂退化鲁棒性。

Comments Accepted to ICASSP 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14784 2026-01-27 eess.AS 57%

MELA-TTS: Joint transformer-diffusion model with representation alignment for speech synthesis

MELA-TTS:联合变压器-扩散模型与表征对齐用于语音合成

Keyu An, Zhiyu Zhang, Changfeng Gao, Yabin Li, Zhendong Peng, Haoxu Wang, Zhihao Du, Han Zhao, Zhifu Gao, Xiangang Li

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 MELA-TTS通过联合变压器-扩散模型与表征对齐,实现端到端文本到语音合成,提升连续特征建模效率和跨模态一致性。

Comments accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18010 2026-01-27 eess.AS cs.SD 57%

AmbER$^2$: Dual Ambiguity-Aware Emotion Recognition Applied to Speech and Text

AmbER$^2$: 双重模糊感知情感识别应用于语音和文本

Jingyao Wu, Grace Lin, Yinuo Song, Rosalind Picard

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 AmbER$^2$通过双重模糊感知框架提升语音和文本情感识别的准确性与鲁棒性。

Comments Accepted in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03310 2026-01-27 eess.AS 57%

TASU: Text-Only Alignment for Speech Understanding

TASU:用于语音理解的纯文本对齐

Jing Peng, Yi Yang, Xu Li, Yu Xi, Quanwei Tang, Yangui Fang, Junjie Li, Kai Yu

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 TASU通过纯文本数据实现语音理解的跨模态对齐,提升了零样本语音识别性能,并在多个基准测试中优于现有模型。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17287 2026-01-27 cs.RO 50%

Real-Time Synchronized Interaction Framework for Emotion-Aware Humanoid Robots

面向情感感知人形机器人的实时同步交互框架

Yanrong Chen, Xihan Bian

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出一种实时框架,通过双通道情感引擎、动态时间规整和闭环验证,实现人形机器人的情感同步交互,提升在医疗、教育等动态场景中的应用能力。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏