arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-13 至 2026-01-13 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 3 篇

2305.07216 2026-01-13 cs.LG cs.MM cs.SD eess.AS 84%

Versatile audio-visual learning for emotion recognition

多功能音频视觉学习用于情绪识别

Lucas Goncalves, Seong-Gyun Leem, Wei-Cheng Lin, Berrak Sisman, Carlos Busso

机构 * Multimodal Signal Processing (MSP) Lab(多模态信号处理实验室) Erik Jonsson School of Engineering and Computer Science(埃里克·乔纳森工程与计算机科学学院) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.MM、eess.AS

AI总结 本文提出VAVL框架,通过共享层和残差连接实现灵活的音频视觉学习,提升情绪识别和预测性能。

Comments 18 pages, 4 Figures, 3 tables (published at IEEE Transactions on Affective Computing)

Journal ref IEEE Transactions on Affective Computing 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20166 2026-01-13 eess.AS cs.AI cs.CL cs.LG cs.SD 67%

From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data

从对齐到提升:通过合成数据 bootstrap 音频-语言对齐

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文提出BALSa框架,通过合成数据生成提升音频-语言对齐能力,缓解幻觉问题并增强模型理解与推理性能。

Comments Published in IEEE Transactions on Audio, Speech, and Language Processing (TASLP). Project Website: https://kuan2jiu99.github.io/Balsa

Journal ref IEEE Transactions on Audio, Speech and Language Processing, vol. 33, pp. 4604-4619, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06774 2026-01-13 cs.HC 50%

ImmuniFraug: A Metacognitive Intervention Anti-Fraud Approach to Enhance Undergraduate Students' Cyber Fraud Awareness

ImmuniFraug:一种基于元认知干预的反欺诈方法,以提高本科生的网络欺诈意识

Xiangzhe Yuan, Jiajun Wang, Huanchen Wang, Qian Wan, Siying Hu

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 ImmuniFraug通过基于LLM的多模态欺诈模拟,提升本科生网络欺诈意识和自我效能感,提供更有效的反欺诈教育方法。

详情

展开后加载摘要…

URL PDF HTML 收藏