arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-14 至 2026-01-14 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2601.08457 2026-01-14 cs.AI cs.CL 84%

An Under-Explored Application for Explainable Multimodal Misogyny Detection in code-mixed Hindi-English

可解释的多模态 misogyny 检测在混合印地语-英语中的一个未被充分探索的应用

Sargam Yadav, Abhishek Kaushik, Kevin Mc Daid

专题命中 音频语音多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个多模态且可解释的网页应用,用于检测混合印地语-英语中的性别歧视,利用Transformer模型和可解释性技术提升透明度和可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04563 2026-01-14 cs.LG cs.AI cs.CL cs.CV 75%

A Vision for Multisensory Intelligence: Sensing, Science, and Synergy

多感官智能的愿景:感知、科学与协同

Paul Pu Liang

机构 * MIT Media Lab and MIT EECS(MIT媒体实验室和MIT电子工程与计算机科学系)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出未来十年多感官人工智能的研究愿景,强调通过感知、科学和协同三大主题推动多感官技术发展,提升人与AI的交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04151 2026-01-14 cs.CV cs.AI cs.MM cs.SD 67%

Apollo: Unified Multi-Task Audio-Video Joint Generation

Apollo:统一多任务音频视频联合生成

Jun Wang, Chunyu Qiang, Yuxin Guo, Yiran Wang, Xijuan Zeng, Feng Deng

机构 * Kuaishou Technology(快手科技)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 Apollo通过统一多任务架构、渐进训练策略和大规模数据集,实现音频视频联合生成的高保真度与强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08342 2026-01-14 cs.CL 57%

Detecting Mental Manipulation in Speech via Synthetic Multi-Speaker Dialogue

通过合成多说话对话检测心理操控

Run Chen, Wen Liang, Ziwei Gong, Lin Ai, Julia Hirschberg

机构 * Columbia University(哥伦比亚大学) Red Hat(红帽公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出首个通过合成多说话对话检测心理操控的研究,揭示语音与文本在检测准确性上的差异,强调多模态对话系统中模态意识的重要性。

Comments Accepted to IWSDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07999 2026-01-14 cs.SD eess.AS 57%

VoxCog: Towards End-to-End Multilingual Cognitive Impairment Classification through Dialectal Knowledge

VoxCog: 通过方言知识实现端到端多语言认知障碍分类

Tiantian Feng, Anfeng Xu, Jinkook Lee, Shrikanth Narayanan

机构 * Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California(明斯希德电气与计算机工程系,南加州大学) Dornsife College of Letters, Arts and Sciences, University of Southern California(多恩斯菲学院,南加州大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 VoxCog通过整合方言知识,实现了端到端的多语言认知障碍分类,其语音基础模型在AD和MCI检测中表现出优于多模态集成和大语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏