arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-11 至 2026-02-11 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2510.21797 2026-02-11 cs.LG cs.AI cs.SD eess.AS 87%

Quantifying Multimodal Imbalance: A GMM-Guided Adaptive Loss for Audio-Visual Learning

量化多模态不平衡:一种基于GMM的自适应损失用于音频-视觉学习

Zhaocheng Liu, Zhiwen Yu, Xiaoqing Liu

机构 * South China University of Technology(南方科技大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 cs.AI、eess.AS

AI总结 本文提出基于GMM的自适应损失,用于量化和缓解多模态学习中的样本级不平衡问题,通过双阶段框架提升音频-视觉学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09637 2026-02-11 cs.CV cs.MM 81%

Towards Training-free Multimodal Hate Localisation with Large Language Models

无需训练的多模态仇恨定位与大型语言模型

Yueming Sun, Long Yang, Jianbo Jiao, Zeyu Fu

机构 * Hybrid Intelligence Lab, University of Durham(杜伦大学混合智能实验室) Multimodal Intelligence Lab, University of Exeter(埃克塞特大学多模态智能实验室) The MIx Group University of Birmingham(伯明翰大学MIx集团)

专题命中 音频语音多模态 :multimodal(title);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 提出无需训练的多模态仇恨视频定位框架LELA,通过多阶段提示方案和跨模态推理机制实现高精度定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09121 2026-02-11 cs.AI 79%

Uncertainty-Aware Multimodal Emotion Recognition through Dirichlet Parameterization

通过狄利克雷参数化实现的不确定性感知多模态情绪识别

Rémi Grzeczkowicz, Eric Soriano, Ali Janati, Miyu Zhang, Gerard Comas-Quiles, Victor Carballo Araruna, Aneesh Jonelagadda

机构 * Kaliber Labs(Kaliber实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种轻量级且隐私保护的多模态情绪识别框架,通过狄利克雷参数化方法协调不同模态的不确定性,实现高效且鲁棒的情绪识别。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08794 2026-02-11 cs.CV cs.SD 77%

MOVA: Towards Scalable and Synchronized Video-Audio Generation

MOVA:迈向可扩展且同步的视频-音频生成

OpenMOSS Team, Donghua Yu, Mingshu Chen, Qi Chen, Qi Luo, Qianyi Wu, Qinyuan Cheng, Ruixiao Li, Tianyi Liang, Wenbo Zhang, Wenming Tu, Xiangyu Peng, Yang Gao, Yanru Huo, Ying Zhu, Yinze Luo, Yiyang Zhang, Yuerong Song, Zhe Xu, Zhiyu Zhang, Chenchen Yang, Cheng Chang, Chushu Zhou, Hanfu Chen, Hongnan Ma, Jiaxi Li, Jingqi Tong, Junxi Liu, Ke Chen, Shimin Li, Shiqi Jiang, Songlin Wang, Wei Jiang, Zhaoye Fei, Zhiyuan Ning, Chunguo Li, Chenhui Li, Ziwei He, Zengfeng Huang, Xie Chen, Xipeng Qiu

专题命中 音频语音多模态 :multimodal(abstract);image-text(abstract);audio-visual(abstract);分类 cs.CV

AI总结 MOVA通过混合专家架构生成高质量同步音频视频内容,支持图像-文本到视频-音频的生成任务,推动开放研究与创作者社区发展。

Comments Technical report for MOVA (open-source video-audio generation model). 38 pages, 10 figures, 22 tables. Project page: https://mosi.cn/models/mova Code: https://github.com/OpenMOSS/MOVA Models: https://huggingface.co/collections/OpenMOSS-Team/mova. Qinyuan Cheng and Tianyi Liang are project leader. Xie Chen and Xipeng Qiu are corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏