arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-08 至 2025-12-08 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 3 篇

2512.05745 2025-12-08 cs.CR cs.MM 83%

ARGUS: Defending Against Multimodal Indirect Prompt Injection via Steering Instruction-Following Behavior

ARGUS: 通过引导指令遵循行为防御多模态间接提示注入攻击

Weikai Lu, Ziqian Zeng, Kehua Zhang, Haoran Li, Huiping Zhuang, Ruidong Wang, Cen Chen, Hao Peng

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.MM

AI总结 ARGUS通过引导指令遵循行为,在表示空间中寻找最优防御方向,实现对多模态间接提示注入攻击的有效防御,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05126 2025-12-08 eess.AS cs.AI cs.CL cs.CV cs.MM cs.SD 73%

SyncVoice: Towards Video Dubbing with Vision-Augmented Pretrained TTS Model

SyncVoice:面向视频配音的视觉增强预训练TTS模型

Kaidi Wang, Yi He, Wenhao Guan, Weijie Wu, Hongwu Ding, Xiong Zhang, Di Wu, Meng Meng, Jian Luan, Lin Li, Qingyang Hong

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) MiLM Plus, Xiaomi Inc., China(小米公司) School of Electronic Science and Engineering, Xiamen University, China(厦门大学电子科学与技术学院)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 SyncVoice通过视觉增强预训练TTS模型,提升视频配音的语音自然度和音视频同步性能,适用于多语言视频翻译场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05508 2025-12-08 cs.SD cs.AI cs.LG 57%

Lyrics Matter: Exploiting the Power of Learnt Representations for Music Popularity Prediction

歌词很重要:利用学习到的表示力预测音乐流行度

Yash Choudhary, Preeti Rao, Pushpak Bhattacharyya

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔) Department of Electrical Engineering, IIT Bombay(印度理工学院班加罗尔电气工程系) CFILT, Department of Computer Science, IIT Bombay(印度理工学院班加罗尔计算机科学系)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型提取歌词嵌入,结合音频和社交数据,提升音乐流行度预测精度,实验显示在SpotGenTrack数据集上MAE和MSE分别提升9%和20%。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏