arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-24 至 2025-11-24 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2311.02733 2025-11-24 cs.CV cs.AI cs.LG cs.MM cs.SD eess.AS 85%

AV-Lip-Sync+: Leveraging AV-HuBERT to Exploit Multimodal Inconsistency for Deepfake Detection of Frontal Face Videos

AV-Lip-Sync+: 借助AV-HuBERT利用多模态不一致性的深度伪造检测方法

Sahibzada Adil Shahzad, Ammarah Hashmi, Yan-Tsung Peng, Yu Tsao, Hsin-Min Wang

机构 * Social Networks and Human-Centered Computing Program, Taiwan International Graduate Program, Academia Sinica(学术.sinica.edu.tw 社会网络与人本计算计划,台湾国际研究生计划,台湾.sinica.edu.tw) Department of Computer Science, National Chengchi University(计算机科学系,国立政治大学) Institute of Information Systems and Applications, National Tsing Hua University(信息系统与应用研究所,国立清华大学) Research Center for Information Technology Innovation, Academia Sinica(资讯技术创新研究中心,学术.sinica.edu.tw) Institute of Information Science, Academia Sinica(资讯研究所,学术.sinica.edu.tw)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出AV-Lip-Sync+方法,利用AV-HuBERT和多模态不一致性检测深度伪造,实现对正面人脸视频的高精度检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17323 2025-11-24 cs.SD cs.AI cs.CL cs.MM 82%

MusicAIR: A Multimodal AI Music Generation Framework Powered by an Algorithm-Driven Core

MusicAIR: 一种由算法驱动核心的多模态AI音乐生成框架

Callie C. Liao, Duoduo Liao, Ellie L. Zhang

机构 * Stanford University(斯坦福大学) George Mason University(乔治·马歇尔大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 MusicAIR通过算法驱动的核心生成音乐,能从歌词、文本和图像生成符合音乐理论的旋律谱,提升音乐创作效率并降低入门门槛。

Comments Accepted by IEEE Big Data 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09439 2025-11-24 eess.AS cs.SD 57%

Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?

Omni-R1:你真的需要音频来微调你的音频大语言模型吗?

Andrew Rouditchenko, Saurabhchand Bhati, Edson Araujo, Samuel Thomas, Hilde Kuehne, Rogerio Feris, James Glass

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Goethe University of Frankfurt(法兰克福歌德大学) IBM Research AI(IBM人工智能研究部) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

AI总结 Omni-R1通过强化学习方法GRPO微调多模态大语言模型,实现了在音频问答任务上的新SOTA性能,同时发现文本推理能力提升对音频性能有显著贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16769 2025-11-24 cs.HC 50%

Trust in AI emerges from distrust in humans: A machine learning study on decision-making guidance

对人工智能的信任源于对人类的不信任:一项关于决策指导的机器学习研究

Johan Sebastián Galindez-Acosta, Juan José Giraldo-Huertas

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本研究通过机器学习探讨了人工智能在决策指导中的信任机制,发现对人类的不信任会促使人们转向AI,且AI在事实性情景中更受青睐。

Comments 36 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏