arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-23 至 2025-12-23 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2512.18575 2025-12-23 cs.LG cs.AI cs.NE 83%

Modality-Dependent Memory Mechanisms in Cross-Modal Neuromorphic Computing

跨模态类脑计算中的模态依赖性记忆机制

Effiong Blessing, Chiung-Yi Tseng, Somshubhra Roy, Junaid Rehman, Isaac Nkrumah

机构 * 1 Department of Computer Science, Saint Louis University, St. Louis, MO, USA 2 Luxmuse AI, USA 3 Department of Electrical Computer Engineering, North Carolina State University, Raleigh, NC, USA 4 Independent Researcher 5 Department of Computer Science, Saint Louis University, St. Louis, MO, USA Email

专题命中 音频语音多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 本文首次探讨了跨模态类脑计算中记忆机制的模态依赖性,通过实验揭示了不同架构在视觉与听觉任务中的性能差异,并验证了并行架构在能效提升方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19687 2025-12-23 cs.SD cs.CV cs.LG 79%

Pushing the Frontier of Audiovisual Perception with Large-Scale Multimodal Correspondence Learning

推动音频视觉感知前沿:大规模多模态对应学习

Apoorv Vyas, Heng-Jui Chang, Cheng-Fu Yang, Po-Yao Huang, Luya Gao, Julius Richter, Sanyuan Chen, Matt Le, Piotr Dollár, Christoph Feichtenhofer, Ann Lee, Wei-Ning Hsu

机构 * Meta Superintelligence Labs(Meta超级智能实验室)

专题命中 音频语音多模态 :multimodal(title);cross-modal(abstract);分类 cs.CV

AI总结 PE-AV通过大规模多模态对应学习提升音频视频理解,支持跨模态嵌入并实现语音检索等新任务,同时开发PE-A-Frame实现细粒度音频-文本对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12489 2025-12-23 eess.AS cs.AI cs.MM 67%

A Comprehensive Survey on Generative AI for Video-to-Music Generation

生成式AI在视频到音乐生成中的全面综述

Shulei Ji, Songruoyao Wu, Zihao Wang, Shuyu Li, Kejun Zhang

机构 * Zhejiang University(浙江大学) Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文综述了生成式AI在视频到音乐生成中的关键技术和方法,分析了输入构造、条件机制和音乐生成框架,并总结了现有数据集和评估指标及面临的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18772 2025-12-23 cs.CV 57%

In-Context Audio Control of Video Diffusion Transformers

上下文音频控制视频扩散变换器

Wenze Liu, Weicai Ye, Minghong Cai, Quande Liu, Xintao Wang, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Kling Team, Kuaishou Technology(快手科技Kling团队)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 本文提出ICAC框架,通过三维注意力机制实现音频驱动的视频生成,解决时间同步信号在视频扩散模型中的整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏