arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-07-31 至 2025-07-31 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2507.22781 2025-07-31 cs.CV 85%

HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training

Xuecheng Wu, Danlei Huang, Heli Sun, Xinyi Yin, Yifan Wang, Hao Wang, Jia Zhang, Fei Wang, Peihao Guo, Suyu Xing, Junxiao Xue, Liang He

机构 * Xi'an Jiaotong University(西安交通大学) Zhengzhou University(郑州大学) University of Science and Technology of China(中国科学技术大学) Dalian University of Technology(大连理工大学) Zhejiang Lab(浙江实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04906 2025-07-31 cs.MM cs.CV cs.SD eess.AS 78%

Art2Mus: Bridging Visual Arts and Music through Cross-Modal Generation

Ivan Rinaldi, Nicola Fanelli, Giovanna Castellano, Gennaro Vessio

机构 * Department of Computer Science, University of Bari Aldo Moro, Italy(巴里阿尔多·莫罗大学计算机科学系)

专题命中 音频语音多模态 :cross-modal(title);分类 cs.CV、cs.MM、eess.AS

Comments Presented at the AI for Visual Arts (AI4VA) workshop at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11026 2025-07-31 eess.AS cs.CV cs.LG cs.MM 75%

MAVFlow: Preserving Paralinguistic Elements with Conditional Flow Matching for Zero-Shot AV2AV Multilingual Translation

Sungwoo Cho, Jeongsoo Choi, Sungnyun Kim, Se-Young Yun

机构 * KAIST AI(韩国科学技术院人工智能研究所) KAIST EE(韩国科学技术院电子工程系)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20999 2025-07-31 cs.SD cs.GR eess.AS 57%

Text-Driven Voice Conversion via Latent State-Space Modeling

Wen Li, Sofia Martinez, Priyanka Shah

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

Comments arXiv admin note: This paper has been withdrawn by arXiv due to disputed and unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11308 2025-07-31 eess.AS eess.SP 57%

Uncovering the role of semantic and acoustic cues in normal and dichotic listening

Sai Samrat Kankanala, Akshara Soman, Sriram Ganapathy

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

Comments 10 Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏