arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4597 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2412.19259 2024-12-30 eess.AS cs.SD 57%

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis

Jaemin Jung, Junseok Ahn, Chaeyoung Jung, Tan Dat Nguyen, Youngjoon Jang, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

Comments Accepted to ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12121 2024-12-30 cs.SD eess.AS 57%

WMCodec: End-to-End Neural Speech Codec with Deep Watermarking for Authenticity Verification

Junzuo Zhou, Jiangyan Yi, Yong Ren, Jianhua Tao, Tao Wang, Chu Yuan Zhang

机构 * Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) Department of Automation Tsinghua University(清华大学自动化系)

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10523 2024-12-17 cs.CV 57%

The Language of Motion: Unifying Verbal and Non-verbal Language of 3D Human Motion

Changan Chen, Juze Zhang, Shrinidhi K. Lakshmikanth, Yusu Fang, Ruizhi Shao, Gordon Wetzstein, Li Fei-Fei, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

Comments Project page: languageofmotion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15771 2024-12-17 eess.AS cs.LG cs.SD 57%

wav2pos: Sound Source Localization using Masked Autoencoders

Axel Berg, Jens Gulin, Mark O'Connor, Chuteng Zhou, Karl Åström, Magnus Oskarsson

机构 * Lund University(隆德大学) Arm(安谋科技) Sony(索尼) Tenstorrent

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

Comments IPIN 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00571 2024-12-11 cs.SD eess.AS 57%

From Audio Deepfake Detection to AI-Generated Music Detection -- A Pathway and Overview

Yupei Li, Manuel Milling, Lucia Specia, Björn W. Schuller

机构 * Imperial College London(帝国理工学院) Technical University of Munich(慕尼黑工业大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01829 2024-12-04 cs.LG cs.CV 57%

Explainable Artificial Intelligence for Medical Applications: A Review

Qiyang Sun, Alican Akman, Björn W. Schuller

机构 * Imperial College London(帝国理工学院) Technical University of Munich(慕尼黑工业大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00949 2024-12-03 cs.LG cs.AI cs.RO 57%

STEVE-Audio: Expanding the Goal Conditioning Modalities of Embodied Agents in Minecraft

Nicholas Lenzen, Amogh Raut, Andrew Melnik

机构 * Bielefeld University(比勒费尔德大学) Indian Institute of Technology BHU(印度理工学院( varanasi )) Bremen University(不来梅大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

Comments Accepted at CoRL 2024: Workshop on Lifelong Learning for Home Robots

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12025 2024-12-02 cs.CL 57%

Speech Translation with Speech Foundation Models and Large Language Models: What is There and What is Missing?

Marco Gaido, Sara Papi, Matteo Negri, Luisa Bentivogli

机构 * Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

Comments Outstanding paper at the ACL 2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11369 2024-11-27 cs.SD cs.LG eess.AS 57%

Learning Spatially-Aware Language and Audio Embeddings

Bhavika Devnani, Skyler Seto, Zakaria Aldeneh, Alessandro Toso, Elena Menyaylenko, Barry-John Theobald, Jonathan Sheaffer, Miguel Sarabia

机构 * Georgia Institute of Technology(佐治亚理工学院) Apple(苹果公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

Comments 26 pages, 7 figures, accepted at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17305 2024-11-27 cs.CV 57%

in-Car Biometrics (iCarB) Datasets for Driver Recognition: Face, Fingerprint, and Voice

Vedrana Krivokuca Hahn, Jeremy Maceiras, Alain Komaty, Philip Abbet, Sebastien Marcel

机构 * Idiap Research Institute(伊迪亚普研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

Comments 8 pages, 13 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13607 2024-11-27 cs.CV 57%

VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference

Seong Jong Yoo, Snehesh Shrestha, Irina Muresanu, Cornelia Fermüller

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by WACV 2025 in Round 1. First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15741 2024-11-26 cs.CV cs.IR cs.LG 57%

Proceedings of the 6th International Workshop on Reading Music Systems

Jorge Calvo-Zaragoza, Alexander Pacha, Elona Shatri

机构 * University of Alicante(阿利坎特大学) TU Wien(维也纳技术大学) Queen Mary University of London(伦敦大学玛丽皇后学院)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV

Comments Proceedings edited by Jorge Calvo-Zaragoza, Alexander Pacha and Elona Shatri

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18068 2024-11-26 cs.CV 57%

Speech2UnifiedExpressions: Synchronous Synthesis of Co-Speech Affective Face and Body Expressions from Affordable Inputs

Uttaran Bhattacharya, Aniket Bera, Dinesh Manocha

机构 * Adobe Inc.(奥多比公司) Purdue University(普渡大学) University of Maryland(马里兰大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

Comments 14 pages, 7 figures, 2 tables

Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 1st Workshop on Human Motion Generation, 2024, Seattle, Washington, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11454 2024-11-19 cs.CV 57%

Relevance-guided Audio Visual Fusion for Video Saliency Prediction

Li Yu, Xuanzhe Sun, Pan Gao, Moncef Gabbouj

机构 * School of Computer Science, Nanjing University of Information Science and Technology(南京信息工程大学计算机科学学院) Jiangsu Collaborative Innovation Center of Atmospheric Environment and Equipment Technology, Nanjing University of Information Science and Technology(南京信息工程大学江苏省大气环境与装备技术协同创新中心) College of Computer and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05550 2024-11-19 cs.HC cs.AI 57%

MEEG and AT-DGNN: Improving EEG Emotion Recognition with Music Introducing and Graph-based Learning

Minghao Xiao, Zhengxi Zhu, Kang Xie, Bin Jiang

机构 * Shenzhen Research Institute of Shandong University(山东大学深圳研究院) Key Lab of Information Network Security Ministry of Public Security(公安部信息网络安全重点实验室)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16824 2024-11-15 cs.CV 57%

V2A-Mark: Versatile Deep Visual-Audio Watermarking for Manipulation Localization and Copyright Protection

Xuanyu Zhang, Youmin Xu, Runyi Li, Jiwen Yu, Weiqi Li, Zhipei Xu, Jian Zhang

机构 * Peking University Shenzhen Graduate School(北京大学深圳研究生院)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07834 2024-11-13 cs.CV 57%

Towards Vision Mixture of Experts for Wildlife Monitoring on the Edge

Emmanuel Azuh Mensah, Anderson Lee, Haoran Zhang, Yitong Shan, Kurtis Heimerl

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16727 2024-10-31 cs.CL 57%

Recent Advances in Hate Speech Moderation: Multimodality and the Role of Large Models

Ming Shan Hee, Shivam Sharma, Rui Cao, Palash Nandi, Preslav Nakov, Tanmoy Chakraborty, Roy Ka-Wei Lee

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

Comments Accepted at EMNLP'24 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21091 2024-10-29 cs.HC cs.AI 57%

Large Language Model-assisted Speech and Pointing Benefits Multiple 3D Object Selection in Virtual Reality

Junlong Chen, Jens Grubert, Per Ola Kristensson

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19954 2024-10-29 cs.CV 57%

Turn-by-Turn Indoor Navigation for the Visually Impaired

Santosh Srinivasaiah, Sai Kumar Nekkanti, Rohith Reddy Nedhunuri

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05567 2024-10-28 cs.CV cs.HC cs.LG 57%

Exploring Emotion Expression Recognition in Older Adults Interacting with a Virtual Coach

Cristina Palmero, Mikel deVelasco, Mohamed Amine Hmani, Aymen Mtibaa, Leila Ben Letaifa, Pau Buch-Cardona, Raquel Justo, Terry Amorese, Eduardo González-Fraile, Begoña Fernández-Ruanova, Jofre Tenorio-Laranga, Anna Torp Johansen, Micaela Rodrigues da Silva, Liva Jenny Martinussen, Maria Stylianou Korsnes, Gennaro Cordasco, Anna Esposito, Mounim A. El-Yacoubi, Dijana Petrovska-Delacrétaz, M. Inés Torres, Sergio Escalera

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.11368 2024-10-28 cs.RO cs.AI 57%

Dynamic Hand Gesture-Featured Human Motor Adaptation in Tool Delivery using Voice Recognition

Haolin Fei, Stefano Tedeschi, Yanpei Huang, Andrew Kennedy, Ziwei Wang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15650 2024-10-22 cs.AI 57%

Voice-Enabled AI Agents can Perform Common Scams

Richard Fang, Dylan Bowman, Daniel Kang

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15062 2024-10-22 cs.SD eess.AS 57%

PAT: Parameter-Free Audio-Text Aligner to Boost Zero-Shot Audio Classification

Ashish Seth, Ramaneswaran Selvakumar, Sonal Kumar, Sreyan Ghosh, Dinesh Manocha

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14509 2024-10-21 cs.CV 57%

CLIP-VAD: Exploiting Vision-Language Models for Voice Activity Detection

Andrea Appiani, Cigdem Beyan

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03146 2024-10-15 cs.CV 57%

Bridging the Gap between Text, Audio, Image, and Any Sequence: A Novel Approach using Gloss-based Annotation

Sen Fang, Sizhou Chen, Yalin Feng, Xiaofeng Zhang, Teik Toe Teoh

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08039 2024-10-15 cs.SD eess.AS 57%

Zero-Shot Sing Voice Conversion: built upon clustering-based phoneme representations

Wangjin Zhou, Fengrun Zhang, Yiming Liu, Wenhao Guan, Yi Zhao, Tatsuya Kawahara

专题命中 音频语音多模态 :any-to-any(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12182 2024-10-15 eess.AS 57%

Latent CLAP Loss for Better Foley Sound Synthesis

Tornike Karchkhadze, Hassan Salami Kavaki, Mohammad Rasool Izadi, Bryce Irvin, Mikolaj Kegler, Ari Hertz, Shuo Zhang, Marko Stamenovic

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

Journal ref EUSIPCO 2024 Proceedings, ISBN: 978-9-4645-9361-7

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05986 2024-10-10 eess.AS cs.SD 57%

The USTC-NERCSLIP Systems for the CHiME-8 MMCSG Challenge

Ya Jiang, Hongbo Lan, Jun Du, Qing Wang, Shutong Niu

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11023 2024-10-10 cs.HC cs.CL cs.LG 57%

Advancing Social Intelligence in AI Agents: Technical Challenges and Open Questions

Leena Mathur, Paul Pu Liang, Louis-Philippe Morency

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

Comments EMNLP 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏