arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2504.16573 2025-04-24 cs.HC cs.AI 57%

PsyCounAssist: A Full-Cycle AI-Powered Psychological Counseling Assistant System

Xianghe Liu, Jiaqi Xu, Tao Sun

机构 * Beijing PsychTech Technology Co., Ltd.(北京心理科技技术有限公司) University of Hechi(贺州学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04067 2025-04-24 cs.CV 57%

FREAK: Frequency-modulated High-fidelity and Real-time Audio-driven Talking Portrait Synthesis

Ziqi Ni, Ao Fu, Yi Zhou

机构 * School of Computer Science and Engineering, Southeast University(计算机科学与工程学院,东南大学) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, China(新一代人工智能技术及其交叉应用重点实验室,教育部,中国)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

Comments Accepted by ICMR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09269 2025-04-22 cs.SD cs.LG eess.AS 57%

Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs

Anshuman Sinha, Camille Migozzi, Aubin Rey, Chao Zhang

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

Comments 29 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13205 2025-04-21 cs.CR cs.AI 57%

On-Device Watermarking: A Socio-Technical Imperative For Authenticity In The Age of Generative AI

Houssam Kherraz

机构 * Kensho Technologies

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI

Comments 10 pages, 3 figures, ICLR 2025, https://openreview.net/forum?id=ygE0U21vxM

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06778 2025-04-18 cs.SD eess.AS 57%

CAFA: a Controllable Automatic Foley Artist

Roi Benita, Michael Finkelson, Tavi Halperin, Gleb Sterkin, Yossi Adi

机构 * Technion(以色列理工学院) Hebrew University of Jerusalem(耶路撒冷希伯来大学) Lightricks(丽塔克斯科技公司)

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

Comments Renamed paper to "CAFA: a Controllable Automatic Foley Artist" from "Controllable Automatic Foley Artist". Updated link to demo page

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19898 2025-04-16 cs.LG cs.AI 57%

A Review of Deep Learning Approaches for Non-Invasive Cognitive Impairment Detection

Muath Alsuhaibani, Ali Pourramezan Fard, Jian Sun, Farida Far Poor, Peter S. Pressman, Mohammad H. Mahoor

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08687 2025-04-14 cs.HC cs.AI cs.CY 57%

Voice Interaction With Conversational AI Could Facilitate Thoughtful Reflection and Substantive Revision in Writing

Jiho Kim, Philippe Laban, Xiang 'Anthony' Chen, Kenneth C. Arnold

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

Comments 5 pages; Accepted to Fourth Workshop on Intelligent and Interactive Writing Assistants (In2Writing 2025) at NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17911 2025-04-08 cs.CV cs.CR 57%

Passive Deepfake Detection Across Multi-modalities: A Comprehensive Survey

Hong-Hanh Nguyen-Le, Van-Tuan Tran, Dinh-Thuc Nguyen, Nhien-An Le-Khac

机构 * University College Dublin(都柏林大学学院) Trinity College Dublin(都柏林圣三一学院) University of Science(科学大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02920 2025-04-07 cs.CV cs.LG 57%

LiDAR-based Object Detection with Real-time Voice Specifications

Anurag Kulkarni

机构 * Shivaji University(希瓦吉大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV

Comments 10 pages, 4 figures, submitted as part of MSc research

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11123 2025-04-04 cs.CL 57%

DuplexMamba: Enhancing Real-time Speech Conversations with Duplex and Streaming Capabilities

Xiangyu Lu, Wang Xu, Haoyu Wang, Hongyun Zhou, Haiyan Zhao, Conghui Zhu, Tiejun Zhao, Muyun Yang

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算学部) Tsinghua University(清华大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01032 2025-04-03 cs.CY cs.AI 57%

Who Owns the Output? Bridging Law and Technology in LLMs Attribution

Emanuele Mezzi, Asimina Mertzani, Michael P. Manis, Siyanna Lilova, Nicholas Vadivoulis, Stamatis Gatirdakis, Styliani Roussou, Rodayna Hmede

机构 * Ethikon Institute(Ethikon研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

Comments 20 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23873 2025-04-01 eess.AS cs.SD 57%

Exploring In-Context Learning Capabilities of ChatGPT for Pathological Speech Detection

Mahdi Amiri, Hatef Otroshi Shahreza, Ina Kodrasi

机构 * Idiap Research Institute(Idiap研究所) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

Comments submitted to EUSIPCO 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21480 2025-03-31 cs.CL 57%

OmniVox: Zero-Shot Emotion Recognition with Omni-LLMs

John Murzaku, Owen Rambow

机构 * Stony Brook University(石溪大学) Institute for Advanced Computational Science(高级计算科学研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

Comments Submitted to COLM 2025. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17479 2025-03-25 cs.HC cs.AI 57%

Your voice is your voice: Supporting Self-expression through Speech Generation and LLMs in Augmented and Alternative Communication

Yiwen Xu, Monideep Chakraborti, Tianyi Zhang, Katelyn Eng, Aanchan Mohan, Mirjana Prpa

机构 * Northeastern University(东北大学) Khoury College of Computer Sciences(科里计算机学院) Mercury Speech & Language(水星言语与语言机构)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15494 2025-03-21 cs.HC cs.AI cs.CY 57%

AI-Powered Assistive Technologies for Visual Impairment

Prudhvi Naayini, Praveen Kumar Myakala, Chiranjeevi Bura, Anil Kumar Jonnalagadda, Srikanth Kamatala

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) Google LLC(谷歌公司) Klein Tools(克莱因工具公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11684 2025-03-18 cs.AI cs.CY cs.HC cs.LG cs.RO 57%

Exploring Causality for HRI: A Case Study on Robotic Mental Well-being Coaching

Micol Spitale, Srikar Babu, Serhan Cakmak, Jiaee Cheong, Hatice Gunes

机构 * University of Cambridge(剑桥大学) Politecnico di Milano(米兰理工大学) Indian Institute of Technology Madras(马德拉斯印度理工学院) Bogazici University(博阿齐奇大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10719 2025-03-18 cs.CV 57%

Long-Video Audio Synthesis with Multi-Agent Collaboration

Yehang Zhang, Xinli Xu, Xiaojie Xu, Li Liu, Yingcong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09852 2025-03-14 cs.MM 57%

StyleSpeaker: Audio-Enhanced Fine-Grained Style Modeling for Speech-Driven 3D Facial Animation

An Yang, Chenyu Liu, Pengcheng Xia, Jun Du

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09262 2025-03-14 cs.CV 57%

LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision

Chunyu Li, Chao Zhang, Weikai Xu, Jingyu Lin, Jinghui Xie, Weiguo Feng, Bingyue Peng, Cunjian Chen, Weiwei Xing

机构 * ByteDance(字节跳动) Beijing Jiaotong University(北京交通大学) Monash University(莫纳什大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05978 2025-03-11 cs.CV 57%

MagicInfinite: Generating Infinite Talking Videos with Your Words and Voice

Hongwei Yi, Tian Ye, Shitong Shao, Xuancheng Yang, Jiantong Zhao, Hanzhong Guo, Terrance Wang, Qingyu Yin, Zeke Xie, Lei Zhu, Wei Li, Michael Lingelbach, Daquan Zhou

机构 * Hedra Inc.(Hedra公司) Peking University(北京大学) HKUST(GZ)(香港科技大学(广州)) HKU(香港大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV

Comments MagicInfinite is publicly accessible at https://www.hedra.com/. More examples are at https://magicinfinite.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04724 2025-03-07 cs.CL 57%

LLMVoX: Autoregressive Streaming Text-to-Speech Model for Any LLM

Sambal Shikhar, Mohammed Irfan Kurpath, Sahal Shaji Mullappilly, Jean Lahoud, Fahad Khan, Rao Muhammad Anwer, Salman Khan, Hisham Cholakkal

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学(MBZUAI)) Linköping University(林雪平大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01892 2025-03-05 cs.LG cs.CV cs.CY 57%

Recognition of Dysarthria in Amyotrophic Lateral Sclerosis patients using Hypernetworks

Loukas Ilias, Dimitris Askounis

机构 * School of ECE, NTUA(希腊国立雅典理工大学电气与计算机工程学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01553 2025-03-04 cs.CL 57%

Co-creation for Sign Language Processing and Machine Translation

Lisa Lepp, Dimitar Shterionov, Mirella De Sisto, Grzegorz Chrupała

机构 * 1 Lisa Lepp: 2 Dimitar Shterionov: 3 Mirella De Sisto: 4 Grzegorz Chrupa a

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

Comments Submitted to the MDPI special issue "Human and Machine Translation: Recent Trends and Foundations"

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15803 2025-02-27 cs.LG cs.CL 57%

Megrez-Omni Technical Report

Boxun Li, Yadong Li, Zhiyuan Li, Congyi Liu, Weilin Liu, Guowei Niu, Zheyue Tan, Haiyang Xu, Zhuyu Yao, Tao Yuan, Dong Zhou, Yueqing Zhuang, Shengen Yan, Guohao Dai, Yu Wang

机构 * Infinigence-AI(智源人工智能研究院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16718 2025-02-25 cs.RO cs.AI 57%

NatSGLD: A Dataset with Speech, Gesture, Logic, and Demonstration for Robot Learning in Natural Human-Robot Interaction

Snehesh Shrestha, Yantian Zha, Saketh Banagiri, Ge Gao, Yiannis Aloimonos, Cornelia Fermüller

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

Comments arXiv admin note: substantial text overlap with arXiv:2403.02274

Journal ref 2025 20th ACM/IEEE International Conference on Human-Robot Interaction (HRI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07982 2025-02-19 cs.HC cs.AI cs.RO 57%

Toward a Dialogue System Using a Large Language Model to Recognize User Emotions with a Camera

Hiroki Tanioka, Tetsushi Ueta, Masahiko Sano

机构 * Tokushima University(德岛大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

Comments 4 pages, 5 figures, 1 table, The 1st InterAI: Interactive AI for Human-Centered Robotics workshop in conjunction with IEEE Ro-MAN 2024, Pasadona, LA, USA, Aug. 2024

Journal ref The 1st InterAI Workshop: Interactive AI for Human-centered Robotics, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00249 2025-02-19 eess.AS 57%

Acoustic Prompt Tuning: Empowering Large Language Models with Audition Capabilities

Jinhua Liang, Xubo Liu, Wenwu Wang, Mark D. Plumbley, Huy Phan, Emmanouil Benetos

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

Comments Published at IEEE Transactions on Audio, Speech and Language Processing

Journal ref IEEE Transactions on Audio, Speech and Language Processing (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11219 2025-02-18 eess.AS cs.SD 57%

AudioSpa: Spatializing Sound Events with Text

Linfeng Feng, Lei Zhao, Boyu Zhu, Xiao-Lei Zhang, Xuelong Li

机构 * School of Marine Science and Technology, Northwestern Polytechnical University(西北工业大学海洋科学与技术学院) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI)) Research and Development Institute of Northwestern Polytechnical University in Shenzhen(西北工业大学深圳研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01084 2025-02-14 cs.LG cs.SD eess.AS 57%

Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis

Weiwei Lin, Chenghan He

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

Comments ICLR 2025

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16368 2025-02-06 cs.LG cs.AI cs.SY eess.SY 57%

Foundation Models for CPS-IoT: Opportunities and Challenges

Ozan Baris, Yizhuo Chen, Gaofeng Dong, Liying Han, Tomoyoshi Kimura, Pengrui Quan, Ruijie Wang, Tianchen Wang, Tarek Abdelzaher, Mario Bergés, Paul Pu Liang, Mani Srivastava

机构 * CMU(卡内基梅隆大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) UCLA(加利福尼亚大学洛杉矶分校) MIT(麻省理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏