arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4587 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4587 篇

2411.09413 2025-04-30 cs.CV cs.AI 73%

Detecting Children with Autism Spectrum Disorder based on Script-Centric Behavior Understanding with Emotional Enhancement

Wenxing Liu, Yueran Pan, Dong Zhang, Hongzhu Deng, Xiaobing Zou, Ming Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Digital Innovation Research Center, Duke Kunshan University(杜克昆山大学数字创新研究中心) School of Electronics and Information Technology, Sun Yat-sen University(中山大学电子与信息学院) Child Development and Behavior Center, Third Affiliated Hospital of Sun Yat-sen University(中山大学第三附属医院儿童发展与行为中心)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

Comments 15 pages, 12 figures, sumbitted to IEEE transactions on affective computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22687 2025-04-01 eess.AS cs.AI 73%

Qieemo: Speech Is All You Need in the Emotion Recognition in Conversations

Jinming Chen, Jingyi Fang, Yuanzhong Zheng, Yaoxuan Wang, Haojun Fei

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22208 2025-03-31 cs.SD cs.CV eess.AS 73%

DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos

Yunming Liang, Zihao Chen, Chaofan Ding, Xinhan Di

专题命中 音频语音多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、eess.AS

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18880 2025-03-25 cs.CV cs.SD eess.AS 73%

Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes

Hyeonggon Ryu, Seongyu Kim, Joon Son Chung, Arda Senocak

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12840 2025-03-18 cs.SD cs.CV eess.AS 73%

Dynamic Derivation and Elimination: Audio Visual Segmentation with Enhanced Audio Semantics

Chen Liu, Liying Yang, Peike Li, Dadong Wang, Lincheng Li, Xin Yu

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05413 2025-01-10 cs.SD cs.CV cs.GR eess.AS 73%

Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation

Darius Petermann, Mahdi M. Kalayeh

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16944 2024-12-24 cs.CV cs.MM 73%

Linguistics-Vision Monotonic Consistent Network for Sign Language Production

Xu Wang, Shengeng Tang, Peipei Song, Shuo Wang, Dan Guo, Richang Hong

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

Comments Accepted by ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03270 2024-12-13 cs.GR cs.CV cs.LG cs.SD eess.AS 73%

A Comprehensive Multi-scale Approach for Speech and Dynamics Synchrony in Talking Head Generation

Louis Airale, Dominique Vaufreydaz, Xavier Alameda-Pineda

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.15464 2024-10-28 cs.SD cs.CV cs.LG eess.AS 73%

Large-scale unsupervised audio pre-training for video-to-speech synthesis

Triantafyllos Kefalas, Yannis Panagakis, Maja Pantic

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

Comments Corrected typos. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16654 2024-09-26 eess.AS cs.CL cs.SD 73%

Speech Recognition Rescoring with Large Speech-Text Foundation Models

Prashanth Gurunath Shivakumar, Jari Kolehmainen, Aditya Gourav, Yi Gu, Ankur Gandhe, Ariya Rastrow, Ivan Bulyko

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07867 2024-08-05 cs.CV cs.AI cs.HC 73%

Let's Go Real Talk: Spoken Dialogue Model for Face-to-Face Conversation

Se Jin Park, Chae Won Kim, Hyeongseop Rha, Minsu Kim, Joanna Hong, Jeong Hun Yeo, Yong Man Ro

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

Comments Accepted to ACL 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21491 2024-08-02 cs.CL cs.SD eess.AS 73%

Generative Expressive Conversational Speech Synthesis

Rui Liu, Yifan Hu, Yi Ren, Xiang Yin, Haizhou Li

专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CL、eess.AS

Comments 14 pages, 6 figures, 8 tables. Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09342 2024-07-23 cs.CV cs.SD eess.AS 73%

Face-voice Association in Multilingual Environments (FAME) Challenge 2024 Evaluation Plan

Muhammad Saad Saeed, Shah Nawaz, Muhammad Salman Tahir, Rohan Kumar Das, Muhammad Zaigham Zaheer, Marta Moscati, Markus Schedl, Muhammad Haris Khan, Karthik Nandakumar, Muhammad Haroon Yousaf

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

Comments ACM Multimedia Conference - Grand Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02005 2024-07-03 cs.CL cs.SD eess.AS 73%

An End-to-End Speech Summarization Using Large Language Model

Hengchao Shang, Zongyao Li, Jiaxin Guo, Shaojun Li, Zhiqiang Rao, Yuanchang Luo, Daimeng Wei, Hao Yang

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、eess.AS

Comments InterSpeech 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09207 2024-04-18 cs.CL cs.IR cs.LG cs.SD eess.AS 73%

WikiMuTe: A web-sourced dataset of semantic descriptions for music audio

Benno Weck, Holger Kirchhoff, Peter Grosche, Xavier Serra

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CL、eess.AS

Comments Submitted to 30th International Conference on MultiMedia Modeling (MMM2024). This preprint has not undergone peer review or any post-submission improvements or corrections

Journal ref The Version of Record of this contribution is published in MultiMedia Modeling. MMM 2024. Lecture Notes in Computer Science, vol 14565. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13289 2024-04-09 cs.SD cs.CL eess.AS 73%

SALMONN: Towards Generic Hearing Abilities for Large Language Models

Changli Tang, Wenyi Yu, Guangzhi Sun, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Chao Zhang

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04849 2024-03-18 cs.CL cs.AI cs.LG 73%

Speech Emotion Recognition with Distilled Prosodic and Linguistic Affect Representations

Debaditya Shome, Ali Etemad

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

Comments Accepted at ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.08730 2023-10-26 cs.CV cs.SD eess.AS 73%

Novel-View Acoustic Synthesis

Changan Chen, Alexander Richard, Roman Shapovalov, Vamsi Krishna Ithapu, Natalia Neverova, Kristen Grauman, Andrea Vedaldi

专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

Comments Accepted at CVPR 2023. Project page: https://vision.cs.utexas.edu/projects/nvas

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11713 2023-10-19 cs.CV cs.SD eess.AS 73%

Separating Invisible Sounds Toward Universal Audiovisual Scene-Aware Sound Separation

Yiyang Su, Ali Vosoughi, Shijian Deng, Yapeng Tian, Chenliang Xu

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

Comments Accepted at ICCV 2023 - AV4D, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02050 2023-10-04 cs.CL cs.CV 73%

Tuning Large language model for End-to-end Speech Translation

Hao Zhang, Nianwen Si, Yaqi Chen, Wenlin Zhang, Xukui Yang, Dan Qu, Xiaolin Jiao

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00455 2023-10-03 cs.MM cs.GR cs.LG cs.SD eess.AS 73%

Music- and Lyrics-driven Dance Synthesis

Wenjie Yin, Qingyuan Yao, Yi Yu, Hang Yin, Danica Kragic, Mårten Björkman

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.15930 2023-09-19 cs.CL cs.LG cs.SD eess.AS 73%

LLaSM: Large Language and Speech Model

Yu Shu, Siwei Dong, Guangyao Chen, Wenhao Huang, Ruihua Zhang, Daochen Shi, Qiqi Xiang, Yemin Shi

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04585 2023-08-08 cs.SD cs.AI eess.AS 73%

Exploring Efficient-Tuned Learning Audio Representation Method from BriVL

Sen Fang, Yangjian Wu, Bowen Gao, Jingwen Cai, Teik Toe Teoh

专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.AI、eess.AS

Comments 13 pages, 2023.3 Finished

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.12559 2023-06-23 cs.CV cs.SD eess.AS 73%

Exploring the Role of Audio in Video Captioning

Yuhan Shen, Linjie Yang, Longyin Wen, Haichao Yu, Ehsan Elhamifar, Heng Wang

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14042 2023-05-24 cs.CL cs.SD eess.AS 73%

Improving speech translation by fusing speech and text

Wenbiao Yin, Zhicheng Liu, Chengqi Zhao, Tao Wang, Jian Tong, Rong Ye

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04439 2023-03-09 cs.CV cs.SD eess.AS 73%

A Light Weight Model for Active Speaker Detection

Junhua Liao, Haihan Duan, Kanghui Feng, Wanbing Zhao, Yanbing Yang, Liangyin Chen

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

Comments Accepted by CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.10295 2023-01-26 cs.CV cs.SD eess.AS 73%

Object Segmentation with Audio Context

Kaihui Zheng, Yuqing Ren, Zixin Shen, Tianxu Qin

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

Comments Research project for Introduction to Deep Learning (11785) at Carnegie Mellon University

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.01235 2023-01-20 cs.CL cs.LG eess.AS 73%

An Analysis of Semantically-Aligned Speech-Text Embeddings

Muhammad Huzaifah, Ivan Kukanov

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CL、eess.AS

Comments This is the accepted version of the paper published at IEEE Spoken Language Technology (SLT) Workshop 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.12208 2022-08-26 cs.SD cs.CL cs.LG eess.AS 73%

Contrastive Audio-Language Learning for Music

Ilaria Manco, Emmanouil Benetos, Elio Quinton, György Fazekas

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、eess.AS

Comments Accepted to ISMIR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.14295 2022-06-03 cs.CV eess.AS 73%

Is Lip Region-of-Interest Sufficient for Lipreading?

Jing-Xuan Zhang, Gen-Shun Wan, Jia Pan

专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏