arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4597 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2410.04221 2024-10-08 cs.CV 57%

TANGO: Co-Speech Gesture Video Reenactment with Hierarchical Audio Motion Embedding and Diffusion Interpolation

Haiyang Liu, Xingchao Yang, Tomoya Akiyama, Yuantian Huang, Qiaoge Li, Shigeru Kuriyama, Takafumi Taketomi

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09009 2024-10-02 cs.CL 57%

Optimizing Rare Word Accuracy in Direct Speech Translation with a Retrieval-and-Demonstration Approach

Siqi Li, Danni Liu, Jan Niehues

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18372 2024-10-01 cs.CV 57%

You Only Speak Once to See

Wenhao Yang, Jianguo Wei, Wenhuan Lu, Lei Li

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15335 2024-09-25 cs.SD eess.AS 57%

Efficient learning-based sound propagation for virtual and real-world audio processing applications

Anton Jeran Ratnarajah

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14464 2024-09-24 cs.CL cs.SI 57%

AggregHate: An Efficient Aggregative Approach for the Detection of Hatemongers on Social Platforms

Tom Marzea, Abraham Israeli, Oren Tsur

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09214 2024-09-20 cs.SD eess.AS 57%

Seed-Music: A Unified Framework for High Quality and Controlled Music Generation

Ye Bai, Haonan Chen, Jitong Chen, Zhuo Chen, Yi Deng, Xiaohong Dong, Lamtharn Hantrakul, Weituo Hao, Qingqing Huang, Zhongyi Huang, Dongya Jia, Feihu La, Duc Le, Bochen Li, Chumin Li, Hui Li, Xingxing Li, Shouda Liu, Wei-Tsung Lu, Yiqing Lu, Andrew Shaw, Janne Spijkervet, Yakun Sun, Bo Wang, Ju-Chiang Wang, Yuping Wang, Yuxuan Wang, Ling Xu, Yifeng Yang, Chao Yao, Shuo Zhang, Yang Zhang, Yilin Zhang, Hang Zhao, Ziyi Zhao, Dejian Zhong, Shicen Zhou, Pei Zou

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

Comments Seed-Music technical report, 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10058 2024-09-17 eess.AS cs.SD 57%

StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style Diffusion

Yinghao Aaron Li, Xilin Jiang, Cong Han, Nima Mesgarani

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08148 2024-09-13 eess.AS cs.SD 57%

Faster Speech-LLaMA Inference with Multi-token Prediction

Desh Raj, Gil Keren, Junteng Jia, Jay Mahadeokar, Ozlem Kalinli

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

Comments Submitted to IEEE ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06991 2024-09-12 cs.CV 57%

1M-Deepfakes Detection Challenge

Zhixi Cai, Abhinav Dhall, Shreya Ghosh, Munawar Hayat, Dimitrios Kollias, Kalin Stefanov, Usman Tariq

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

Comments ACM MM 2024. Challenge webpage: https://deepfakes1m.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05436 2024-09-12 cs.CV 57%

A Methodological and Structural Review of Hand Gesture Recognition Across Diverse Data Modalities

Jungpil Shin, Abu Saleh Musa Miah, Md. Humaun Kabir, Md. Abdur Rahim, Abdullah Al Shiam

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

Journal ref IEEE Access-09 September 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07606 2024-09-11 cs.CL cs.IR 57%

Zero-shot Audio Topic Reranking using Large Language Models

Mengjie Qian, Rao Ma, Adian Liusie, Erfan Loweimi, Kate M. Knill, Mark J. F. Gales

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06137 2024-09-11 eess.AS cs.SD eess.SP 57%

DeWinder: Single-Channel Wind Noise Reduction using Ultrasound Sensing

Kuang Yuan, Shuo Han, Swarun Kumar, Bhiksha Raj

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19605 2024-09-11 cs.CV 57%

Look Hear: Gaze Prediction for Speech-directed Human Attention

Sounak Mondal, Seoyoung Ahn, Zhibo Yang, Niranjan Balasubramanian, Dimitris Samaras, Gregory Zelinsky, Minh Hoai

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted for ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05243 2024-09-10 cs.CV 57%

Mamba-Enhanced Text-Audio-Video Alignment Network for Emotion Recognition in Conversations

Xinran Li, Xiaomao Fan, Qingyang Wu, Xiaojiang Peng, Ye Li

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.06198 2024-09-10 cs.CV 57%

Data standardization for robust lip sync

Chun Wang

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02290 2024-09-05 cs.RO cs.CV eess.IV 57%

Unsupervised Welding Defect Detection Using Audio And Video

Georg Stemmer, Jose A. Lopez, Juan A. Del Hoyo Ontiveros, Arvind Raju, Tara Thimmanaik, Sovan Biswas

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01591 2024-09-04 cs.CV cs.GR 57%

Dynamic Motion Synthesis: Masked Audio-Text Conditioned Spatio-Temporal Transformers

Sohan Anisetty, James Hays

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00089 2024-09-04 cs.CR cs.AI 57%

Watermarking Techniques for Large Language Models: A Survey

Yuqing Liang, Jiancheng Xiao, Wensheng Gan, Philip S. Yu

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

Comments Preprint. 19 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16448 2024-08-30 cs.CV 57%

Enhancing Sound Source Localization via False Negative Elimination

Zengjie Song, Jiangshe Zhang, Yuxi Wang, Junsong Fan, Zhaoxiang Zhang

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2203.13412

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19976 2024-08-29 cs.HC cs.MM 57%

MambaGesture: Enhancing Co-Speech Gesture Generation with Mamba and Disentangled Multi-Modality Fusion

Chencan Fu, Yabiao Wang, Jiangning Zhang, Zhengkai Jiang, Xiaofeng Mao, Jiafu Wu, Weijian Cao, Chengjie Wang, Yanhao Ge, Yong Liu

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.MM

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14198 2024-08-27 eess.AS cs.SD 57%

Combined assessment of auditory distance perception and externalization

Henning Hoppe, Steven van de Par, Virginia Flanagin, Stephan D. Ewert

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

Comments This work has been submitted to The Journal of the Acoustical Society of America of the for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12354 2024-08-23 eess.AS cs.SD 57%

LCM-SVC: Latent Diffusion Model Based Singing Voice Conversion with Inference Acceleration via Latent Consistency Distillation

Shihao Chen, Yu Gu, Jianwei Cui, Jie Zhang, Rilin Chen, Lirong Dai

专题命中 音频语音多模态 :any-to-any(abstract);分类 eess.AS

Comments Accepted to ISCSLP 2024. arXiv admin note: text overlap with arXiv:2406.05325

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13356 2024-08-22 eess.AS cs.SD eess.IV 57%

KunquDB: An Attempt for Speaker Verification in the Chinese Opera Scenario

Huali Zhou, Yuke Lin, Dong Liu, Ming Li

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

Comments Accepted by ICPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11019 2024-08-21 q-bio.NC cs.AI cs.LG 57%

An Overlooked Role of Context-Sensitive Dendrites

Mohsin Raza, Ahsan Adeel

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16317 2024-08-20 cs.SD eess.AS 57%

SNR-Progressive Model with Harmonic Compensation for Low-SNR Speech Enhancement

Zhongshu Hou, Tong Lei, Qinwen Hu, Zhanzhong Cao, Ming Tang, Jing Lu

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08669 2024-08-19 cs.SD eess.AS 57%

HSDreport: Heart Sound Diagnosis with Echocardiography Reports

Zihan Zhao, Pingjie Wang, Liudan Zhao, Yuchen Yang, Ya Zhang, Kun Sun, Xin Sun, Xin Zhou, Yu Wang, Yanfeng Wang

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04362 2024-08-09 cs.SD eess.AS 57%

NeuralMultiling: A Novel Neural Architecture Search for Smartphone based Multilingual Speaker Verification

Aravinda Reddy PN, Raghavendra Ramachandra, K. Sreenivasa Rao, Pabitra Mitra

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11764 2024-08-08 cs.MM 57%

Identity-Driven Multimedia Forgery Detection via Reference Assistance

Junhao Xu, Jingjing Chen, Xue Song, Feng Han, Haijun Shan, Yugang Jiang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01433 2024-08-06 cs.CV cs.ET 57%

Evaluating and Enhancing Trustworthiness of LLMs in Perception Tasks

Malsha Ashani Mahawatta Dona, Beatriz Cabrero-Daniel, Yinan Yu, Christian Berger

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted in 27th IEEE International Conference on Intelligent Transportation Systems (ITSC) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12501 2024-08-06 cs.CV cs.GR 57%

EmoFace: Audio-driven Emotional 3D Face Animation

Chang Liu, Qunfen Lin, Zijiao Zeng, Ye Pan

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

Comments 2024 IEEE Conference Virtual Reality and 3D User Interfaces (VR). IEEE, 2024

Journal ref 2024 IEEE Conference Virtual Reality and 3D User Interfaces (VR). IEEE, 2024: 387-397

详情

展开后加载摘要…

URL PDF HTML 收藏