arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2403.13356 2024-08-22 eess.AS cs.SD eess.IV 57%

KunquDB: An Attempt for Speaker Verification in the Chinese Opera Scenario

Huali Zhou, Yuke Lin, Dong Liu, Ming Li

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

Comments Accepted by ICPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11019 2024-08-21 q-bio.NC cs.AI cs.LG 57%

An Overlooked Role of Context-Sensitive Dendrites

Mohsin Raza, Ahsan Adeel

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16317 2024-08-20 cs.SD eess.AS 57%

SNR-Progressive Model with Harmonic Compensation for Low-SNR Speech Enhancement

Zhongshu Hou, Tong Lei, Qinwen Hu, Zhanzhong Cao, Ming Tang, Jing Lu

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08669 2024-08-19 cs.SD eess.AS 57%

HSDreport: Heart Sound Diagnosis with Echocardiography Reports

Zihan Zhao, Pingjie Wang, Liudan Zhao, Yuchen Yang, Ya Zhang, Kun Sun, Xin Sun, Xin Zhou, Yu Wang, Yanfeng Wang

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04362 2024-08-09 cs.SD eess.AS 57%

NeuralMultiling: A Novel Neural Architecture Search for Smartphone based Multilingual Speaker Verification

Aravinda Reddy PN, Raghavendra Ramachandra, K. Sreenivasa Rao, Pabitra Mitra

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11764 2024-08-08 cs.MM 57%

Identity-Driven Multimedia Forgery Detection via Reference Assistance

Junhao Xu, Jingjing Chen, Xue Song, Feng Han, Haijun Shan, Yugang Jiang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01433 2024-08-06 cs.CV cs.ET 57%

Evaluating and Enhancing Trustworthiness of LLMs in Perception Tasks

Malsha Ashani Mahawatta Dona, Beatriz Cabrero-Daniel, Yinan Yu, Christian Berger

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted in 27th IEEE International Conference on Intelligent Transportation Systems (ITSC) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12501 2024-08-06 cs.CV cs.GR 57%

EmoFace: Audio-driven Emotional 3D Face Animation

Chang Liu, Qunfen Lin, Zijiao Zeng, Ye Pan

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

Comments 2024 IEEE Conference Virtual Reality and 3D User Interfaces (VR). IEEE, 2024

Journal ref 2024 IEEE Conference Virtual Reality and 3D User Interfaces (VR). IEEE, 2024: 387-397

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20556 2024-07-31 cs.RO cs.CL cs.CY 57%

Survey of Design Paradigms for Social Robots

Rita Frieske, Xiaoyu Mo, Yini Fang, Jay Nieles, Bertram E. Shi

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19590 2024-07-30 cs.MM 57%

The Future is Meta: Metadata, Formats and Perspectives towards Interactive and Personalized AV Content

Alexander Weller, Werner Bleisteiner, Christian Hufnagel, Michael Iber

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM

Comments 12 pages, 4 figures, submitted to the Tonmeistertagung 32

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00475 2024-07-30 cs.SD eess.AS 57%

E-chat: Emotion-sensitive Spoken Dialogue System with Large Language Models

Hongfei Xue, Yuhao Liang, Bingshen Mu, Shiliang Zhang, Mengzhe Chen, Qian Chen, Lei Xie

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17902 2024-07-26 eess.AS 57%

Multi-Stage Face-Voice Association Learning with Keynote Speaker Diarization

Ruijie Tao, Zhan Shi, Yidi Jiang, Duc-Tuan Truong, Eng-Siong Chng, Massimo Alioto, Haizhou Li

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16638 2024-07-24 cs.CV 57%

Unveiling and Mitigating Bias in Audio Visual Segmentation

Peiwen Sun, Honggang Zhang, Di Hu

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

Comments Accepted by ACM MM 24 (ORAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14875 2024-07-23 cs.CL 57%

Seal: Advancing Speech Language Models to be Few-Shot Learners

Shuyu Lei, Lingen Liu, Jiaolong Yang, Yasen Jiao, Yuxiang Yang, Yushu Yang, Xiang Guo

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13198 2024-07-19 cs.SD eess.AS 57%

DiveSound: LLM-Assisted Automatic Taxonomy Construction for Diverse Audio Generation

Baihan Li, Zeyu Xie, Xuenan Xu, Yiwei Guo, Ming Yan, Ji Zhang, Kai Yu, Mengyue Wu

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02584 2024-07-18 cs.SD eess.AS 57%

Towards Weakly Supervised Text-to-Audio Grounding

Xuenan Xu, Ziyang Ma, Mengyue Wu, Kai Yu

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10947 2024-07-16 cs.CV 57%

Can Textual Semantics Mitigate Sounding Object Segmentation Preference?

Yaoting Wang, Peiwen Sun, Yuanchao Li, Honggang Zhang, Di Hu

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

Comments Accepted by ECCV2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08403 2024-07-12 eess.IV cs.CV 57%

Ethics of Generating Synthetic MRI Vocal Tract Views from the Face

Muhammad Suhaib Shahid, Gleb E. Yakubov, Andrew P. French

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13843 2024-06-24 cs.AI 57%

Generative AI Misuse: A Taxonomy of Tactics and Insights from Real-World Data

Nahema Marchal, Rachel Xu, Rasmi Elasmar, Iason Gabriel, Beth Goldberg, William Isaac

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07254 2024-06-12 cs.SD eess.AS 57%

SRC4VC: Smartphone-Recorded Corpus for Voice Conversion Benchmark

Yuki Saito, Takuto Igarashi, Kentaro Seki, Shinnosuke Takamichi, Ryuichi Yamamoto, Kentaro Tachibana, Hiroshi Saruwatari

专题命中 音频语音多模态 :any-to-any(abstract);分类 eess.AS

Comments Accepted for INTERSPEECH 2024, corpus project page: https://y-saito.sakura.ne.jp/sython/Corpus/SRC4VC/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06295 2024-06-11 cs.SD eess.AS 57%

Zero-Shot Audio Captioning Using Soft and Hard Prompts

Yiming Zhang, Xuenan Xu, Ruoyi Du, Haohe Liu, Yuan Dong, Zheng-Hua Tan, Wenwu Wang, Zhanyu Ma

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

Comments Submitted to IEEE/ACM Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07652 2024-05-14 cs.HC cs.AI 57%

G-VOILA: Gaze-Facilitated Information Querying in Daily Scenarios

Zeyu Wang, Yuanchun Shi, Yuntao Wang, Yuchen Yao, Kun Yan, Yuhan Wang, Lei Ji, Xuhai Xu, Chun Yu

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

Comments 25 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05749 2024-05-13 cs.CV 57%

NeRFFaceSpeech: One-shot Audio-driven 3D Talking Head Synthesis via Generative Prior

Gihoon Kim, Kwanggyoon Seo, Sihun Cha, Junyong Noh

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04963 2024-05-09 cs.MM 57%

Audio Matters Too! Enhancing Markerless Motion Capture with Audio Signals for String Performance Capture

Yitong Jin, Zhiping Qiu, Yi Shi, Shuangpeng Sun, Chongwu Wang, Donghao Pan, Jiachen Zhao, Zhenghao Liang, Yuan Wang, Xiaobing Li, Feng Yu, Tao Yu, Qionghai Dai

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.MM

Comments SIGGRAPH2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00983 2024-05-03 cs.CV 57%

LLM-AD: Large Language Model based Audio Description System

Peng Chu, Jiang Wang, Andre Abrantes

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12888 2024-04-22 cs.CV cs.GR cs.LG 57%

Learn2Talk: 3D Talking Face Learns from 2D Talking Face

Yixiang Zhuang, Baoping Cheng, Yao Cheng, Yuntao Jin, Renshuai Liu, Chengyang Li, Xuan Cheng, Jing Liao, Juncong Lin

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10390 2024-04-19 cs.CL 57%

LibriSQA: A Novel Dataset and Framework for Spoken Question Answering with Large Language Models

Zihan Zhao, Yiyang Jiang, Heyang Liu, Yanfeng Wang, Yu Wang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10578 2024-04-17 cs.SD eess.AS 57%

Vivo : une approche multimodale de la synthese concatenative par corpus dans le cadre d'une oeuvre audiovisuelle immersive

Mateo Fayet

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

Comments in French language

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06659 2024-04-11 cs.CL 57%

Leveraging Interesting Facts to Enhance User Engagement with Conversational Interfaces

Nikhita Vedula, Giuseppe Castellucci, Eugene Agichtein, Oleg Rokhlenko, Shervin Malmasi

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02450 2024-04-04 cs.LG cs.AI 57%

Task Agnostic Architecture for Algorithm Induction via Implicit Composition

Sahil J. Sindhi, Ignas Budvytis

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

Comments 12 pages, 2 figures, 2024 ICLR Generative Models for Decision Making Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏