arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4597 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2407.20556 2024-07-31 cs.RO cs.CL cs.CY 57%

Survey of Design Paradigms for Social Robots

Rita Frieske, Xiaoyu Mo, Yini Fang, Jay Nieles, Bertram E. Shi

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19590 2024-07-30 cs.MM 57%

The Future is Meta: Metadata, Formats and Perspectives towards Interactive and Personalized AV Content

Alexander Weller, Werner Bleisteiner, Christian Hufnagel, Michael Iber

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM

Comments 12 pages, 4 figures, submitted to the Tonmeistertagung 32

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00475 2024-07-30 cs.SD eess.AS 57%

E-chat: Emotion-sensitive Spoken Dialogue System with Large Language Models

Hongfei Xue, Yuhao Liang, Bingshen Mu, Shiliang Zhang, Mengzhe Chen, Qian Chen, Lei Xie

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17902 2024-07-26 eess.AS 57%

Multi-Stage Face-Voice Association Learning with Keynote Speaker Diarization

Ruijie Tao, Zhan Shi, Yidi Jiang, Duc-Tuan Truong, Eng-Siong Chng, Massimo Alioto, Haizhou Li

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16638 2024-07-24 cs.CV 57%

Unveiling and Mitigating Bias in Audio Visual Segmentation

Peiwen Sun, Honggang Zhang, Di Hu

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

Comments Accepted by ACM MM 24 (ORAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14875 2024-07-23 cs.CL 57%

Seal: Advancing Speech Language Models to be Few-Shot Learners

Shuyu Lei, Lingen Liu, Jiaolong Yang, Yasen Jiao, Yuxiang Yang, Yushu Yang, Xiang Guo

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13198 2024-07-19 cs.SD eess.AS 57%

DiveSound: LLM-Assisted Automatic Taxonomy Construction for Diverse Audio Generation

Baihan Li, Zeyu Xie, Xuenan Xu, Yiwei Guo, Ming Yan, Ji Zhang, Kai Yu, Mengyue Wu

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02584 2024-07-18 cs.SD eess.AS 57%

Towards Weakly Supervised Text-to-Audio Grounding

Xuenan Xu, Ziyang Ma, Mengyue Wu, Kai Yu

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10947 2024-07-16 cs.CV 57%

Can Textual Semantics Mitigate Sounding Object Segmentation Preference?

Yaoting Wang, Peiwen Sun, Yuanchao Li, Honggang Zhang, Di Hu

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

Comments Accepted by ECCV2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08403 2024-07-12 eess.IV cs.CV 57%

Ethics of Generating Synthetic MRI Vocal Tract Views from the Face

Muhammad Suhaib Shahid, Gleb E. Yakubov, Andrew P. French

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13843 2024-06-24 cs.AI 57%

Generative AI Misuse: A Taxonomy of Tactics and Insights from Real-World Data

Nahema Marchal, Rachel Xu, Rasmi Elasmar, Iason Gabriel, Beth Goldberg, William Isaac

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07254 2024-06-12 cs.SD eess.AS 57%

SRC4VC: Smartphone-Recorded Corpus for Voice Conversion Benchmark

Yuki Saito, Takuto Igarashi, Kentaro Seki, Shinnosuke Takamichi, Ryuichi Yamamoto, Kentaro Tachibana, Hiroshi Saruwatari

专题命中 音频语音多模态 :any-to-any(abstract);分类 eess.AS

Comments Accepted for INTERSPEECH 2024, corpus project page: https://y-saito.sakura.ne.jp/sython/Corpus/SRC4VC/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06295 2024-06-11 cs.SD eess.AS 57%

Zero-Shot Audio Captioning Using Soft and Hard Prompts

Yiming Zhang, Xuenan Xu, Ruoyi Du, Haohe Liu, Yuan Dong, Zheng-Hua Tan, Wenwu Wang, Zhanyu Ma

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

Comments Submitted to IEEE/ACM Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07652 2024-05-14 cs.HC cs.AI 57%

G-VOILA: Gaze-Facilitated Information Querying in Daily Scenarios

Zeyu Wang, Yuanchun Shi, Yuntao Wang, Yuchen Yao, Kun Yan, Yuhan Wang, Lei Ji, Xuhai Xu, Chun Yu

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

Comments 25 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05749 2024-05-13 cs.CV 57%

NeRFFaceSpeech: One-shot Audio-driven 3D Talking Head Synthesis via Generative Prior

Gihoon Kim, Kwanggyoon Seo, Sihun Cha, Junyong Noh

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04963 2024-05-09 cs.MM 57%

Audio Matters Too! Enhancing Markerless Motion Capture with Audio Signals for String Performance Capture

Yitong Jin, Zhiping Qiu, Yi Shi, Shuangpeng Sun, Chongwu Wang, Donghao Pan, Jiachen Zhao, Zhenghao Liang, Yuan Wang, Xiaobing Li, Feng Yu, Tao Yu, Qionghai Dai

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.MM

Comments SIGGRAPH2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00983 2024-05-03 cs.CV 57%

LLM-AD: Large Language Model based Audio Description System

Peng Chu, Jiang Wang, Andre Abrantes

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12888 2024-04-22 cs.CV cs.GR cs.LG 57%

Learn2Talk: 3D Talking Face Learns from 2D Talking Face

Yixiang Zhuang, Baoping Cheng, Yao Cheng, Yuntao Jin, Renshuai Liu, Chengyang Li, Xuan Cheng, Jing Liao, Juncong Lin

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10390 2024-04-19 cs.CL 57%

LibriSQA: A Novel Dataset and Framework for Spoken Question Answering with Large Language Models

Zihan Zhao, Yiyang Jiang, Heyang Liu, Yanfeng Wang, Yu Wang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10578 2024-04-17 cs.SD eess.AS 57%

Vivo : une approche multimodale de la synthese concatenative par corpus dans le cadre d'une oeuvre audiovisuelle immersive

Mateo Fayet

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

Comments in French language

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06659 2024-04-11 cs.CL 57%

Leveraging Interesting Facts to Enhance User Engagement with Conversational Interfaces

Nikhita Vedula, Giuseppe Castellucci, Eugene Agichtein, Oleg Rokhlenko, Shervin Malmasi

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02450 2024-04-04 cs.LG cs.AI 57%

Task Agnostic Architecture for Algorithm Induction via Implicit Composition

Sahil J. Sindhi, Ignas Budvytis

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

Comments 12 pages, 2 figures, 2024 ICLR Generative Models for Decision Making Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02098 2024-04-03 cs.CV 57%

BRAVEn: Improving Self-Supervised Pre-training for Visual and Auditory Speech Recognition

Alexandros Haliassos, Andreas Zinonos, Rodrigo Mira, Stavros Petridis, Maja Pantic

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

Comments ICASSP 2024. Code: https://github.com/ahaliassos/raven

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07676 2024-04-02 cs.CR cs.CL cs.LG 57%

Composite Backdoor Attacks Against Large Language Models

Hai Huang, Zhengyu Zhao, Michael Backes, Yun Shen, Yang Zhang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

Comments To Appear in Findings of the Association for Computational Linguistics: NAACL 2024, June 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16078 2024-03-26 cs.SD eess.AS 57%

Target Speech Extraction with Pre-trained AV-HuBERT and Mask-And-Recover Strategy

Wenxuan Wu, Xueyuan Chen, Xixin Wu, Haizhou Li, Helen Meng

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

Comments Accepted by IJCNN 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05730 2024-03-15 cs.MM 57%

AFL-Net: Integrating Audio, Facial, and Lip Modalities with a Two-step Cross-attention for Robust Speaker Diarization in the Wild

Yongkang Yin, Xu Li, Ying Shan, Yuexian Zou

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14363 2024-03-13 cs.AI 57%

Mobile Foundation Model as Firmware

Jinliang Yuan, Chen Yang, Dongqi Cai, Shihe Wang, Xin Yuan, Zeling Zhang, Xiang Li, Dingge Zhang, Hanzi Mei, Xianqing Jia, Shangguang Wang, Mengwei Xu

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

Comments 17 pages, 15 figures, published to ACM MobiCom'24

Journal ref The 30th Annual International Conference on Mobile Computing and Networking, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06282 2024-03-12 cs.LG cs.CV cs.IR 57%

MuseChat: A Conversational Music Recommendation System for Videos

Zhikang Dong, Bin Chen, Xiulong Liu, Pawel Polak, Peng Zhang

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04594 2024-03-08 cs.SD eess.AS 57%

A Detailed Audio-Text Data Simulation Pipeline using Single-Event Sounds

Xuenan Xu, Xiaohang Xu, Zeyu Xie, Pingyue Zhang, Mengyue Wu, Kai Yu

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07902 2024-03-06 cs.SD eess.AS 57%

BLAT: Bootstrapping Language-Audio Pre-training based on AudioSet Tag-guided Synthetic Data

Xuenan Xu, Zhiling Zhang, Zelin Zhou, Pingyue Zhang, Zeyu Xie, Mengyue Wu, Kenny Q. Zhu

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏