arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46352 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4587 篇

2309.11500 2024-09-10 cs.SD cs.CV cs.MM eess.AS 75%

Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning

Luoyi Sun, Xuenan Xu, Mengyue Wu, Weidi Xie

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00486 2024-09-04 cs.CV cs.LG cs.MM cs.SD eess.AS 75%

Multi-scale Multi-instance Visual Sound Localization and Segmentation

Shentong Mo, Haofan Wang

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12946 2024-06-21 eess.AS cs.AI cs.CL cs.LG 75%

Instruction Data Generation and Unsupervised Adaptation for Speech Language Models

Vahid Noroozi, Zhehuai Chen, Somshubra Majumdar, Steve Huang, Jagadeesh Balam, Boris Ginsburg

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments Accepted for Interspeech 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18669 2024-06-03 cs.LG cs.AI cs.CL eess.AS 75%

Zipper: A Multi-Tower Decoder Architecture for Fusing Modalities

Vicky Zayats, Peter Chen, Melissa Ferrari, Dirk Padfield

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments Under review at NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16423 2024-01-30 cs.CV cs.LG cs.MM cs.SD eess.AS 75%

Synchformer: Efficient Synchronization from Sparse Cues

Vladimir Iashin, Weidi Xie, Esa Rahtu, Andrew Zisserman

专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Extended version of the ICASSP 24 paper. Project page: https://www.robots.ox.ac.uk/~vgg/research/synchformer/ Code: https://github.com/v-iashin/Synchformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16184 2023-12-25 cs.CV cs.LG cs.MM cs.SD eess.AS 75%

UnIVAL: Unified Model for Image, Video, Audio and Language Tasks

Mustafa Shukor, Corentin Dancette, Alexandre Rame, Matthieu Cord

专题命中 音频语音多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted at TMLR 2023. 40 pages. Project page: https://unival-model.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19972 2023-12-19 eess.AS cs.AI cs.CL 75%

VILAS: Exploring the Effects of Vision and Language Context in Automatic Speech Recognition

Ziyi Ni, Minglun Han, Feilong Chen, Linghui Meng, Jing Shi, Pin Lv, Bo Xu

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments Accepted to ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10901 2023-10-24 cs.SD cs.CL cs.IR cs.MM eess.AS 75%

ALCAP: Alignment-Augmented Music Captioner

Zihao He, Weituo Hao, Wei-Tsung Lu, Changyou Chen, Kristina Lerman, Xuchen Song

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.00347 2023-09-04 cs.IR cs.CV cs.MM cs.SD eess.AS 75%

Towards Contrastive Learning in Music Video Domain

Karel Veldkamp, Mariya Hendriksen, Zoltán Szlávik, Alexander Keijser

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments 6 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12370 2023-08-25 cs.CV cs.MM cs.SD eess.AS 75%

AdVerb: Visually Guided Audio Dereverberation

Sanjoy Chowdhury, Sreyan Ghosh, Subhrajyoti Dasgupta, Anton Ratnarajah, Utkarsh Tyagi, Dinesh Manocha

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted at ICCV 2023. For project page, see https://gamma.umd.edu/researchdirections/speech/adverb

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09089 2023-08-21 cs.SD cs.CV cs.IR cs.MM eess.AS 75%

Bridging High-Quality Audio and Video via Language for Sound Effects Retrieval from Visual Queries

Julia Wilkins, Justin Salamon, Magdalena Fuentes, Juan Pablo Bello, Oriol Nieto

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments WASPAA 2023. Project page: https://juliawilkins.github.io/sound-effects-retrieval-from-video/. 4 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17490 2023-03-31 cs.CV cs.MM cs.SD eess.AS eess.IV 75%

Sound to Visual Scene Generation by Audio-to-Visual Latent Alignment

Kim Sung-Bin, Arda Senocak, Hyunwoo Ha, Andrew Owens, Tae-Hyun Oh

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.06875 2022-06-15 cs.CV cs.MM cs.SD eess.AS 75%

Visual Acoustic Matching

Changan Chen, Ruohan Gao, Paul Calamia, Kristen Grauman

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Project page: https://vision.cs.utexas.edu/projects/visual-acoustic-matching. Accepted at CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.01265 2022-04-05 cs.CV cs.AI cs.SD eess.AS 75%

Multi-modality Associative Bridging through Memory: Speech Sound Recollected from Face Video

Minsu Kim, Joanna Hong, Se Jin Park, Yong Man Ro

专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、eess.AS

Comments Published at ICCV 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.15075 2020-11-10 cs.CV cs.AI cs.HC eess.AS eess.IV 75%

Generative Adversarial Networks in Human Emotion Synthesis:A Review

Noushin Hajarolasvadi, Miguel Arjona Ramírez, Hasan Demirel

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、eess.AS

Comments 46 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.04210 2020-03-10 cs.CV cs.MM cs.SD eess.AS 75%

Semantic Object Prediction and Spatial Sound Super-Resolution with Binaural Sounds

Arun Balajee Vasudevan, Dengxin Dai, Luc Van Gool

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Project page: https://www.trace.ethz.ch/publications/2020/sound_perception/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.06651 2018-07-27 cs.CV cs.LG cs.MM cs.SD eess.AS 75%

Objects that Sound

Relja Arandjelović, Andrew Zisserman

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Appears in: European Conference on Computer Vision (ECCV) 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01957 2025-10-27 cs.CV cs.SD eess.AS 74%

VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction

Chaoyou Fu, Haojia Lin, Xiong Wang, Yi-Fan Zhang, Yunhang Shen, Xiaoyu Liu, Haoyu Cao, Zuwei Long, Heting Gao, Ke Li, Long Ma, Xiawu Zheng, Rongrong Ji, Xing Sun, Caifeng Shan, Ran He

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Tencent Youtu Lab(腾讯优图实验室) XMU(厦门大学) CASIA(中国科学院自动化研究所)

专题命中 音频语音多模态 :MLLM(abstract,comments);multimodal(abstract);分类 cs.CV、eess.AS

Comments NeurIPS 2025 Spotlight, Code 2.4K Stars: https://github.com/VITA-MLLM/VITA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12176 2026-08-27 cs.CV 版本更新 74%

HEDGE: A Calibrated Ensemble for A/H Recognition

用于矛盾/犹豫识别的校准多模态集成:系统描述与私密测试提交策略

Josep Cabacas-Maso, Ismael Benito-Altamirano, Carles Ventura

机构 * eHealth Center, Faculty of Computer Science, Multimedia and Telecommunicactions, Universitat Oberta de Catalunya(加泰罗尼亚开放大学计算机科学、多媒体与电信学院电子健康中心) MIND/IN2UB, Department of Electronic and Biomedical Engineeering, Universitat de Barcelona(巴塞罗那大学电子与生物医学工程系MIND/IN2UB) Institute of Semiconductor Technology (IHT) & Laboratory for Emerging Nanometrology (LENA), Technische Universität Braunschweig(布伦瑞克工业大学半导体技术研究所(IHT)和新兴纳米计量实验室(LENA))

专题命中 音频语音多模态 :multimodal(title);分类 cs.CV

AI总结 该研究针对BAH数据集上的ABAW A/H挑战,提出校准多模态集成系统,由三个融合模型组成。在公共测试集上宏F1达0.7358,介绍五次私密测试提交的配置等,首次提交在私密测试中宏F1为0.7361,验证系统能推广到未见参与者。

Comments 8 pages, 1 figure, ECCV workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05663 2026-08-10 cs.CV cs.SD 版本更新 74%

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

Vorch-Streamer:将人类音视频生扩展至实时长格式流式生成

Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

机构 * Vorch Team(Vorch团队) Tongji University(同济大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV

AI总结 Vorch-Streamer是一款后训练框架,通过混合训练、自强制与DMD蒸馏等技术,实现了超24 FPS的实时长格式T2AV流式音视频生成,兼具音唇同步性与身份保留能力。

Comments Project page: https://vorch-project.github.io/Vorch-Streamer-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17576 2026-07-21 cs.CV 版本更新 74%

LoGSAM: Parameter-Efficient Cross-Modal Grounding for MRI Segmentation

LoGSAM: 用于MRI分割的参数高效跨模态接地

Mohammad Robaitul Islam Bhuiyan, Sheethal Bhat, Melika Qahqaie, Andreas Maier, Tri-Thien Nguyen, Paula Andrea Pérez-Toro, Tomás Arias-Vergara

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität, Erlangen, Germany(德国埃朗根-纽伦堡大学模式识别实验室) Siemens Healthineers, Erlangen, Germany(德国埃朗根西门子医疗)

专题命中 音频语音多模态 :cross-modal(title);分类 cs.CV

AI总结 LoGSAM通过将放射科医生的语音转录为文本提示,利用预训练基础模型实现MRI肿瘤的高效分割,采用LoRA微调提升领域适应性,达到80.32%的Dice分数。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11861 2026-06-16 cs.HC cs.AI 74%

Investigating Role of Big Five Personality Traits in Audio-Visual Rapport Estimation

探究大五人格特质在音频视觉共情估计中的作用

Takato Hayashi, Ryusei Kimura, Ryo Ishii, Shogo Okada

机构 * Japan Advanced Institute of Science and Technology(日本科学技术先进研究院) Human Informatics Laboratories, NTT Corporation(NTT公司人因实验室)

专题命中 音频语音多模态 :audio-visual(title);分类 cs.AI

AI总结 本研究探讨了大五人格特质在朋友间音频视觉共情估计中的作用,通过比较有无人格特质输入的模型,发现其能提升共情估计性能,并分解出感知者效应、目标效应和关系效应。

Comments 9 pages, 5 figures

Journal ref International Conference on Automatic Face and Gesture Recognition (FG2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05760 2026-06-05 cs.CV 74%

ExpSpeech-Net: Multimodal Fusion of Expression and Speech for Deepfake Detection

ExpSpeech-Net: 表情与语音的多模态融合用于深度伪造检测

Ruchika Sharma, Rudresh Dwivedi

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 音频语音多模态 :multimodal(title);分类 cs.CV

AI总结 提出轻量级ExpSpeech-Net模型,通过融合面部表情和语音模式,利用SqueezeNet和RNN骨干网络及智能特征选择,实现高效深度伪造检测,准确率达94.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17684 2026-05-19 cs.AI cs.SE 74%

EGI: A Multimodal Emotional AI Framework for Enhancing Scrum Master Real-time Self-Awareness

EGI:一种多模态情感AI框架,用于增强Scrum Master的实时自我意识

Jingni Huang, Peter Bloodsworth

机构 * Department of Computer Science(计算机科学系) University of Oxford(牛津大学)

专题命中 音频语音多模态 :multimodal(title);分类 cs.AI

AI总结 本文提出一种多模态情感AI框架EGI,通过整合四个精选的AI模型,实时监测Scrum Master和会议组织者无意识表达的情绪,提升团队动态中的情绪感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26568 2026-04-30 cs.CL 74%

Multimodal LLMs are not all you need for Pediatric Speech Language Pathology

多模态大语言模型并非儿科言语语言病理学的全部需求

Darren Fürst, Sebastian Steindl, Ulrich Schäfer

机构 * Ostbayerische Technische Hochschule(奥斯特拜尔技术大学)

专题命中 音频语音多模态 :multimodal(title);分类 cs.CL

AI总结 本文提出一种分层方法对儿童语音障碍进行分类,通过微调语音表示模型和数据增强技术,提高了临床任务的性能,证明语音表示模型在各项任务中均显著优于基于大语言模型的最新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18618 2026-02-24 cs.CV 74%

Narrating For You: Prompt-guided Audio-visual Narrating Face Generation Employing Multi-entangled Latent Space

为你叙述:基于多纠缠潜在空间的提示引导音频视觉叙述面部生成

Aashish Chandra, Aashutosh A, Abhijit Das

机构 * Machine Intelligence Group, Department of CS&IS, BITS Pilani, Hyderabad Campus, India(机器智能组,计算机科学与信息学系,比斯汉学院海得拉巴校区,印度) Georgia Institute of Technology, USA(佐治亚理工学院,美国)

专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV

AI总结 本文提出了一种基于多纠缠潜在空间的音频视觉叙述面部生成方法,通过合成静态图像、语音档案和目标文本来生成逼真的说话面孔。

Comments To appear in the Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026. Presented at Poster Session 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10509 2026-02-18 cs.SD cs.AI 74%

MARS-Sep: Multimodal-Aligned Reinforced Sound Separation

MARS-Sep: 多模态对齐强化声音分离

Zihan Zhang, Xize Cheng, Zhennan Jiang, Dongjie Fu, Jingyuan Chen, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 音频语音多模态 :multimodal(title);分类 cs.AI

AI总结 MARS-Sep通过强化学习框架实现多模态对齐,提升声音分离的语义一致性和信号质量。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13787 2026-02-17 cs.SD eess.AS 74%

Enhancing spatial hearing with cochlear implants: exploring the role of AI, multimodal interaction and perceptual training

通过 cochlear implants 增强空间听觉:探索人工智能、多模态交互和感知训练的作用

Lorenzo Picinali, Robert Baumgartner, Valerie Gaveau, Antonino Greco, Stefanie Liebe, Paul Oomen, Christoph Braun

机构 * Acoustics Research Institute, Austrian Academy of Sciences(奥地利科学院声学研究所) Centre de Recherche en Neurosciences de Lyon Inserm(里昂神经科学研究中心(Inserm)) Department of Neural Dynamics and Magnetoencephalography, Hertie Institute for Clinical Brain Research, University of Tübingen(图宾根大学神经动力学与脑磁图部门) Centre for Integrative Neuroscience, University of Tübingen(图宾根大学整合神经科学中心) NEMO Labs Nonprofit Kft., Budapest(布达佩斯NEMO实验室(非营利公司))

专题命中 音频语音多模态 :multimodal(title);分类 eess.AS

AI总结 本文提出多学科合作框架,通过人工智能、多模态交互和感知训练提升耳蜗植入物用户的空间听觉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03233 2026-01-07 cs.CV 74%

LTX-2: Efficient Joint Audio-Visual Foundation Model

LTX-2:高效的音频-视觉联合基础模型

Yoav HaCohen, Benny Brazowski, Nisan Chiprut, Yaki Bitterman, Andrew Kvochko, Avishai Berkowitz, Daniel Shalem, Daphna Lifschitz, Dudu Moshe, Eitan Porat, Eitan Richardson, Guy Shiran, Itay Chachy, Jonathan Chetboun, Michael Finkelson, Michael Kupchick, Nir Zabari, Nitzan Guetta, Noa Kotler, Ofir Bibi, Ori Gordon, Poriya Panet, Roi Benita, Shahar Armon, Victor Kulikov, Yaron Inger, Yonatan Shiftan, Zeev Melumian, Zeev Farbman

机构 * Lightricks(利光科技)

专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV

AI总结 LTX-2是一种高效的音频-视觉联合基础模型,通过统一的双流变压器架构生成高质量的音频视觉内容,支持多语言提示和模态感知的可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06106 2025-12-09 cs.HC cs.AI 74%

Future You: Designing and Evaluating Multimodal AI-generated Digital Twins for Strengthening Future Self-Continuity

未来你:设计和评估多模态AI生成的数字双胞胎以加强未来自我连续性

Constanze Albrecht, Chayapatr Archiwaranguprok, Rachel Poonsiriwong, Awu Chen, Peggy Yin, Monchai Lertsutthiwong, Kavin Winson, Hal Hershfield, Pattie Maes, Pat Pataranutaporn

机构 * MIT Media Lab(MIT媒体实验室) Harvard University(哈佛大学) Stanford University(斯坦福大学) KASIKORN Labs(KASIKORN实验室)

专题命中 音频语音多模态 :multimodal(title);分类 cs.AI

AI总结 本研究通过多模态AI生成的未来自我探索其对自我连续性、情绪和动机的影响,发现avatar效果最佳,但各模态无显著差异,互动质量是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏