Instruction Data Generation and Unsupervised Adaptation for Speech Language Models
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments Accepted for Interspeech 2024
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments Accepted for Interspeech 2024
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments Under review at NeurIPS
专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Extended version of the ICASSP 24 paper. Project page: https://www.robots.ox.ac.uk/~vgg/research/synchformer/ Code: https://github.com/v-iashin/Synchformer
专题命中 音频语音多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted at TMLR 2023. 40 pages. Project page: https://unival-model.github.io/
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments Accepted to ICASSP 2024
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.MM、eess.AS
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments 6 pages, 2 figures, 2 tables
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted at ICCV 2023. For project page, see https://gamma.umd.edu/researchdirections/speech/adverb
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments WASPAA 2023. Project page: https://juliawilkins.github.io/sound-effects-retrieval-from-video/. 4 pages, 2 figures, 2 tables
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments CVPR 2023
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Project page: https://vision.cs.utexas.edu/projects/visual-acoustic-matching. Accepted at CVPR 2022
专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、eess.AS
Comments Published at ICCV 2021
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、eess.AS
Comments 46 pages, 28 figures
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Project page: https://www.trace.ethz.ch/publications/2020/sound_perception/index.html
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Appears in: European Conference on Computer Vision (ECCV) 2018
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ; School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) ; Tencent Youtu Lab(腾讯优图实验室) ; XMU(厦门大学) ; CASIA(中国科学院自动化研究所)
专题命中 音频语音多模态 :MLLM(abstract,comments);multimodal(abstract);分类 cs.CV、eess.AS
Comments NeurIPS 2025 Spotlight, Code 2.4K Stars: https://github.com/VITA-MLLM/VITA
用于矛盾/犹豫识别的校准多模态集成:系统描述与私密测试提交策略
机构 * eHealth Center, Faculty of Computer Science, Multimedia and Telecommunicactions, Universitat Oberta de Catalunya(加泰罗尼亚开放大学计算机科学、多媒体与电信学院电子健康中心) ; MIND/IN2UB, Department of Electronic and Biomedical Engineeering, Universitat de Barcelona(巴塞罗那大学电子与生物医学工程系MIND/IN2UB) ; Institute of Semiconductor Technology (IHT) & Laboratory for Emerging Nanometrology (LENA), Technische Universität Braunschweig(布伦瑞克工业大学半导体技术研究所(IHT)和新兴纳米计量实验室(LENA))
专题命中 音频语音多模态 :multimodal(title);分类 cs.CV
AI总结 该研究针对BAH数据集上的ABAW A/H挑战,提出校准多模态集成系统,由三个融合模型组成。在公共测试集上宏F1达0.7358,介绍五次私密测试提交的配置等,首次提交在私密测试中宏F1为0.7361,验证系统能推广到未见参与者。
Comments 8 pages, 1 figure, ECCV workshops
Vorch-Streamer:将人类音视频生扩展至实时长格式流式生成
机构 * Vorch Team(Vorch团队) ; Tongji University(同济大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV
AI总结 Vorch-Streamer是一款后训练框架,通过混合训练、自强制与DMD蒸馏等技术,实现了超24 FPS的实时长格式T2AV流式音视频生成,兼具音唇同步性与身份保留能力。
Comments Project page: https://vorch-project.github.io/Vorch-Streamer-project/
LoGSAM: 用于MRI分割的参数高效跨模态接地
机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität, Erlangen, Germany(德国埃朗根-纽伦堡大学模式识别实验室) ; Siemens Healthineers, Erlangen, Germany(德国埃朗根西门子医疗)
专题命中 音频语音多模态 :cross-modal(title);分类 cs.CV
AI总结 LoGSAM通过将放射科医生的语音转录为文本提示,利用预训练基础模型实现MRI肿瘤的高效分割,采用LoRA微调提升领域适应性,达到80.32%的Dice分数。
Comments 10 pages, 3 figures, 5 tables
探究大五人格特质在音频视觉共情估计中的作用
机构 * Japan Advanced Institute of Science and Technology(日本科学技术先进研究院) ; Human Informatics Laboratories, NTT Corporation(NTT公司人因实验室)
专题命中 音频语音多模态 :audio-visual(title);分类 cs.AI
AI总结 本研究探讨了大五人格特质在朋友间音频视觉共情估计中的作用,通过比较有无人格特质输入的模型,发现其能提升共情估计性能,并分解出感知者效应、目标效应和关系效应。
Comments 9 pages, 5 figures
Journal ref International Conference on Automatic Face and Gesture Recognition (FG2025)
ExpSpeech-Net: 表情与语音的多模态融合用于深度伪造检测
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 音频语音多模态 :multimodal(title);分类 cs.CV
AI总结 提出轻量级ExpSpeech-Net模型,通过融合面部表情和语音模式,利用SqueezeNet和RNN骨干网络及智能特征选择,实现高效深度伪造检测,准确率达94.5%。
EGI:一种多模态情感AI框架,用于增强Scrum Master的实时自我意识
机构 * Department of Computer Science(计算机科学系) ; University of Oxford(牛津大学)
专题命中 音频语音多模态 :multimodal(title);分类 cs.AI
AI总结 本文提出一种多模态情感AI框架EGI,通过整合四个精选的AI模型,实时监测Scrum Master和会议组织者无意识表达的情绪,提升团队动态中的情绪感知能力。
多模态大语言模型并非儿科言语语言病理学的全部需求
机构 * Ostbayerische Technische Hochschule(奥斯特拜尔技术大学)
专题命中 音频语音多模态 :multimodal(title);分类 cs.CL
AI总结 本文提出一种分层方法对儿童语音障碍进行分类,通过微调语音表示模型和数据增强技术,提高了临床任务的性能,证明语音表示模型在各项任务中均显著优于基于大语言模型的最新方法。
为你叙述:基于多纠缠潜在空间的提示引导音频视觉叙述面部生成
机构 * Machine Intelligence Group, Department of CS&IS, BITS Pilani, Hyderabad Campus, India(机器智能组,计算机科学与信息学系,比斯汉学院海得拉巴校区,印度) ; Georgia Institute of Technology, USA(佐治亚理工学院,美国)
专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV
AI总结 本文提出了一种基于多纠缠潜在空间的音频视觉叙述面部生成方法,通过合成静态图像、语音档案和目标文本来生成逼真的说话面孔。
Comments To appear in the Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026. Presented at Poster Session 1
MARS-Sep: 多模态对齐强化声音分离
机构 * Zhejiang University(浙江大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 音频语音多模态 :multimodal(title);分类 cs.AI
AI总结 MARS-Sep通过强化学习框架实现多模态对齐,提升声音分离的语义一致性和信号质量。
Comments ICLR 2026
通过 cochlear implants 增强空间听觉:探索人工智能、多模态交互和感知训练的作用
机构 * Acoustics Research Institute, Austrian Academy of Sciences(奥地利科学院声学研究所) ; Centre de Recherche en Neurosciences de Lyon Inserm(里昂神经科学研究中心(Inserm)) ; Department of Neural Dynamics and Magnetoencephalography, Hertie Institute for Clinical Brain Research, University of Tübingen(图宾根大学神经动力学与脑磁图部门) ; Centre for Integrative Neuroscience, University of Tübingen(图宾根大学整合神经科学中心) ; NEMO Labs Nonprofit Kft., Budapest(布达佩斯NEMO实验室(非营利公司))
专题命中 音频语音多模态 :multimodal(title);分类 eess.AS
AI总结 本文提出多学科合作框架,通过人工智能、多模态交互和感知训练提升耳蜗植入物用户的空间听觉能力。
LTX-2:高效的音频-视觉联合基础模型
机构 * Lightricks(利光科技)
专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV
AI总结 LTX-2是一种高效的音频-视觉联合基础模型,通过统一的双流变压器架构生成高质量的音频视觉内容,支持多语言提示和模态感知的可控生成。
未来你:设计和评估多模态AI生成的数字双胞胎以加强未来自我连续性
机构 * MIT Media Lab(MIT媒体实验室) ; Harvard University(哈佛大学) ; Stanford University(斯坦福大学) ; KASIKORN Labs(KASIKORN实验室)
专题命中 音频语音多模态 :multimodal(title);分类 cs.AI
AI总结 本研究通过多模态AI生成的未来自我探索其对自我连续性、情绪和动机的影响,发现avatar效果最佳,但各模态无显著差异,互动质量是关键因素。
用于人脸-语音关联的共享多模态嵌入空间
专题命中 音频语音多模态 :multi-modal(title);分类 cs.CV
AI总结 本文提出了一种基于共享多模态嵌入空间的人脸-语音关联方法,通过自适应角边距损失实现跨语言的高效识别
Comments Ranked 1st in Fame 2026 Challenge, ICASSP
机构 * Adobe Research(Adobe研究院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; MIT(麻省理工学院)
专题命中 音频语音多模态 :multimodal(title);分类 eess.AS
Comments Submitted to ICASSP 2026