Hierarchical Cross-Modal Talking Face Generationwith Dynamic Pixel-Wise Loss
专题命中 音频语音多模态 :cross-modal(title);分类 cs.CV
Journal ref Published in CVPR 2019
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :cross-modal(title);分类 cs.CV
Journal ref Published in CVPR 2019
专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV
专题命中 音频语音多模态 :multi-modal(title);分类 eess.AS
Comments Accepted at IEEE ICASSP 2019, Brighton, UK. 5 pages. 3 figures
专题命中 音频语音多模态 :multimodal(title);分类 eess.AS
Comments Pitch Extraction, F0 extraction, harmonic signals, speech, monophonic songs, Convolutional Neural Network, 5 pages, 5 figures
专题命中 音频语音多模态 :multimodal(title);分类 cs.CL
Comments 9 pages
专题命中 音频语音多模态 :multimodal(title);分类 cs.CL
Comments 6pages, ICDMW
专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV
专题命中 音频语音多模态 :multimodal(title);分类 cs.CL
Comments 7 pages, Accepted as a conference paper at IEEE SLT 2018
专题命中 音频语音多模态 :multimodal(title);分类 cs.CL
Comments Accepted for ICMI18
专题命中 音频语音多模态 :multimodal(title);分类 eess.AS
专题命中 音频语音多模态 :multi-modal(title);分类 cs.CL
Comments Proceedings of the Language Evaluation and Resources Conference (LREC) 2018
专题命中 音频语音多模态 :multimodal(title);分类 cs.CL
Journal ref Proc. LREC 11 (2018) 4277-4281
专题命中 音频语音多模态 :multi-modal(title);分类 cs.CV
专题命中 音频语音多模态 :multi-modal(title);分类 cs.CL
Comments Accepted to ICASSP 2018
专题命中 音频语音多模态 :multimodal(title);分类 cs.CL
Comments LREC 2018, Japan
专题命中 音频语音多模态 :multimodal(title);分类 cs.CL
专题命中 音频语音多模态 :multimodal(title);分类 cs.CL
Comments 6 pages, ps file, presented at icmi96 (Bejing)
专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV
Comments Published in British Machine Vision Conference (BMVC) 2015
专题命中 音频语音多模态 :multi-modal(title);分类 cs.CL
Comments 8 pages, 6 figures
Journal ref Proceedings of ACL Workshop on Sharing Tools and Resources for Research and Education, Toulouse, July 2001, pp 23-30
专题命中 音频语音多模态 :multimodal(title,comments)
Comments Created for 6.835, Intelligent Multimodal User Interfaces at MIT, Spring 2022. Submitted to CHI 2024. 10 pages, 6 figures, 1 table
REFRAMED:面向电影的真实音频描述生成
专题命中 音频语音多模态 :multimodal(abstract,abstract_cn);分类 cs.CV、cs.CL
AI总结 本文提出新的音频描述生成范式,构建含206部电影的REFRAMED数据集及评估协议,实验显示现有AD系统和多模态LLMs表现优于简单基线但不及专业人类,为视频理解研究提供新基础。
Comments COLM 2026
VideoFDB: 评估对话代理中的全双工视觉-语音能力
机构 * NVIDIA ; David AI
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL
AI总结 提出首个全双工视听到视听(AV2AV)对话基准VideoFDB,通过237个真实视频片段、感知与生成行为分类以及基于评分规则的LM评判框架,系统评估代理在非语言对话动态中的表现,发现现有系统存在字幕崩溃和视觉流忽视等缺陷。
Comments Project page: https://research.nvidia.com/labs/amri/projects/video-fdb/
少即是多:通用AIGC音频-视频检测的模态解耦
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; University of Agder(阿格德大学)
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI
AI总结 针对通用AIGC音频-视频检测,现有方法假设不总成立,本文提出DAV-Det系统,通过决策级融合独立建模各模态取证证据,视觉和音频检测器分别利用多粒度表示及门控双分支架构,在挑战赛中排名第一。
Comments First place in the General AIGC Audio-Video Detection Challenge at the IJCAI-ECAI 2026 DDL 2.0 Workshop
Unison:和谐运动、语音和声音以实现以人为中心的音频视频生成
机构 * DeepMind ; OpenAI
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
AI总结 Unison通过显式促进运动、语音和声音模态的协调,解决音频视频生成中模态不一致的问题,提升感知质量和跨模态同步性能。
NTNU系统在S&I挑战2025 SLA开放赛道中的表现
机构 * National Taiwan Normal University(国立台湾师范大学) ; Department of Computer Science and Information Engineering(计算机科学与信息工程系) ; Institute of AI Interdisciplinary Applied Technology(人工智能跨学科应用技术研究所)
专题命中 音频语音多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CL、eess.AS
AI总结 本文提出整合W2V与Phi-4多模态大语言模型的系统,通过分数融合策略提升SLA评估性能,在Speak & Improve Challenge 2025中取得第二名,RMSE为0.375。
Comments submitted to the ISCA SLaTE-2025 Workshop
SpeechEQ: 社交感知语音对话模型的情商基准测试
机构 * New York University(纽约大学) ; NVIDIA(英伟达) ; Carnegie Mellon University(卡内基梅隆大学) ; NYU Shanghai(上海纽约大学)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI
AI总结 提出SpeechEQ框架,基于EQ-i 2.0理论构建2265个对话数据集,通过口语情商(SEQ)评分评估语音语言模型在主动多轮对话中的副语言社交线索推理能力,揭示端到端模型存在模态捷径、安全陷阱和上下文遗忘等瓶颈。
TaigiSpeech: 一个低资源真实世界语音意图数据集及基于可扩展野外数据挖掘的初步结果
机构 * Massachusetts Institute of Technology, USA(麻省理工学院) ; National Taiwan University, Taipei, Taiwan(国立台湾大学) ; National Taiwan University Artificial Intelligence Center of Research Excellence, Taipei, Taiwan(国立台湾大学人工智能研究中心) ; Academia Sinica, Taiwan(台湾“中央”研究院) ; National Yang Ming Chiao Tung University, Taiwan(阳明交通大学) ; Signal Analysis and Interpretation Laboratory (SAIL), University of Southern California, USA(信号分析与解释实验室(SAIL),南加州大学)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CL、eess.AS
AI总结 针对低资源台语,构建包含21位老年人3000条话语的语音意图数据集,并探索关键词匹配与LLM伪标注、音视频框架两种数据挖掘策略,以解决标注数据稀缺问题。
Comments Interspeech 2026 long paper
针对瑞士德语音识别的Whisper字幕对齐微调:基准污染、惯例不匹配以及25.6% WER(13.8% cWER)的诚实基线
机构 * Independent Researcher, Zurich, Switzerland(独立研究员,瑞士苏黎世) ; ETH Zürich(苏黎世联邦理工学院) ; University of Bern(伯尔尼大学) ; FHNW(西北应用科学与艺术大学) ; CeTIM Leiden/Munich(CeTIM 莱顿/慕尼黑)
专题命中 音频语音多模态 :multimodal(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 通过1,367小时广播语音与标准德语字幕的弱监督,系统微调Whisper large-v3用于瑞士德语音识,发现公开结果因基准污染被高估,并发布两个诚实评估的模型。
Comments 15 pages, 21 tables. Models available at https://huggingface.co/Flix-AI
DOA:面向语音大语言模型的长形式同声传译的无训练解码器仅注意力策略
机构 * Fondazione Bruno Kessler(布鲁诺·克塞塞基金会)
专题命中 音频语音多模态 :multimodal(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出DOA策略,利用解码器自注意力导出代理对齐,无需训练即可实现语音大语言模型在长形式同声传译中的流式决策。
OmniInteract:面向实时全模态助手的流式交互基准测试
机构 * CUHK MMLab(香港中文大学多模态实验室) ; SJTU(上海交通大学) ; NTU(国立新加坡大学) ; McMaster(麦马斯特大学) ; CityUHK(香港城市大学) ; JUFE(吉林大学)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL
AI总结 提出OmniInteract基准,通过在线推理音视频流评估全模态大模型的实时交互能力,发现现有模型在流式交互中表现薄弱。