TeamCAD -- A Multimodal Interface for Remote Computer Aided Design
专题命中 音频语音多模态 :multimodal(title,comments)
Comments Created for 6.835, Intelligent Multimodal User Interfaces at MIT, Spring 2022. Submitted to CHI 2024. 10 pages, 6 figures, 1 table
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(title,comments)
Comments Created for 6.835, Intelligent Multimodal User Interfaces at MIT, Spring 2022. Submitted to CHI 2024. 10 pages, 6 figures, 1 table
REFRAMED:面向电影的真实音频描述生成
专题命中 音频语音多模态 :multimodal(abstract,abstract_cn);分类 cs.CV、cs.CL
AI总结 本文提出新的音频描述生成范式,构建含206部电影的REFRAMED数据集及评估协议,实验显示现有AD系统和多模态LLMs表现优于简单基线但不及专业人类,为视频理解研究提供新基础。
Comments COLM 2026
VideoFDB: 评估对话代理中的全双工视觉-语音能力
机构 * NVIDIA ; David AI
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL
AI总结 提出首个全双工视听到视听(AV2AV)对话基准VideoFDB,通过237个真实视频片段、感知与生成行为分类以及基于评分规则的LM评判框架,系统评估代理在非语言对话动态中的表现,发现现有系统存在字幕崩溃和视觉流忽视等缺陷。
Comments Project page: https://research.nvidia.com/labs/amri/projects/video-fdb/
少即是多:通用AIGC音频-视频检测的模态解耦
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; University of Agder(阿格德大学)
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI
AI总结 针对通用AIGC音频-视频检测,现有方法假设不总成立,本文提出DAV-Det系统,通过决策级融合独立建模各模态取证证据,视觉和音频检测器分别利用多粒度表示及门控双分支架构,在挑战赛中排名第一。
Comments First place in the General AIGC Audio-Video Detection Challenge at the IJCAI-ECAI 2026 DDL 2.0 Workshop
Unison:和谐运动、语音和声音以实现以人为中心的音频视频生成
机构 * DeepMind ; OpenAI
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
AI总结 Unison通过显式促进运动、语音和声音模态的协调,解决音频视频生成中模态不一致的问题,提升感知质量和跨模态同步性能。
NTNU系统在S&I挑战2025 SLA开放赛道中的表现
机构 * National Taiwan Normal University(国立台湾师范大学) ; Department of Computer Science and Information Engineering(计算机科学与信息工程系) ; Institute of AI Interdisciplinary Applied Technology(人工智能跨学科应用技术研究所)
专题命中 音频语音多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CL、eess.AS
AI总结 本文提出整合W2V与Phi-4多模态大语言模型的系统,通过分数融合策略提升SLA评估性能,在Speak & Improve Challenge 2025中取得第二名,RMSE为0.375。
Comments submitted to the ISCA SLaTE-2025 Workshop
SpeechEQ: 社交感知语音对话模型的情商基准测试
机构 * New York University(纽约大学) ; NVIDIA(英伟达) ; Carnegie Mellon University(卡内基梅隆大学) ; NYU Shanghai(上海纽约大学)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI
AI总结 提出SpeechEQ框架,基于EQ-i 2.0理论构建2265个对话数据集,通过口语情商(SEQ)评分评估语音语言模型在主动多轮对话中的副语言社交线索推理能力,揭示端到端模型存在模态捷径、安全陷阱和上下文遗忘等瓶颈。
TaigiSpeech: 一个低资源真实世界语音意图数据集及基于可扩展野外数据挖掘的初步结果
机构 * Massachusetts Institute of Technology, USA(麻省理工学院) ; National Taiwan University, Taipei, Taiwan(国立台湾大学) ; National Taiwan University Artificial Intelligence Center of Research Excellence, Taipei, Taiwan(国立台湾大学人工智能研究中心) ; Academia Sinica, Taiwan(台湾“中央”研究院) ; National Yang Ming Chiao Tung University, Taiwan(阳明交通大学) ; Signal Analysis and Interpretation Laboratory (SAIL), University of Southern California, USA(信号分析与解释实验室(SAIL),南加州大学)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CL、eess.AS
AI总结 针对低资源台语,构建包含21位老年人3000条话语的语音意图数据集,并探索关键词匹配与LLM伪标注、音视频框架两种数据挖掘策略,以解决标注数据稀缺问题。
Comments Interspeech 2026 long paper
针对瑞士德语音识别的Whisper字幕对齐微调:基准污染、惯例不匹配以及25.6% WER(13.8% cWER)的诚实基线
机构 * Independent Researcher, Zurich, Switzerland(独立研究员,瑞士苏黎世) ; ETH Zürich(苏黎世联邦理工学院) ; University of Bern(伯尔尼大学) ; FHNW(西北应用科学与艺术大学) ; CeTIM Leiden/Munich(CeTIM 莱顿/慕尼黑)
专题命中 音频语音多模态 :multimodal(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 通过1,367小时广播语音与标准德语字幕的弱监督,系统微调Whisper large-v3用于瑞士德语音识,发现公开结果因基准污染被高估,并发布两个诚实评估的模型。
Comments 15 pages, 21 tables. Models available at https://huggingface.co/Flix-AI
DOA:面向语音大语言模型的长形式同声传译的无训练解码器仅注意力策略
机构 * Fondazione Bruno Kessler(布鲁诺·克塞塞基金会)
专题命中 音频语音多模态 :multimodal(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出DOA策略,利用解码器自注意力导出代理对齐,无需训练即可实现语音大语言模型在长形式同声传译中的流式决策。
OmniInteract:面向实时全模态助手的流式交互基准测试
机构 * CUHK MMLab(香港中文大学多模态实验室) ; SJTU(上海交通大学) ; NTU(国立新加坡大学) ; McMaster(麦马斯特大学) ; CityUHK(香港城市大学) ; JUFE(吉林大学)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL
AI总结 提出OmniInteract基准,通过在线推理音视频流评估全模态大模型的实时交互能力,发现现有模型在流式交互中表现薄弱。
SIREM: 语音引导的MRI重建与学习采样
机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg(埃森哲-埃尔朗根-纽伦堡大学模式识别实验室) ; Institute of Radiology, University Hospital Erlangen, Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根大学医院放射学研究所) ; Institut für Informationsverarbeitung, Leibniz Universität Hannover(汉诺威莱比锡大学信息处理研究所) ; Department of Radiology, Harvard Medical School and Massachusetts General Hospital(哈佛医学院放射科和麻省总医院)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
AI总结 本文提出了一种语音引导的MRI重建框架SIREM,通过同步语音作为跨模态先验,利用语音与声音学之间的相关性预测图像内容,从而在更高的吞吐量下实现更合理的解剖结构重建。
声音激发动作:用于视频编辑的音频和文本微调
机构 * University of Cyprus(塞浦路斯大学) ; Simon Fraser University(西蒙弗雷泽大学) ; Tel Aviv University(特拉维夫大学) ; CYENS Center Of Excellence(CYENS卓越中心)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM
AI总结 本文提出Sound Sparks Motion框架,通过测试时调整音频视觉生成模型的多模态条件信号,实现视频动作编辑,无需训练,通过音频潜在和文本条件残差扰动促进动作修改,同时利用视觉语言模型反馈提升编辑效果。
Comments Project Page: https://amirhossein-razlighi.github.io/Sound_Sparks_Motion
KARMA-MV:音乐视频上的因果问答基准
机构 * AMAAI Lab, Singapore University of Technology and Design(新加坡科技设计大学AMAAI实验室)
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI
AI总结 KARMA-MV是一个基于2682个YouTube音乐视频构建的大规模多选问答数据集,旨在测试模型整合时序音频视觉线索和视觉到音乐影响的能力,通过因果知识图谱方法提升音乐视频因果推理性能。
Omni2Sound:迈向统一的视频-文本到音频生成
机构 * Tsinghua University(清华大学) ; Monash University(莫纳什大学) ; Shengshu AI(盛数人工智能)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM
AI总结 本文提出Omni2Sound模型,解决视频-音频、文本-音频及联合视频-文本-音频生成中的数据稀缺与任务竞争问题,通过SoundAtlas数据集和三阶段训练策略实现统一生成。
探索第一人称视频理解中的音频幻觉
机构 * Meta ; University Of Maryland, College Park(马里兰大学学院公园分校)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI
AI总结 本文研究了第一人称视频中音频幻觉问题,提出自动评估框架和分类体系,发现先进AV-LLMs在回答声音相关问题时存在较高幻觉率。
Comments Accepted to ICASSP 2026
fMRI-LM:迈向语言对齐的fMRI理解的通用基础模型
机构 * TReNDS Center (Georgia Institute of Technology, Georgia State University, Emory)(TReNDS中心(佐治亚理工学院、佐治亚州立大学、埃默里大学)) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; Jiangsu University(江苏大学)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI
AI总结 本文提出fMRI-LM,通过三阶段框架将fMRI与语言结合,实现跨模态脑表示,通过神经分词、预训练LLM适应及多任务微调,提升fMRI的语义理解能力。
Comments Code are available: https://github.com/yuxiangwei0808/fMRI-LM
监听深度伪造检测:一种超越以说话为中心的伪造分析的新视角
机构 * Beijing Institute of Technology(北京理工大学) ; University of Science and Technology Beijing(北京科技大学) ; University of Science(科学技术大学)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
AI总结 本文提出监听深度伪造检测任务,引入首个专门为此任务设计的ListenForge数据集,并提出MANet网络以捕捉监听伪造中的细微运动不一致,实验表明现有说话深度伪造检测模型在监听场景中表现不佳。
Comments Submitted to ACMMM 2026
电影音频源分离使用视觉线索
机构 * School of Electrical Engineering, KAIST(韩国科学技术院电气工程学院) ; Graduate School of Artificial Intelligence, UNIST(蔚山科学技术院人工智能研究生院)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.MM、eess.AS
AI总结 本文提出首个结合视觉信息的电影音频源分离框架AV-CASS,通过条件流匹配实现多模态音频分离,并设计专用视觉编码器提升分离质量。
Comments CVPR 2026. Project page: https://cass-flowmatching.github.io
动态场景中手术动作空间映射的声源定位
机构 * ROCS(罗克辛研究所) ; Balgrist University Hospital(巴尔格里斯大学医院) ; University of Zurich(苏黎世大学) ; Dept. of Orthopedics(骨科部门) ; Computer Vision and Geometry Group(计算机视觉与几何组) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS
AI总结 本文提出一种动态手术场景中声源定位的方法,通过整合3D音频与视觉数据,提升手术场景的多模态理解能力。
MusicSem: 一种语义丰富的语言-音频数据集,用于自然音乐描述
机构 * University of Rochester(罗切斯特大学) ; National University of Singapore(新加坡国立大学) ; SJTU Paris Elite Institute of Technology(上海科技技术巴黎精英学院) ; Singapore Management University(新加坡管理学院) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.MM、eess.AS
AI总结 MusicSem是一个基于Reddit讨论的语义丰富的音乐描述数据集,旨在提升多模态音乐表示学习中对细粒度语义的建模能力。
突破数据效率困境:一种联邦学习与增强学习框架用于通过语音检测阿尔茨海默病
机构 * Tianjin Key Laboratory of Cognitive Computing and Application(认知计算与应用天津重点实验室) ; College of Intelligence and Computing, Tianjin University(智能计算学院,天津大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) ; College of Computer and Data Science, Fuzhou University(计算机与数据科学学院,福州大学) ; Huiyan Technology (Tianjin) Co., Ltd(慧研科技(天津)有限公司)
专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI
AI总结 FAL-AD通过联邦学习与数据增强框架,实现阿尔茨海默病语音检测中的数据效率提升,达到91.52%的多模态准确率。
Comments 5 pages, 1 figures, accepted by ICASSP 2026 conference
LLMBind:一种统一的模态-任务整合框架
机构 * pku(北京大学) ; pcl(鹏城实验室) ; hkbu(香港 Baptist大学)
专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CL、cs.AI
AI总结 LLMBind通过双路径机制和MoE架构,实现多模态任务的统一整合,提升任务扩展性和性能表现。
MoST:通过模态感知混合专家混合语音和文本
机构 * School of Computer Science, National University of Singapore(新加坡国立大学计算机科学学院) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI
AI总结 MoST通过模态感知混合专家架构,实现语音和文本的高效融合,首次公开了基于混合专家的语音-文本大语言模型。
SyncVoice:面向视频配音的视觉增强预训练TTS模型
机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) ; MiLM Plus, Xiaomi Inc., China(小米公司) ; School of Electronic Science and Engineering, Xiamen University, China(厦门大学电子科学与技术学院)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 SyncVoice通过视觉增强预训练TTS模型,提升视频配音的语音自然度和音视频同步性能,适用于多语言视频翻译场景。
从文本到多模态:探索大型语言模型在医疗实践中的演变与影响
机构 * Kyoto University(京都大学) ; Georgia Institute of Technology(佐治亚理工学院) ; National Taiwan Normal University(台湾师范大学) ; Indiana University(印第安纳大学) ; Hong Kong University of Science(香港科学大学) ; The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Cornell University(康奈尔大学) ; University of Liverpool(利物浦大学) ; University of Edinburgh(爱丁堡大学) ; Zhejiang University(浙江大学) ; Purdue University(Purdue 大学) ; Emory University, Atlanta, GA, USA(埃默里大学) ; West China Biomedical Big Data Center, West China Hospital, Sichuan University, Chengdu, China(西京生物大数据中心,四川大学西京医院,成都,中国)
专题命中 音频语音多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CL、cs.AI
AI总结 本文探讨了多模态大型语言模型在医疗实践中的发展与影响,分析其在医疗影像、临床决策支持等领域的应用及面临的挑战。
Comments 12 pages, 1 figure
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM
机构 * SmartFlowAI Research(SmartFlowAI研究院) ; Tongji University(同济大学) ; CMIC Guangzhou(广州CMIC) ; BUPT Beijing(北京邮电大学) ; Northeastern University Shenyang(沈阳东北大学) ; Peking University(北京大学) ; Qiyuan Tech Beijing(北京启元科技)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CL、cs.MM
机构 * Center for Robotics, Mines Paris - PSL University Paris, France(机器人中心,巴黎 Mines Paris - PSL 大学)
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS
Comments ICLR 2025 (Poster). Camera ready version. Project Page: https://amandinebtto.github.io/NeRAF; 24 pages, 13 figures
Journal ref The Thirteenth International Conference on Learning Representations, 2025