Why Pre-trained Models Fail: Feature Entanglement in Multi-modal Depression Detection
预训练模型为何失效:多模态抑郁检测中的特征纠缠
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS
AI总结 本文针对预训练模型在多模态抑郁检测中性能差的问题,提出信息分离框架解纠缠混合特征,显著提升了SSL模型和LLMs的检测性能,为相关系统开发提供了新见解。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
预训练模型为何失效:多模态抑郁检测中的特征纠缠
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS
AI总结 本文针对预训练模型在多模态抑郁检测中性能差的问题,提出信息分离框架解纠缠混合特征,显著提升了SSL模型和LLMs的检测性能,为相关系统开发提供了新见解。
基于凸特征嵌入学习的人脸与声音跨模态关联
专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV
AI总结 本文提出结合跨模态注意力机制的凸特征嵌入方法,解决人脸与声音跨模态关联中的特征异质性问题,在VoxCeleb数据集的相关任务上较现有方法有显著提升。
Journal ref Multimedia Systems, vol. 31, no. 4, pp. 296, July 2025
Digital Harf:用于普及型阿拉伯语言语和语言治疗的临床整合多模态AI系统
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 Digital Harf是专为阿拉伯语自闭症儿童设计的多模态AI治疗平台,其核心Agentic合成数据引擎解决阿拉伯语治疗内容短缺问题,获专家高接受率,为代表性语言环境构建AI治疗系统提供了思路。
SyncBreaker:面向音频驱动生成的多模态对抗攻击框架
机构 * University of Science and Technology of China(中国科学技术大学) ; Beijing University of Technology(北京工业大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 针对音频驱动生成中单模态防护不足的问题,提出SyncBreaker框架,通过多模态联合扰动提升防护效果,有效抑制唇同步和面部动态。
偏见交响曲:探索多模态大语言模型(LLMs)与乐器的性别关联
机构 * Amirkabir University of Technology(阿米尔卡比尔理工大学) ; King’s College London(伦敦国王学院) ; University of Tehran(德黑兰大学) ; Bocconi University(博科尼大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 本研究推出多模态数据集Symphony-Bias,评估多模态模型在乐器性别关联上的偏见,发现多数结果符合社会研究,契合度随文本、视觉、音频依次减弱。
Comments 32 pages, 23 figures, 21 tables
CARE:一个用于研究多种医疗状况下言语和非言语交流的多模态语料库
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
AI总结 针对多模态语音分析领域因现有数据集存在局限而发展受限的问题,引入CARE v1.0多模态英语数据集,涵盖多种医疗状况,提供丰富描述符和元数据,支持多种应用,推动该领域研究发展。
Comments Under review in npj Scientific Data
多模态说话人验证对说话人匿名化的威胁
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
AI总结 研究多话语、多模态环境下的说话人验证,通过对多个匿名话语的音频、韵律和语言信息进行聚合,比较不同聚合策略,发现多模态系统性能更优,帧级聚合EER最低,即便少量匿名话语结合音频和文本也能显著降低EER。
VIP-MINGLE:用于群体语言交流中视频会议和面对面多模态交互的语料库
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM
AI总结 介绍VIP-MINGLE多模态数据集,含59小时录音等,有两种环境下配对会话,涵盖多种数据。分析发现不同环境多模态行为分布有变化,该数据集是跨环境群体对话模型开发的关键资源。
Comments Interspeech 2026
在潜在空间中通过跨模态对齐实现精确的视频到音频生成
机构 * FPT Software AI Center(FPT软件人工智能中心) ; NVIDIA Corporation(NVIDIA公司)
专题命中 音频语音多模态 :cross-modal(title);audio-visual(abstract);分类 cs.MM
AI总结 研究视频到音频生成问题,提出Flowley架构,结合视觉特征与文本提示,通过渐进软掩码交叉注意力实现视听同步,无额外计算成本,还提出SoundCap字幕,该方法在多个指标及零样本音频质量上达先进水平。
Comments Accepted to ECCV 2026
连接多模型数据:俄罗斯国内与对外政策演讲
机构 * University of Delaware, Department of Political Science & International Relations(德克萨斯大学,政治科学与国际关系系) ; University of Delaware, Masters of Science in Data Science Program(德克萨斯大学,数据科学硕士项目) ; University of Delaware, Department of Computer & Information Sciences(德克萨斯大学,计算机与信息科学系) ; University of Pennsylvania, Department of Political Science(宾夕法尼亚大学,政治科学系)
专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);分类 cs.CL
AI总结 本文介绍了一个连接多模态政治通讯的数据集,涵盖俄罗斯政府多个 decades 的官方演讲,提供俄语和英语文本、图像及注释,并通过 transformer 多模态模型进行主题标注,支持政治通讯的多模态分析。
MAVIN:具有叙事控制的多镜头视听生成
机构 * Peking University(北京大学) ; Kling Team, Kuaishou Technology(快手团队) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Sun Yat-sen University(中山大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
AI总结 提出MAVIN框架,通过边界感知注意力、ID感知传播和多智能体脚本管线,实现多镜头视听生成中的叙事控制,解决时间错位、可控性差和脚本不完整问题。
Comments Accepted to ECCV 2026
用于哮喘的多模态数字生物标志物:声音、临床和人口统计学因素的互补作用
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
AI总结 研究针对哮喘诊断依赖传统方法、声音生物标志物缺乏临床背景整合的问题,提出多模态专家混合框架,结合声学嵌入与临床人口数据,在匹配队列上评估,模型性能优,还通过分析揭示不同症状个体特征依赖差异,支持哮喘筛查。
UBG-Net:用于鲁棒视听语音识别的不确定性感知贝叶斯门控网络
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
AI总结 针对视听语音识别系统在现实场景中的性能问题,提出UBG-Net框架,通过MUBF机制建模认知不确定性,用DUHV进行推理,实验表明其优于SOTA基线,消融研究证实相关机制增强了鲁棒性。
Omni-Embed-Audio: 利用多模态大语言模型实现鲁棒的音频-文本检索
机构 * Sogang University(首尔大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 提出Omni-Embed-Audio(OEA)检索编码器,利用多模态大语言模型原生理解音频,并通过用户意图查询(UIQ)和硬负样本挖掘,在文本到音频检索中达到与M2D-CLAP相当的性能,同时在文本到文本检索和硬负样本判别上显著优于现有方法。
Comments Accepted at ACL 2026 Main Conference. Camera-ready version
对话式人类视听对话生成
机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算系) ; Department of Earth Science & Engineering, Imperial College London(伦敦帝国理工学院地球科学与工程系) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Department of Computer Science, Heriot-Watt University(赫瑞瓦特大学计算机科学系) ; School of Computer Science, Northumbria University(诺森比亚大学计算机科学学院) ; College of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件学院) ; School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) ; Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(深圳大学广东省智能信息处理重点实验室) ; School of Engineering and Design, Hunan Normal University(湖南师范大学工程与设计学院) ; Department of Computer Science, University of Oxford(牛津大学计算机科学系) ; Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
AI总结 提出CHAT框架,统一大语言模型和说话人脸模型,通过交互音频和面部行为细化模块,从单一文本提示生成多样、配对且相互响应的语音-面部对话片段,优于现有方法,合成数据集可作预训练数据。
Comments Accepted to ECCV 2026 as a main paper
多模态大语言模型是否需要推理来从语音中分类痴呆症?
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
AI总结 本文评估了多模态大语言模型在自动痴呆症分类中的推理能力,发现基于文本理由的策略会导致幻觉和不一致,并提出DeTAiL框架,通过非线性适配器和强化学习利用内部表示,在两个数据集上优于基线方法。
TimeChat-Captioner: 用时间感知和结构化的音视频字幕脚本化多场景视频
机构 * South China University of Technology(华南理工大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
AI总结 提出Omni密集描述任务,通过六维结构模式生成带时间戳的类脚本描述,构建OmniDCBench基准和SodaM评估指标,训练TimeChat-Captioner-7B模型,在音视频推理和时间定位任务上超越Gemini-2.5-Pro。
利用被动场景声音和真实世界视频进行音频-视觉相机姿态估计
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
AI总结 本文提出一种结合方向到达谱和双耳嵌入的音频-视觉框架,用于真实世界视频中的相机姿态估计,在视觉信息受损时表现出鲁棒性。
Comments ECCV 2026
基于多模态语音、手势和音乐的LLM驱动交互式机器人动作合成
机构 * TCS Research, Tata Consultancy Services(塔塔咨询服务公司TCS研究院)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 提出利用大语言模型融合语音、手势和音乐节拍等多模态输入,合成复杂机器人动作序列的框架,实现更自然的人机交互。
Comments IROS 2025 Workshop on Action and Interaction: Humans and Robots in Collaboration
AMR: 面向多语言多模态说话人识别的自适应模态路由
机构 * Honor Device Co., Ltd(Honor设备有限公司)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 针对多模态说话人识别中模态缺失和语言不匹配问题,提出自适应模态路由(AMR)模块,动态评估输入质量并融合音频和面部特征,在POLY-SIM 2026评测集上平均准确率达99.07%。
跨模态鲁棒性迁移(CMRT):利用对抗文本训练鲁棒的语音翻译模型
机构 * Department of Advanced Computing Sciences(先进计算科学系)
专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL
AI总结 提出跨模态鲁棒性迁移(CMRT)框架,将文本模态的对抗鲁棒性迁移到语音模态,无需生成对抗语音数据,在四个语言对上平均提升超过3个BLEU点。
Comments A shorter version has been accepted at INTERSPEECH2026
Omnilingual SONAR:跨语言与跨模态句子嵌入,连接大规模多语言文本与语音
机构 * FAIR at Meta(Meta的FAIR)
专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL
AI总结 提出OmniSONAR模型,通过渐进式训练和教师-学生蒸馏,在数千种语言上实现文本、语音、代码和数学表达式的统一语义嵌入,在跨语言检索和翻译任务上显著降低错误率,并支持零样本语音翻译。
ThinkDeception: 一种用于可解释多模态欺骗检测的渐进式强化学习框架
机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 提出ThinkDeception框架,将多模态大语言模型引入欺骗检测,通过逐步推理和视觉-音频一致性组相对策略优化(VAC-GRPO)实现可解释的认知推理,在主流基准上达到新SOTA。
Comments 10pages,4figures
学习鲁棒的成对置信度用于多模态情感-原因对提取
机构 * Institute for Advanced Studies(先进研究院) ; Universiti Malaya(马来大学) ; School of Information Engineering(信息工程学院) ; Suqian University(宿州学院) ; Digitization Department(数字化部门)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 提出RPCL框架,通过置信度差异边界约束和对抗性扰动,增强多模态情感-原因对提取中成对置信度的判别性和稳定性,在三个数据集上提升Pair F1约2.6-2.8个百分点。
Comments 11 pages, 3 figures, 5 tables
协同零样本跨语言阿尔茨海默检测与语言不变多模态双几何对抗学习
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
AI总结 提出ORBIT框架,通过跨注意力融合、多语言对抗和球面-双曲几何学习实现零样本跨语言阿尔茨海默病检测,多模态融合优于单模态基线。
Comments Accepted to INTERSPEECH 2026
M*: 一个模块化、可扩展的多模态模型服务系统
机构 * Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 提出M*系统,通过将模型表示为数据流图并引入Walk Graph抽象,支持多模态复合模型的高效服务,在多个任务上降低延迟并提升吞吐量。
Comments The codebase is available at https://github.com/mstar-project/mstar
SSNAPS: 基于扩散逆采样的语音与背景噪声视听分离
机构 * Bar-Ilan University(巴伊兰大学) ; OriginAI
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
AI总结 提出一种无监督的视听语音分离方法,利用扩散先验和逆采样联合建模语音与噪声,在单麦克风场景下优于有监督基线,并支持离屏说话人分离。
基于多模态大语言模型的链式思维差异-共性推理的可解释音频编辑评估
机构 * College of Computer Science, Nankai University, Tianjin, China(南开大学计算机科学学院,天津,中国) ; Academy for Advanced Interdisciplinary Studies, Nankai University, Tianjin, China(南开大学先进跨学科研究学院,天津,中国)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
AI总结 提出首个基于自然语言的音频编辑自动评估框架,利用Qwen2-Audio和链式思维推理策略,实现可解释且与人类判断高度一致的评估。
课堂环境中的多模态说话人识别
机构 * University of Michigan(密歇根大学) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Maryland(马里兰大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 针对课堂背景噪声和儿童语音变异性导致纯声学模型准确率低的问题,提出融合声学嵌入与LLM语义上下文的多模态框架,将学生识别准确率从39.0%提升至50.3%,长句准确率达76.9%,角色区分准确率99.3%。
Comments 9 pages, 5 tables, 3 figures
面向音视频广义零样本学习的层次化标准化嵌入对齐
机构 * Southeast University(东南大学) ; The University of Hong Kong(香港大学) ; Beijing Institute of Technology(北京理工大学) ; Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(新一代人工智能技术及其跨学科应用重点实验室(东南大学),教育部) ; School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
AI总结 提出AHSE方法,通过Z-score标准化和层次化对齐策略(语义、类别、批次三级)解决音视频与文本模态间的分布与结构差异,在三个基准数据集上取得竞争性能。