Visual Speech Enhancement
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS
Comments Accepted to Interspeech 2018. Supplementary video: https://www.youtube.com/watch?v=nyYarDGpcYA
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS
Comments Accepted to Interspeech 2018. Supplementary video: https://www.youtube.com/watch?v=nyYarDGpcYA
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS
Journal ref Speech Communication, Special Issue on AV expressive speech. 2017
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.CL
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.MM
Comments 4 pages
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.CL
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI
Comments Under Peer Review of SigDial 2016
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments 9 pages, 1 figure, pre-print
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.CL
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.CL
倾听重要吗?AI克隆中的反馈式回应与点头动作
机构 * Kyoto University(京都大学) ; Sony Computer Science Laboratories(索尼计算机科学实验室)
专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.CL
AI总结 本研究将口头反馈式回应与头部点头整合到配备语音克隆及LLM响应的AI克隆中,经35人被试内研究证实,添加互动倾听行为可提升AI克隆的感知专注度、真实感与共同在场感,其保真度需涵盖倾听行为。
Comments This paper has been accepted to the Late-Breaking Results (LBR) track of the 28th International Conference on Multimodal Interaction (ICMI 2026)
心理健康领域的大语言模型:应用、创新与伦理挑战的系统综述
专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.AI
AI总结 该系统综述梳理了大语言模型在心理健康领域的多类应用、技术创新,同时探讨了其面临的伦理与监管挑战,并倡导建立保障其安全公平部署的框架。
Comments Systematic review. Published in Journal of Industrial Integration and Management (2025). Applications of large language models in mental health, including social media analysis, clinical conversational agents, therapy support tools, multimodal learning, and ethical considerations
Journal ref Journal of Industrial Integration and Management (JIIM), 2025
机构 * Independent Researcher(独立研究者)
专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.AI
Comments 33 pages, 3 figures, 6 tables. Keywords: LLM security; defense-in-depth; prompt injection; activation steering; multimodal sandbox; threat modeling
机构 * Northwestern University(西北大学) ; University of Chicago(芝加哥大学)
专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.CV
Comments 8 pages, 4 figures, ICMI '25 (27th International Conference on Multimodal Interaction), October 13-17, 2025, Canberra, ACT, Australia
机构 * Florida Institute of Technology(佛罗里达理工学院) ; Knovel Engineering Lab(诺维尔工程实验室) ; Vietnam Military Medical University(越南军事医科大学) ; Military Central Hospital(108陆军中央医院) ; Can Tho University of Medicine and Pharmacy(芹苴医药大学) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.CV
Comments CVPR Multimodal Algorithmic Reasoning Workshop 2025 - SilVarMed
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV;multimodal(comments)
Comments Accepted by ACM ICMI'19 (2019 International Conference on Multimodal Interaction)
专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.CV
Comments 11 pages, 2 figures, 5 tables, in peer review with ACM TIST, Key words: Aggression, multimodal anger recognition, Kinect
专题命中 音频语音多模态 :multimodal(abstract,journal_ref);分类 cs.CV
Comments Alternative see: http://vision.cse.psu.edu/kettebek/academ/publications.htm
Journal ref S. Kettebekov, M. Yeasin, and R. Sharma, "Prosody Based Co-analysis for Continuous Recognition of Coverbal Gestures," presented at International Conference on Multimodal Interfaces (ICMI'02), Pittsburgh, USA, 2002
AudioSpan:覆盖音频理解的时长与深度
机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 音频语音多模态 :omni-modal(abstract);分类 eess.AS
AI总结 本研究提出覆盖10分钟至2小时音频的基准AudioSpan,含3240个分三认知层级的问题,评估12个大型音频-语言模型,发现从长音频提取相关事实是核心难点,该基准可公开获取。
EEG-to-Report:用于在临床脑电图上训练语言模型的标注与特征-文本框架
机构 * Vietnam Maritime University(越南海事大学) ; HAISmartlink Lab(HAISmartlink实验室)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
AI总结 针对临床EEG报告依赖人工、现有工具无法满足AI训练需求的问题,提出EEG-to-Report框架,整合多格式EEG处理与标注,生成对齐特征-文本对,还含自动报告模块,为自动化EEG报告系统提供基础。
超级明星:面向数字人的流式实时交互智能体
机构 * ShanghaiTech University(上海科技大学) ; LIGHTSPEED(腾讯光速工作室)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文针对交互式数字人提出流式实时同步言语手势生成任务,构建耦合流式语音响应与在线手势生成的框架,经实验验证其在延迟-质量权衡等方面优于现有基线。
Comments Accepted by ACM Multimedia 2026. Project Page: \url{https://super-star-2026.github.io/}
面向野外360°语音场景的视觉引导空间音频生成
专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS
AI总结 针对野外360°语音场景空间音频采集质量受限问题,本文提出视觉引导的FOA语音空间化方法,构建YT-SPEECH数据集,采用Localizer-Renderer框架实现定向FOA信号重建,提升了音频相关性能。
Comments Accepted at INTERSPEECH 2026
迷失在语音中:跨音频与文本的三语语音幻觉检测
机构 * Satbayev University(萨塔巴耶夫大学) ; University of Colorado Boulder(科罗拉多大学博尔德分校) ; The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
AI总结 该研究针对低资源语言语音幻觉检测的空白,构建三语语音幻觉基准,评估多模态检测模型,发现文本检测更优,合成训练检测器在真实数据上迁移性强,还揭示合成基准的混淆因素。
音节级别的无监督语音识别
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
AI总结 该研究针对现有无监督语音识别方法依赖G2P且训练不稳定的问题,提出基于掩码语言建模的音节级UASR框架,在LibriSpeech上使CER相对降低40%,并有效推广到低资源语言。
DiaScriber:面向多说话人场景的联合说话人 diarization(语音分割)与转录的语音大语言模型
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
AI总结 本研究提出基于Qwen3.5-Omni的端到端多说话人 diarization与转录模型DiaScriber,通过构建多样数据流程与三阶段训练策略,在多说话人场景测试集上性能优于对比方法且泛化能力出色。
EchoWM:开放且可进入的全模态世界模型
机构 * HKUST(香港科技大学) ; PKU(北京大学) ; Joy Future Academy, JD(京东探索研究院) ; HKU(香港大学) ; THU(清华大学) ; USTC(中国科学技术大学) ; FDU(复旦大学) ; Beihang University(北京航空航天大学) ; Stanford University(斯坦福大学)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV
AI总结 该研究提出EchoWM全模态世界模型,围绕相机意图组织交互,构建互补数据引擎并采用渐进式训练等方法,在公开基准上实现强轨迹跟随与高视觉质量,支持跨视角交互及长序列多模态同步生成。
Comments 42 pages, 24 figures
类人音乐机器人作为音乐诱发情绪研究的实验接口
机构 * Sony Computer Science Laboratories(索尼计算机科学实验室) ; Waseda University(早稻田大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM
AI总结 本文提出将类人音乐机器人作为音乐诱发情绪研究的实验接口,通过WAS-5案例验证其技术可行性,为该领域可控研究提供方法论平台。
Comments Opinion paper accepted for presentation at the Sound and Music Computing (SMC) Conference 2026 (5-7 November in Zagreb, Croatia)
UniVerse:针对文化包容性低资源音乐理解的基准测试与增强
机构 * Sogang University(西江大学) ; KAIST(韩国科学技术院) ; NYU Shanghai(上海纽约大学) ; JIUTIAN Research, China Mobile(中国移动九天研究院) ; The State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) ; China Mobile (Hong Kong) Innovation Research Institute(中国移动(香港)创新研究院) ; Central Conservatory of Music(中央音乐学院)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM
AI总结 该研究针对低资源音乐理解问题,推出UniVerse基准与数据集,训练LALMs并研究多模态不平衡学习策略,实现性能提升但仍存在深层音乐理解的差距。
Comments 21 pages, 7 figures, 8 tables
流行音乐文化的计算研究方法
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.MM
AI总结 该文提出流行音乐文化的计算研究需采用多模态方法,综述相关量化研究并指出其存在的多模态方法匮乏等问题,勾勒出绘制歌词主题图谱等三个未来研究方向。
Comments 18 pages, 1 figure