Audio Visual Emotion Recognition with Temporal Alignment and Perception Attention
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.CL
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.CL
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.CL
倾听重要吗?AI克隆中的反馈式回应与点头动作
机构 * Kyoto University(京都大学) ; Sony Computer Science Laboratories(索尼计算机科学实验室)
专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.CL
AI总结 本研究将口头反馈式回应与头部点头整合到配备语音克隆及LLM响应的AI克隆中,经35人被试内研究证实,添加互动倾听行为可提升AI克隆的感知专注度、真实感与共同在场感,其保真度需涵盖倾听行为。
Comments This paper has been accepted to the Late-Breaking Results (LBR) track of the 28th International Conference on Multimodal Interaction (ICMI 2026)
心理健康领域的大语言模型:应用、创新与伦理挑战的系统综述
专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.AI
AI总结 该系统综述梳理了大语言模型在心理健康领域的多类应用、技术创新,同时探讨了其面临的伦理与监管挑战,并倡导建立保障其安全公平部署的框架。
Comments Systematic review. Published in Journal of Industrial Integration and Management (2025). Applications of large language models in mental health, including social media analysis, clinical conversational agents, therapy support tools, multimodal learning, and ethical considerations
Journal ref Journal of Industrial Integration and Management (JIIM), 2025
机构 * Independent Researcher(独立研究者)
专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.AI
Comments 33 pages, 3 figures, 6 tables. Keywords: LLM security; defense-in-depth; prompt injection; activation steering; multimodal sandbox; threat modeling
机构 * Northwestern University(西北大学) ; University of Chicago(芝加哥大学)
专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.CV
Comments 8 pages, 4 figures, ICMI '25 (27th International Conference on Multimodal Interaction), October 13-17, 2025, Canberra, ACT, Australia
机构 * Florida Institute of Technology(佛罗里达理工学院) ; Knovel Engineering Lab(诺维尔工程实验室) ; Vietnam Military Medical University(越南军事医科大学) ; Military Central Hospital(108陆军中央医院) ; Can Tho University of Medicine and Pharmacy(芹苴医药大学) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.CV
Comments CVPR Multimodal Algorithmic Reasoning Workshop 2025 - SilVarMed
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV;multimodal(comments)
Comments Accepted by ACM ICMI'19 (2019 International Conference on Multimodal Interaction)
专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.CV
Comments 11 pages, 2 figures, 5 tables, in peer review with ACM TIST, Key words: Aggression, multimodal anger recognition, Kinect
专题命中 音频语音多模态 :multimodal(abstract,journal_ref);分类 cs.CV
Comments Alternative see: http://vision.cse.psu.edu/kettebek/academ/publications.htm
Journal ref S. Kettebekov, M. Yeasin, and R. Sharma, "Prosody Based Co-analysis for Continuous Recognition of Coverbal Gestures," presented at International Conference on Multimodal Interfaces (ICMI'02), Pittsburgh, USA, 2002
AudioSpan:覆盖音频理解的时长与深度
机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 音频语音多模态 :omni-modal(abstract);分类 eess.AS
AI总结 本研究提出覆盖10分钟至2小时音频的基准AudioSpan,含3240个分三认知层级的问题,评估12个大型音频-语言模型,发现从长音频提取相关事实是核心难点,该基准可公开获取。
EEG-to-Report:用于在临床脑电图上训练语言模型的标注与特征-文本框架
机构 * Vietnam Maritime University(越南海事大学) ; HAISmartlink Lab(HAISmartlink实验室)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
AI总结 针对临床EEG报告依赖人工、现有工具无法满足AI训练需求的问题,提出EEG-to-Report框架,整合多格式EEG处理与标注,生成对齐特征-文本对,还含自动报告模块,为自动化EEG报告系统提供基础。
超级明星:面向数字人的流式实时交互智能体
机构 * ShanghaiTech University(上海科技大学) ; LIGHTSPEED(腾讯光速工作室)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文针对交互式数字人提出流式实时同步言语手势生成任务,构建耦合流式语音响应与在线手势生成的框架,经实验验证其在延迟-质量权衡等方面优于现有基线。
Comments Accepted by ACM Multimedia 2026. Project Page: \url{https://super-star-2026.github.io/}
面向野外360°语音场景的视觉引导空间音频生成
专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS
AI总结 针对野外360°语音场景空间音频采集质量受限问题,本文提出视觉引导的FOA语音空间化方法,构建YT-SPEECH数据集,采用Localizer-Renderer框架实现定向FOA信号重建,提升了音频相关性能。
Comments Accepted at INTERSPEECH 2026
迷失在语音中:跨音频与文本的三语语音幻觉检测
机构 * Satbayev University(萨塔巴耶夫大学) ; University of Colorado Boulder(科罗拉多大学博尔德分校) ; The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
AI总结 该研究针对低资源语言语音幻觉检测的空白,构建三语语音幻觉基准,评估多模态检测模型,发现文本检测更优,合成训练检测器在真实数据上迁移性强,还揭示合成基准的混淆因素。
音节级别的无监督语音识别
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
AI总结 该研究针对现有无监督语音识别方法依赖G2P且训练不稳定的问题,提出基于掩码语言建模的音节级UASR框架,在LibriSpeech上使CER相对降低40%,并有效推广到低资源语言。
DiaScriber:面向多说话人场景的联合说话人 diarization(语音分割)与转录的语音大语言模型
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
AI总结 本研究提出基于Qwen3.5-Omni的端到端多说话人 diarization与转录模型DiaScriber,通过构建多样数据流程与三阶段训练策略,在多说话人场景测试集上性能优于对比方法且泛化能力出色。
EchoWM:开放且可进入的全模态世界模型
机构 * HKUST(香港科技大学) ; PKU(北京大学) ; Joy Future Academy, JD(京东探索研究院) ; HKU(香港大学) ; THU(清华大学) ; USTC(中国科学技术大学) ; FDU(复旦大学) ; Beihang University(北京航空航天大学) ; Stanford University(斯坦福大学)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV
AI总结 该研究提出EchoWM全模态世界模型,围绕相机意图组织交互,构建互补数据引擎并采用渐进式训练等方法,在公开基准上实现强轨迹跟随与高视觉质量,支持跨视角交互及长序列多模态同步生成。
Comments 42 pages, 24 figures
类人音乐机器人作为音乐诱发情绪研究的实验接口
机构 * Sony Computer Science Laboratories(索尼计算机科学实验室) ; Waseda University(早稻田大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM
AI总结 本文提出将类人音乐机器人作为音乐诱发情绪研究的实验接口,通过WAS-5案例验证其技术可行性,为该领域可控研究提供方法论平台。
Comments Opinion paper accepted for presentation at the Sound and Music Computing (SMC) Conference 2026 (5-7 November in Zagreb, Croatia)
UniVerse:针对文化包容性低资源音乐理解的基准测试与增强
机构 * Sogang University(西江大学) ; KAIST(韩国科学技术院) ; NYU Shanghai(上海纽约大学) ; JIUTIAN Research, China Mobile(中国移动九天研究院) ; The State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) ; China Mobile (Hong Kong) Innovation Research Institute(中国移动(香港)创新研究院) ; Central Conservatory of Music(中央音乐学院)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM
AI总结 该研究针对低资源音乐理解问题,推出UniVerse基准与数据集,训练LALMs并研究多模态不平衡学习策略,实现性能提升但仍存在深层音乐理解的差距。
Comments 21 pages, 7 figures, 8 tables
流行音乐文化的计算研究方法
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.MM
AI总结 该文提出流行音乐文化的计算研究需采用多模态方法,综述相关量化研究并指出其存在的多模态方法匮乏等问题,勾勒出绘制歌词主题图谱等三个未来研究方向。
Comments 18 pages, 1 figure
在语境中说话:通过对比学习实现的多语言语音识别与语音语境对齐
机构 * Institute for Analytics and Data Science, University of Essex(数据分析与科学研究所,埃塞克斯大学) ; School of Computer Science and Electronic Engineering, University of Essex(计算机科学与电子工程学院,埃塞克斯大学)
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL
AI总结 本文提出一种基于对比学习的多语言语音识别框架,通过语境对齐提升识别性能,支持多种语言和口音,实现语音与上下文的高效交互。
Comments Accepted at LREC 2026
老年人认知障碍检测与管理的技术进展:趋势、挑战与未来方向
机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) ; T-Systems ICT India Pvt. Ltd.(德国电信系统印度信息通信技术私人有限公司)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文综合老年人认知障碍检测与管理的技术进展,提出跨学科分类法等成果,指出现有模型多依赖小数据集,展望了可信多模态纵向验证系统的发展前景。
Comments Withdrawn due to an unresolved dispute regarding authorship eligibility and attribution
jina-embeddings-v5-omni: 通过锁定对齐塔实现几何保持嵌入
机构 * Jina by Elastic(Jina 由 Elastic 公司)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
AI总结 本文提出GELATO方法,通过冻结对齐塔实现多模态嵌入,生成统一语义空间,训练效率高且保持文本嵌入一致性。
Comments 11 pages, 9 figures, 5 tables
面向第二届MLC-SLM挑战赛的前置静音增强与多阶段合成监督
机构 * Ant Group(蚂蚁集团) ; UESTC(电子科技大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
AI总结 针对第二届MLC-SLM挑战赛的两项任务,分别采用前置静音增强等策略微调VibeVoice-ASR-7B、用合成问答对微调Qwen3-Omni-30B-A3B-Instruct,提升了任务1和任务2的评估性能。
VisG AV-HuBERT:基于视觉发音的AV-HuBERT
专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS
AI总结 本文提出VisG AV-HuBERT,通过引入辅助的发音分类任务,强化模型对视觉发音特征的依赖,提升在噪声环境下的语音识别性能。
Comments Includes Supplementary Material. Accepted for Publication at International Conference on Pattern Recognition 2026 - ICPR 2026. Code is available at https://github.com/aristosp/visg_avhubert
Journal ref A. Papadopoulos, R. Jain, N. Harte, VisG AV-HuBERT: Viseme-Guided AV-HuBERT, in Pattern Recognition. ICPR 2026, Lecture Notes in Computer Science, vol. 16812, pp. 667-682, Springer, 2026
解码学生心智:利用对话代理进行心理和学习分析
机构 * STIH Laboratory, Sorbonne University(索邦大学STIH实验室) ; LIPAH-LR11ES14, National Engineering School of Tunis(突尼斯国家工程学院LIPAH-LR11ES14) ; Faculty of Sciences of Tunis(突尼斯科学学院) ; LINFI Laboratory(LINFI实验室)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
AI总结 本文提出一种结合多模态数据和语义推理的对话代理,用于实时分析学生认知和情感状态,提升学习表现和情感福祉。
SraVaani 1.0:面向印度语言的包容性自动语音识别规模化模型
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
AI总结 本文提出SraVaani 1.0,一款基于FastConformer架构的多语言ASR模型,覆盖65种印度语言,经三阶段训练后在8个基准上表现优异,是唯一支持多种低资源及部落印度语言转录的开源模型。
AeroReformer2:面向航拍图像的语音查询指称分割
机构 * Massachusetts Institute of Technology(麻省理工学院) ; The University of Manchester(曼彻斯特大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文针对现有指称遥感图像分割基准仅支持书面表达的问题,构建了首个语音查询指称分割基准RISBench-S,并提出高效双边网络模型AeroReformer2,在相关任务上取得优于基线的性能。