GEMINI: A Generic Multi-Modal Natural Interface Framework for Videogames
专题命中 音频语音多模态 :multi-modal(title)
Comments WorldCIST'13 Internacional Conference
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multi-modal(title)
Comments WorldCIST'13 Internacional Conference
专题命中 音频语音多模态 :multimodal(title)
Journal ref 3rd International Symposium on Facial Analysis and Animation (2012)
EXAM²:扩展多语言与多模态分析中的音频理解能力
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 本文提出多语言多模态音频理解基准EXAM²,评估现有模型发现其存在多语言跨模态理解差距,微调的Gemma3n-EXAM²性能显著提升,推动相关研究发展。
Comments 8 pages, 2 figures
TurboT2VA:基于分数正则化一致性蒸馏的快速大规模文本-视频-音频生成
机构 * Zhejiang University(浙江大学) ; Tianjin University(天津大学) ; Tsinghua University(清华大学) ; Qingdao University(青岛大学) ; National University of Singapore(新加坡国立大学)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出TurboT2VA框架,通过多模态归一化与渐进式课程方案,在保持音视频生成质量的同时,大幅加速190亿参数联合T2VA模型的推理,在不同分辨率下实现最高54.67倍的生成器加速。
音频超分辨率和带宽扩展从判别模型到生成模型的综述
机构 * Discovery Partners Institute(发现伙伴研究所)
专题命中 音频语音多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 eess.AS
AI总结 本文综述了音频超分辨率和带宽扩展领域,从判别模型向生成模型的转变,总结了早期判别模型的局限性以及生成模型在表示域、架构、条件机制等方面的改进,探讨了大语言模型和多模态基础模型等新兴方向,并指出了感知评估、相位建模和实际应用泛化等开放挑战。
Comments Under review
VOICE:一种融合原位单细胞基因表达直接预测与基于检索预测的视觉-组学基础模型
机构 * University of Michigan(密歇根大学) ; Weill Cornell Medicine(威尔康奈尔医学院)
专题命中 音频语音多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV
AI总结 该研究提出多模态基础模型 VOICE,通过对比学习对齐 H&E 形态与单细胞表达嵌入,融合直接回归与参考检索分支,泛化性良好且在七项指标上优于现有方法,可从 H&E 图像预测单细胞基因表达。
AVCap:用细节感知奖励强化音视频联合字幕
机构 * MMLab, CUHK(香港中文大学MMLab) ; Peking University(北京大学)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV
AI总结 针对音视频联合字幕的数据集、奖励信号、评估基准的局限,提出AVCap-100K数据集、AVCap模型及专用基准指标,通过Da-GRPO优化的AVCap模型性能优异。
AnyTrack:用任意模态统一视觉目标跟踪
机构 * Army Engineering University of PLA(中国人民解放军陆军工程大学) ; Dalian University of Technology(大连理工大学) ; National University of Defense Technology(国防科技大学)
专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对现有多模态目标跟踪器适配性与泛化性差的问题,提出AnyTrack框架,通过MIM与CUM模块实现任意模态的统一跟踪,扩展基准后实验验证其性能先进、灵活有效。
Comments Accepted by ACM MM2026. More modifications may be performed
EmpaAva:开源智能体式3D化身共情实时聊天机器人
机构 * National University of Singapore(新加坡国立大学) ; Tsinghua University(清华大学) ; University of Oxford(牛津大学)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CL
AI总结 该研究提出首个开源智能体式3D化身共情聊天机器人EmpaAva,通过三智能体架构实现闭环多模态交互,在评估中优于多款基准模型,将开源并提供在线演示。
Comments Project&Demo: https://empaava.top/
HyPASE:用于大音频语言模型的参数高效语音情感微调框架的双曲几何方法
机构 * Tongji University(同济大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Peking University(北京大学)
专题命中 音频语音多模态 :cross-modal(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出HyPASE双曲PEFT框架,利用庞加莱球模型及HGA、EMCA组件,在MELD、IEMOCAP等数据集上优于欧氏PEFT基线,实现高效的大音频语言模型语音情感微调。
OPOD:基于策略的全模态蒸馏
机构 * Tencent(腾讯)
专题命中 音频语音多模态 :multimodal(abstract);omni-modal(abstract);分类 cs.AI
AI总结 研究旨在提升全模态模型能力,提出基于策略的全模态蒸馏(OPOD)方法,将学生响应路由到对应模态教师,调整教师影响,训练后仅留可部署的全模态模型,在多基准测试和多种骨干网络规模下取得优异成绩。
FillGauss:用于3D高斯点云的细粒度填充感知撞击声生成
专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.MM
AI总结 研究针对多模态AI中从视觉合成撞击声的挑战,提出细粒度填充感知撞击声生成任务。基于FillImpact数据集,构建FillGauss框架,融合多种要素实现位置、撞击物及填充感知音频生成,达物理基础跨模态音频生成新水平。
超越语言和模态限制学习说话者身份:来自POLY-SIM 2026挑战赛的见解
机构 * Institute of Computational Perception, Johannes Kepler University(约翰内斯·开普勒大学计算感知研究所) ; University of Michigan-Flint(密歇根大学弗林特分校) ; BDO DIGITAL Gmbh(BDO数字有限公司) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Fortemedia(富特媒体公司) ; College of Computing, Mohammed VI Polytechnic University(穆罕默德六世理工大学计算学院) ; IT:U Interdisciplinary Transformation University(IT:U跨学科转型大学) ; University of Augsburg(奥格斯堡大学)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV
AI总结 POLY-SIM 2026挑战赛旨在解决多模态说话者识别中语言和模态限制问题,针对实际应用中信息缺失、多语言等挑战,为比较解决方案提供标准化设置。
Comments Accepted at ACM MM 2026
LightMem-Ego:适用于日常生活的人工智能记忆
机构 * Zhejiang University(浙江大学) ; South China University of Technology(华南理工大学) ; Central China Normal University(华中师范大学) ; Lenovo Group Limited(联想集团有限公司)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 针对移动和可穿戴设备上个人AI助手回答过去经历查询难的问题,提出LightMem-Ego轻量级流多模态记忆系统,能捕获、对齐并组织视觉和音频流成分层记忆,基于多模态证据生成答案,可部署在多种设备上提供多种支持。
Comments Ongoing work
基于条件流匹配的视觉引导声学增强
机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院) ; Meta
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 eess.AS
AI总结 提出条件流匹配生成框架解决视觉引导音频重混中的多对多映射问题,通过滚动损失和跨模态融合模块实现优于判别方法的性能。
READ:超越所见——基于强化学习的准确连贯音频描述生成
机构 * City University of Hong Kong(香港城市大学) ; Baidu Inc(百度公司) ; Tsinghua University(清华大学)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV
AI总结 提出首个基于强化学习的音频描述生成框架READ,通过序列级优化和连贯性奖励,显著提升生成准确性与连贯性。
评估大型语言模型在会议中的收话人、话轮转换和下一说话人预测能力
机构 * NTT, Inc., Japan(日本电信电话公司) ; Language Technologies Institute, Carnegie Mellon University, USA(卡内基梅隆大学语言技术研究所)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CL
AI总结 利用大型语言模型(LLMs)研究多模态多人对话中的话轮转换,构建了收话人检测、话轮转换预测和下一说话人预测三个任务的评估框架,实验表明LLMs在下一说话人预测上优于监督模型和人类,但多模态LLM在收话人检测和话轮转换预测上仍低于人类水平。
Comments Accepted to INTERSPEECH 2026
针对大型音频语言的成员推断攻击
机构 * National Taiwan University(国立台湾大学) ; NTU Artificial Intelligence Center of Research Excellence(国立成功大学人工智能卓越研究中心)
专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 首次系统评估大型音频语言模型的成员推断攻击,提出盲基线协议控制分布偏移,发现跨模态记忆仅源于说话人声纹与文本绑定。
Comments Accepted by Interspeech 2026
EmoZone-Talker: 基于面部动作单元的音频驱动3DGS说话人头部的区域语义控制
机构 * China University of Petroleum (East China)(中国石油大学(华东))
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出EmoZone-Talker框架,通过区域解耦和时序建模解决音频与表情信号的冲突,实现精细、可解释的面部表情控制。
听、看、学:通过SAM-Audio实现无遗忘学习
机构 * University of Washington(华盛顿大学)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV
AI总结 提出一种利用SAM-Audio多模态先验的类增量学习方法,通过引导注意力机制和双层蒸馏策略,在音频-视觉场景中缓解灾难性遗忘,性能优于现有方法。
DetectZoo:一个用于跨文本、音频和图像模态的AI生成内容检测的统一工具包
机构 * University of Toronto(多伦多大学) ; University of Waterloo(滑铁卢大学) ; Toronto Metropolitan University(多伦多 Metropolitan 大学) ; University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出DetectZoo,一个首个统一的多模态AI生成内容检测工具包,通过标准化数据预处理、评估流程和集成61个检测器与22个基准数据集,实现公平可重复的基准测试。
关注一切:统一人类注意力建模的基础模型
机构 * College of Computer Science, Sichuan University, Chengdu, 610065, China(四川大学计算机学院) ; National Key Laboratory of Fundamental Science on Synthetic Vision, Sichuan University, Chengdu, 610065, China(合成视觉基础科学国家重点实验室)
专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV
AI总结 提出 Attend to Anything Model (AAM),一种多模态基础模型,通过层次化语言提示和双曲空间嵌入统一图像、视频和视听任务中的注意力建模,并在16个基准上平均提升6%,视频推理加速约4倍。
Comments Accepted to ICML 2026
VAANI:为包容性数字印度捕捉语言景观
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS
AI总结 本文提出大规模多模态数据集VAANI,覆盖印度165个地区、105种语言,通过图像提示收集自发语音并严格质控,旨在推动包容性语音技术发展。
第五届PVUW MeViS-Audio Track的第二名:ASR-SaSaSa2VA
机构 * Hunan University(湖南大学)
专题命中 音频语音多模态 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出ASR-SaSaSa2VA框架,通过ASR将音频转换为文本描述,结合预训练文本引导视频分割模型实现高效的音频引导视频分割,解决了计算复杂度高、对齐困难和数据依赖性强的问题。
Comments 5 pages
HumDial-EIBench: 一个用于音频语言模型的情感智能基准测试
机构 * Nanjing University, China(南京大学,中国) ; AISHELL, China(AISHELL,中国)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS
AI总结 本文提出HumDial-EIBench,通过真实人类对话评估音频语言模型的情感智能,采用多选题和对抗性干扰项减少主观评分偏差,发现大多数模型在多轮情感跟踪和隐含因果推理上表现不佳。
端到端听、看、说和行动
机构 * Tsinghua University(清华大学) ; ByteDance(字节跳动)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出ELLSA模型,首个端到端全双工系统,实现视觉、文本、语音和行动的同步感知与生成,支持对话轮替、指令拒绝等复杂交互行为,推动更自然的人工智能发展。
Comments 22 pages, 8 figures
Journal ref ICLR 2026
EgoSound:评估egocentric视频中声音理解的基准测试
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Nankai University(南开大学) ; East China Normal University(华东师范大学) ; KAUST(卡塔尔大学)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 EgoSound首次系统评估多模态大语言模型在egocentric视频中的声音理解能力,包含7个任务分类,揭示当前模型在空间和因果理解上的局限。
Comments Accepted by CVPR 2026
生成式AI研究的环境足迹:来自Moshi基金会模型的洞察
机构 * LIGM, CNRS, Univ Gustave Eiffel, ENPC, Institut Polytechnique de Paris(LIGM, CNRS, 古斯塔夫·埃菲尔大学, ENPC, 巴黎综合理工学院) ; Université Paris-Saclay, CNRS, LISN(巴黎-萨克雷大学, CNRS, LISN) ; Université Paris-Saclay, CNRS, ENSIIE, LISN(巴黎-萨克雷大学, CNRS, ENSIIE, LISN) ; Kyutai
专题命中 音频语音多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.AI
AI总结 本文通过细粒度分析Moshi模型的计算消耗,首次量化了生成式多模态大语言模型(MLLM)研究的环境影响,揭示了计算密集型研究的能耗与环境成本,为可持续AI研究提供指导。
Comments 28 pages, 12 figures, 8 tables
逻辑-解析-全能技术报告
机构 * Alibaba Group(阿里巴巴集团)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.AI
AI总结 本文提出Omni Parsing框架,通过三级层次结构实现多模态解析,整合整体检测、细粒度识别和多级解释,构建证据锚定机制以提升逻辑推理能力,释放Logics-Parsing-Omni模型并发布评估基准。
JoyStreamer: 通过和谐的文本-音频条件化解锁高度表达性的化身
机构 * JD Technology(京东科技)
专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV
AI总结 本文提出JoyAvatar框架,通过双教师增强训练算法和动态调节多模态条件,提升视频化身生成的自然性和时序一致性,优于现有模型并在多人群对话等复杂应用中表现突出。