Sema: Semantic Transport for Real-Time Multimodal Agents
Sema:面向实时多模态代理的语义传输
机构 * Pine AI
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM
AI总结 Sema通过结合离散音频分词与混合屏幕表示及突发性分组传输,有效降低带宽并保持任务准确性,解决多模态代理传输中的语义保真问题。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
Sema:面向实时多模态代理的语义传输
机构 * Pine AI
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM
AI总结 Sema通过结合离散音频分词与混合屏幕表示及突发性分组传输,有效降低带宽并保持任务准确性,解决多模态代理传输中的语义保真问题。
同步的音频-视觉多视角捕捉系统
机构 * Delft University of Technology(代尔夫特理工大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
AI总结 本文提出一种同步音频-视觉多视角捕捉系统,通过统一时间架构整合多摄像机和多通道麦克风,实现高质量的音频视频同步记录,支持对话行为的精细分析与建模。
多模态大语言模型中的乘法:文本、图像和音频输入的计算
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; National University of Singapore (NUS)(新加坡国立大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 研究多模态大语言模型在处理不同模态下的多数字乘法时的局限性,提出一个受控的多模态乘法基准,通过因子变化数字长度、稀疏性、表示形式和模态,定义算术负载作为总和和非零数字计数的乘积,揭示模型性能与算术负载的关系。
Comments To appear in ACL Findings (2026)
多模态数字传感用于早期生活阶段产蛋鸡的监测:整合热成像、音频、光流和环境数据的试点研究
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM
AI总结 本研究通过多模态传感整合热成像、音频、光流和环境数据,评估了早期产蛋鸡生理和行为发展特征,发现温度、声音和光流数据与年龄相关的变化,为精准养鸡的福利监测提供了基础。
Comments 29 pages, 11 figures, 5 Tables
GAMBIT:一种用于多模态大语言模型的游戏化突破框架
机构 * Georgia State University(佐治亚州立大学) ; Shandong University(山东大学) ; Nanyang Technological University, Singapore(新加坡南洋理工大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出GAMBIT框架,通过分解重组有害视觉语义并构建游戏化场景,使模型在探索和重建意图中主动完成突破,提升攻击成功率。
Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference
从多模态信号到自适应XR体验的降级训练
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM
AI总结 本文提出了一种多模态实时通信分析系统,用于自适应VR训练的基础交互层,整合了语音、手势、情感分析、脑电波和生理信号,通过同步技术实现用户意识和无意识沟通线索的连续评估,结合社会符号学和象征互动理论,构建了连接低层信号到冲突缓解的解释层。
Comments 16 pages, 5 figures, ACM Intelligent User Interfaces (IUI) Workshops 2026
多模态不确定推断的统一框架
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Human Language Technology Center of Excellence(人类语言技术卓越中心)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出UMUI框架,通过多模态数据生成校准的概率估计,引入CLUE模型实现跨模态细粒度概率推理,实验表明其在多种模态上表现优于基线模型。
Comments Update citations
跟踪听者注意力:基于注视的音频视觉语音增强框架
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
AI总结 本文提出基于注视的音频视觉语音增强框架,通过结合注视方向与面部检测提取目标说话人特征,提升多说话人环境中的语音增强效果。
Comments Accepted to IEEE ICASSP 2026
让 MLLMs 失明:MLLM 内容审核中的对抗走私攻击
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化研究所多模态人工智能系统国家重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京市多模态信息超智能安全重点实验室) ; Hellogroup ; University of Washington(华盛顿大学) ; Jilin University(吉林大学) ; ShanghaiTech University(上海科技大学)
专题命中 音频语音多模态 :MLLM(title);multimodal(abstract);分类 cs.CV
AI总结 本文揭示了MLLM在内容审核中面临的新威胁——对抗走私攻击,通过SmuggleBench基准测试发现多种模型易受攻击,提出通过感知和推理角度分析其根本原因并探索缓解策略。
Comments Accepted to ACL 2026. 19 pages, 6 figures
Thiomi数据集:一个大规模多模态语料库,用于低资源非洲语言
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 Thiomi数据集包含超过60万条文本注释和38.5万条音频记录,用于训练和评估ASR、MT和TTS模型,显著提升了非洲语言的语音识别性能。
MS-Mix:基于情感的自适应增强用于多模态情感分析
机构 * Chongqing Institute of Green Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究院) ; Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆学院) ; School of Engineering, Westlake University(西湖大学工学院)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出MS-Mix,一种基于情感的自适应增强框架,通过情感感知的样本选择策略、情感强度引导模块和情感对齐损失提升多模态情感分析的鲁棒性和实用性。
Comments Under Review
通过多模态深度扩展适应文本LLM到语音
机构 * Tohoku University(东北大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 本文提出多模态深度扩展方法,通过在冻结的文本LLM中插入新层并仅训练这些层来适应语音数据,实验表明其在ASR性能上接近全微调,且文本能力退化更少。
对多模态大语言模型的对抗攻击:全面综述
机构 * Google(谷歌) ; Bennett University, India(印度贝内特大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 本文综述了多模态大语言模型面临的对抗威胁,分析了攻击类型及其根源,提出分类框架以提升模型安全性。
Comments Survey paper, 37 pages, 10 figures, accepted at TMLR
Journal ref Transactions on Machine Learning Research, 2026
关键性标注:模态平衡与难度意识的多模态主动学习
机构 * Key Laboratory of Big Data and Artificial Intelligence in Transportation, Ministry of Education(北京交通大学计算机与信息技术学院;轨道交通控制与安全国家重点实验室;交通大数据与人工智能教育部重点实验室) ; State Key Laboratory of Advanced Rail Autonomous Operation(格拉斯哥大学心理与神经科学学院) ; School of Computer and Information Technology, Beijing Jiaotong University ; School of Psychology & Neuroscience, University of Glasgow
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出RL-MBA框架,通过强化学习实现多模态主动学习的模态平衡与难度意识,提升分类准确率和模态公平性。
不留死角:揭示深度伪造检测中的整体音频视觉内在一致性
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
AI总结 本文提出HAVIC方法,通过学习模态特定的结构一致性及跨模态微/宏观一致性,提升深度伪造检测的鲁棒性和泛化能力,实验表明其在跨数据集场景中性能提升显著。
超越仇恨:区分多模态内容审核中的不文明与不宽容言论
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 本文提出细粒度标注方案区分不文明与不宽容言论,通过2030个仇恨漫画数据验证,细粒度标注提升模型性能,减少有害内容误判。
Comments Preprint. Under review
选择性噪声抑制与判别互作用用于鲁棒音频视觉分割
机构 * Dalian University of Technology(大连理工大学) ; Yale University(耶鲁大学) ; University of Alberta(阿尔伯塔大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
AI总结 本文提出SDAVS方法,通过选择性噪声抑制处理器和判别音频视觉互融合策略,提升动态场景中音频视觉分割的鲁棒性与准确性。
Comments Accepted to IEEE Transactions on Multimedia (TMM) 2026. Code: https://github.com/happylife-pk/SDAVS
Journal ref IEEE Transactions on Multimedia (2026)
Memory Bear AI记忆科学引擎:多模态情感智能的技术报告
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出Memory Bear AI框架,通过结构化记忆处理提升多模态情感智能,实现持续、鲁棒的情感识别与应用。
喜剧表演中的时间:文本、音频、笑声、身体语言(TIC-TALK):用于喜剧时间多模态研究的管道和数据库
机构 * Centre Jean-Mabillon, École nationale des chartes, PSL, Paris, France(中心 Jean-Mabillon,国家档案学院,PSL,巴黎,法国) ; Laboratoire de Recherche, EPITA, Paris, France(研究实验室,EPITA,巴黎,法国) ; médialab, Sciences Po, Paris, France(媒体实验室,社会科学高等学院,巴黎,法国)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 本文介绍TIC-TALK数据库,通过5400多个时间对齐的主题片段,结合BERTopic、Whisper-AT、YOLOv8等技术,研究喜剧表演中的时间动态及观众反应。
一种用于Pepper机器人低延迟LLM驱动多模态交互的框架
机构 * Institute for Information Systems(信息系统研究所) ; University of Applied Sciences and Arts Northwestern Switzerland(西北瑞士应用科学与艺术大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出一个开源Android框架,通过端到端语音模型和功能调用能力,实现低延迟多模态交互,提升Pepper机器人的人机交互性能。
Comments 4 pages, 2 figures. To appear in Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (HRI '26), Edinburgh, Scotland, March 2026
EgoSpot:面向无手移动操作的视角多模态控制
机构 * Technical University of Munich(慕尼黑技术大学) ; ETH Zurich(苏黎世联邦理工学院) ; SJTU(上海交通大学) ; Microsoft(微软公司)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出一种基于微软HoloLens 2混合现实头显的无手控制框架,通过眼动、头部动作和语音指令融合实现机器人移动和机械臂操作的实时控制,提升无障碍交互体验。
语言模型是否将声音与意义关联?一种多模态研究声音象征主义
机构 * Yonsei University(延世大学) ; Seoul National University(首尔国立大学) ; Korea University(韩国大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 研究语言模型在多模态输入中对声音象征性的处理,通过分析不同语义维度下的音节注意力分数,揭示模型对声音与意义关联的理解机制。
Comments 33 pages, 27 tables, 10 figures, accepted to AAAI 2026 (Oral)
通过条件音频生成实现一致的音频视觉编辑
机构 * Sony AI(索尼人工智能) ; Sony Group Corporation(索尼集团)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM
AI总结 本文提出一种联合音频视觉编辑 pipeline,通过条件音频生成实现视频编辑与音频的协调一致,实验表明其在保持音频视觉一致性方面优于现有方法。
Comments Source code: https://github.com/SonyResearch/CoherentAVEdit
多模态情感回归:基于多目标优化和VAD感知音频建模的第10届ABAW EMI任务
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出多目标优化和VAD感知音频建模方法,用于改进Hume-Vidmimic2数据集上的情感模仿强度估计任务,通过多模态融合和共享回归头提升性能。
MoXaRt: 基于音频视觉对象的XR声音交互
机构 * Google Mountain View CA USA(谷歌山景城) ; University of Michigan Ann Arbor MI USA(密歇根大学安 Arbor分校) ; Columbia University New York NY USA(哥伦比亚大学) ; Google San Francisco CA USA(谷歌旧金山)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
AI总结 MoXaRt通过音频视觉线索分离交织声源,提升XR环境中的语音可懂度和社交参与度。
高效音频-视觉语音分离与离散唇语语义及多尺度全局-局部注意力
机构 * Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University, Beijing(计算机科学与技术系,人工智能研究院,BNRist,清华大学,北京) ; IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing(IDG/麦克戈文脑研究 institute,清华大学,北京) ; Chinese Institute for Brain Research (CIBR), Beijing(中国脑科学研究院(CIBR),北京)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
AI总结 Dolphin通过离散唇语语义和多尺度全局-局部注意力实现高效音频-视觉语音分离,提升分离质量和效率。
Comments Accepted to ICLR 2026
利用多模态和语言无关的句子嵌入进行抽象摘要
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 本文提出SBARThez框架,利用多模态和多语言句子嵌入提升抽象摘要的准确性与跨语言能力。
Comments Accepted at LREC 2026
基于查询引导的时空频交互的音乐音频视觉问答
机构 * University of Twente(特文特大学) ; University of Bath(巴斯大学) ; IT University of Copenhagen(哥本哈根IT大学)
专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract);分类 cs.CV
AI总结 本文提出一种查询引导的时空频交互方法,通过整合问题引导的线索和频域特性,提升音频-视觉问答的性能。
Comments Accepted to ICLR 2026
DLIOS:一种增强现实时间多模态交互增强叠加系统的大型语言模型增强系统,用于抖音直播
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS
AI总结 DLIOS通过LLM增强实时多模态交互增强系统,实现抖音直播中的弹幕、礼物效果和TTS广播的高效处理与优化。
Comments 14 pages, 13 figures, 6 tables, 7 algorithms, 16 references, submitted to ACM/IEEE International Conference on Systems and Software Engineering
认知假体:一种基于AI的多模态系统,用于知识工作中的事件回忆
机构 * Old Dominion University(老奥 Dominion 大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出了一种基于AI的多模态系统CPMS,通过结构化事件捕获和自然语言检索,支持知识工作中的事件回忆,同时保障隐私安全。
Comments CHI EA '26