Cross-Modal Mutual Learning for Cued Speech Recognition
专题命中 音频语音多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、eess.AS
Comments Accepted to ICASSP2023
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、eess.AS
Comments Accepted to ICASSP2023
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted at NeurIPS 2022
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted as a spotlight presentation for the BMVC 2022. Code: https://github.com/v-iashin/SparseSync Project page: https://v-iashin.github.io/SparseSync
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments 5 pages, 2 figures, based on the work that won first place in the challenge of DCASE2021 Task 1B
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI、eess.AS
Comments Accepted to ICASSP 2022. H. Zhou et al
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、eess.AS
Comments 9 pages ,Figure 2, Table 5
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL、eess.AS
Comments Accepted: CVPRW
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Under submission as a conference paper. Video examples: https://youtu.be/ku9xoLh62E
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted by the 28th ACM International Conference on Multimedia (ACM MM 2020)
专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Dissertation at TU Wien
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL、cs.MM、eess.AS
Comments Presented at the 3rd Visually Grounded Interaction and Language (ViGIL) Workshop, NeurIPS 2019, Vancouver, Canada. arXiv admin note: substantial text overlap with arXiv:1812.08407, arXiv:1912.10132
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、eess.AS
Comments accepted by ICASSP2019
机构 * Tencent Youtu Lab(腾讯优图实验室) ; Nanjing University(南京大学) ; Xiamen University(厦门大学)
专题命中 音频语音多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CL、cs.AI;MLLM(comments)
Comments Training and Inference Codes: https://github.com/VITA-MLLM/VITA-Audio
机构 * University of Maryland, College Park(马里兰大学College Park分校) ; KAUST(卡尔斯兰大学) ; MBZUAI(马克斯·普朗克人工智能研究所) ; University of Toronto(多伦多大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
Comments Audio-visual learning, Audio-Visual RAG, Multi-Video Linkage
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS
Comments Project page: http://vision.cs.utexas.edu/projects/semantic-audio-visual-navigation
AV-EMO-Reasoning: 在具有视听线索的全模态大语言模型中基准测试情感推理能力
机构 * UC Berkeley(加州大学伯克利分校) ; South China University of Technology(华南理工大学) ; Zhejiang University(浙江大学) ; National Taiwan University(台湾大学) ; University of Southern California(美国南加州大学)
专题命中 音频语音多模态 :audio-visual(title);omni-modal(title);分类 cs.MM
AI总结 提出AV-EMO-Reasoning基准,通过合成和真实世界的视听对话数据集及情感感知与交互推理指标,系统评估全模态大语言模型的情感推理能力。
Valley3:面向电商的多模态大语言模型规模化
机构 * Valley Team, ByteDance Group(字节跳动集团山谷团队)
专题命中 音频语音多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);audio-visual(abstract)
AI总结 Valley3通过四阶段预训练管道,融合多模态能力与电商知识,实现跨模态指令跟随和长链推理,构建了涵盖6个任务的电商基准测试,展现出在电商场景中的优越性能。
ATIR:面向音频-文本交错上下文检索
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)
专题命中 音频语音多模态 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.AI
AI总结 本文提出ATIR任务,通过整合ASR、QA和检索数据集构建基准,解决现有音频检索数据集在语义检索上的局限,引入新的token压缩机制提升MLLM在ATIR中的性能。
机构 * Scientific Computing and Imaging Institute(科学计算与成像研究所) ; Department of Electrical and Computer Engineering(电气与计算机工程系) ; University of Utah(犹他大学)
专题命中 音频语音多模态 :cross-modal(title);audio-visual(title);分类 cs.CV
视听世界模型:为具身智能体奠定多感官想象的基础
机构 * Tsinghua University(清华大学) ; Beijing Institute of Technology(北京理工大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM
AI总结 提出视听世界模型(AVWM)统一框架,通过条件扩散Transformer(AV-CDiT)联合预测双耳音频与视觉动态,在30小时基准AVW-4k上实现高保真多模态预测,并验证其在具身导航中的有效性。
用于抑郁症检测的多模态域泛化:基于注意力的双向长短期记忆网络与域对抗训练
机构 * University of Milan(米兰大学) ; Gran Sasso Science Institute (GSSI)(大萨索科学研究所)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI
AI总结 研究针对深度学习抑郁症检测泛化受限问题,提出含域泛化的多模态检测框架,集成BiLSTM与注意力机制,用梯度反转层增强泛化,实验表明该方法提升了准确率和F1分数,超越现有基准,消融研究突出各因素贡献。
Comments 12 pages, 8 figures, 6 tables. Accepted for publication in IEEE Transactions on Neural Networks and Learning Systems (TNNLS)
用于社交机器人对话轮次转换的多模态语音活动投影及与语音活动相关的预训练编码器
机构 * i Intelligent Insights(4i智能洞察公司) ; Universidad de Sevilla(塞维利亚大学) ; Universidad Pablo de Olavide(巴勃罗·德奥拉维德大学) ; Honda Research Institute Japan(本田日本研究所)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL、cs.AI
AI总结 研究社交机器人对话轮次转换,提出多模态语音活动投影框架,基于预训练视听主干并经低秩适应,结合说话人间注意力及语义一致性损失,实验表明该方法优于基线,适用于调解型人机交互。
Comments Accepted for presentation at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026). Acceptance notification date: 30 May 2026. Final published version pending
通过生成的多语言转录本的蒸馏和跨模态集成进行音频情感分析
机构 * University of Bucharest(布加勒斯特大学) ; PPC Romania(罗马尼亚PPC)
专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI
AI总结 研究语音情感分析难题,提出通过跨模态变压器集成音频与文本信息的多模态方案,经自动语音识别生成转录本并翻译为多语言文本,还进行知识蒸馏,实验证明该方法能提升多模态情感分类性能及增强单模态音频模型。
Comments Accepted at KES 2026
Q-TriM:用于视听问答的问题引导三模态注意力
机构 * Dept. of Computer Science and Engineering(计算机科学与工程系)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 研究视听问答问题,提出Q-TriM以浅并行方式进行多模态融合,引入基于文本的视频和音频注意力操作框架,避免深度堆叠融合的问题,在三个基准测试中达最优性能。
Comments Accepted at ECCV 2026
通过解耦音频语义实现延迟双向对齐的音频视觉分割
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Peking University(北京大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS
AI总结 本文提出DDAVS方法,通过解耦音频语义和延迟双向对齐解决音频视觉分割中的多源纠缠和视听错位问题,实验表明其在多种场景下均取得最优性能。
Comments Accepted by ECCV 2026
AVOC:通过检索启发的令牌压缩增强全模态大语言模型中的小时级音视频理解
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) ; Huawei Inc.(华为技术有限公司)
专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL
AI总结 提出AVOC框架,通过检索启发的令牌压缩模块,将多模态令牌压缩视为top-K检索问题,结合相关性、重要性和多样性三个标准,实现长时音视频理解,在小时级基准上取得最优性能。
注意力谱正则化:无回放的连续多模态大语言模型
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Sun Yat-sen University(中山大学) ; Nanyang Technological University(南洋理工大学) ; Renmin University of China(中国人民大学) ; Tsinghua University(清华大学)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出注意力谱正则化(ASR),一种无回放的连续学习框架,通过存储技能级交叉注意力原型分布并施加谱正则化约束,有效缓解多模态大语言模型在连续微调中的灾难性遗忘。