Self-Supervised Audio-and-Text Pre-training with Extremely Low-Resource Parallel Data
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS
Comments AAAI 2022
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS
Comments AAAI 2022
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV
Comments Accepted at CVPR 2022
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV
Comments Accepted to CVPR 2022
专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 eess.AS
Comments Erratum: Due to a bug in the evaluation script, the correct average distance (aD) metric is here reported in yellow. The analysis remains unchanged from the original paper as the trend between the old and new measures are perfectly monotonic. The bug was caused by an incorrect normalization factor
Journal ref IEEE 23rd International Workshop on Multimedia Signal Processing (MMSP), 2021
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 eess.AS
Comments 19 pages, 11 figures
Journal ref Published in Expert Systems With Applications, 2021
专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);分类 eess.AS
Journal ref Frontiers in Computer Science, 08 April 2021
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV
Comments Accepted to BMVC2021. Project page: https://sites.google.com/view/bmvc2021stm
专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV
专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 eess.AS
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments ICASSP 2021 (Accepted)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV
Comments To appear in CVPR 2021
专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
Comments IEEE Conf. on Computer Vision and Pattern Recognition (CVPR), 2021 Code : https://github.com/AyanKumarBhunia/Self-Supervised-Learning-for-Sketch
专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
Comments MICCAI 2020 (early acceptance)
专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV
Comments 11 pages
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 eess.AS
Comments in IEEE/ACM Transactions on Audio, Speech, and Language Processing (to appear)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CL
Comments Presented at the Visual Question Answering and Dialog Workshop, CVPR 2019, Long Beach, USA. arXiv admin note: substantial text overlap with arXiv:1912.10131
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS
Comments This extended version of a ICASSP 2020 submission under same title has an added figure and additional discussion for easier consumption
专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 eess.AS
Comments arXiv admin note: substantial text overlap with arXiv:1909.10407
专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 eess.AS
Comments Accepted to ASRU 2019
专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV
Comments Published in CVPR 2019, project page: http://vision.cs.utexas.edu/projects/2.5D_visual_sound/
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CL
Comments 7 pages, 2 figures, DSTC7 workshop at AAAI 2019
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 5 pages and 3 figures
Journal ref IEEE Xplore (ICASSP) (2017) 5020-5024
专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CL
专题命中 音频语音多模态 :audio-visual(abstract,comments);分类 cs.CV、cs.MM、eess.AS
Comments Submitted to ICASSP 2023. SOTA performance in Audio-Visual Sound Localization. 5 Pages
专题命中 音频语音多模态 :multimodal(abstract,journal_ref);分类 cs.CV、cs.CL、cs.AI
Comments Paper accepted for publication at MMSR 2021; 10 pages, 5 figures
Journal ref Proceedings of the 1st Workshop on Multimodal Semantic Representations (MMSR), 2021, Groningen, Netherlands (Online), Association for Computational Linguistics, p. 1--10
当文本误导时:面向音频接地对话的不一致感知推理
机构 * Center for Language and Speech Processing, Johns Hopkins University(约翰霍普金斯大学语言与语音处理中心)
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
AI总结 本研究针对口语对话理解中基于转录本的捷径问题,构建了含501个问题的受控基准ContraTalk,提出Audio Twin智能体式推理框架,可提升冲突问答案例的准确率并减少文本偏向陷阱选择。
Comments 24 pages, 4 figures
ONOTE:面向专家级音乐智能的多模态记谱处理基准测试
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Nanyang Technological University(南洋理工大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS
AI总结 本文提出ONOTE基准测试,通过确定性流程消除记谱系统偏差,揭示多模态模型在感知准确性和音乐理论理解间的根本分歧。
AME:一种高效的异构代理记忆引擎用于智能手机
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract)
AI总结 AME是一种为智能手机设计的高效异构代理记忆引擎,通过硬件感知的矩阵流水线和调度方案提升内存处理效率,实现更高吞吐量和更低延迟。
Comments Accepted by the 34th ACM International Conference on Multimedia (MM '26). 9 pages, 11 figures
大型音频语言模型综述:通用性、可信度与展望
机构 * Nanyang Technological University(南洋理工大学) ; Independent Researcher(独立研究者) ; The University of Melbourne(墨尔本大学) ; North China Electric Power University(华北电力大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; University of Science and Technology of China(中国科学技术大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Shanghai AI Laboratory(上海人工智能实验室) ; Huazhong University of Science and Technology(华中科技大学) ; Tsinghua University(清华大学) ; Fortemedia Singapore(富媒体新加坡) ; Tencent(腾讯) ; Fudan University(复旦大学) ; Wuhan University(武汉大学) ; Chinese University of Hong Kong(香港中文大学) ; Chongqing University of Posts and Telecommunications(重庆邮电大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract)
AI总结 本文综述了大型音频语言模型的通用性、可信度及未来发展方向,探讨了其架构创新、对齐算法及安全风险,并提出了防御深入、因果音频世界建模等策略以提升音频智能的可信度。