CLASP: Cross-modal Salient Anchor-based Semantic Propagation for Weakly-supervised Dense Audio-Visual Event Localization
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
机构 * Imperial College London(伦敦帝国学院)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted to IEEE ASRU 2025
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Project page: https://github.com/jasongief/TGS-Agent
机构 * Great Bay University(大亚湾大学) ; Nanyang Technological University(南洋理工大学)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV
Comments Accepted by Workshop SVC of ACM MM 2025
机构 * Department of Computer Science, The University of Texas at Dallas(计算机科学系,德克萨斯大学达拉斯分校)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV
机构 * AImotion Bavaria Technische Hochschule Ingolstadt(巴伐利亚AImotion技术大学)
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.AI、cs.MM
Comments 5 pages and 4 figures
机构 * DISI, University of Bologna(DISI,博洛尼亚大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI
Comments 12th Workshop on Argument Mining (ArgMining 2025) @ ACL 2025
Journal ref In Proceedings of the 12th Argument mining Workshop (ArgMining 2025), pages 388-397, Vienna, Austria
机构 * Australian Institute for Machine Learning, University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学) ; Sony Group Corporation(索尼集团) ; Sony AI, Sony Group Corporation(索尼人工智能,索尼集团)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
Comments 9 pages
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.MM、eess.AS
Comments Project page: https://ali-vosoughi.github.io/SoundCLIP/
机构 * Brown University(布朗大学) ; University of California at Berkeley(加州大学伯克利分校) ; University of Central Florida(中央佛罗里达大学) ; Dolby Laboratories(杜比实验室)
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 eess.AS
Comments Updated abstract
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
Comments 3 pages, 2 tables, submitted for arXiv preprint