Adapter-Based Multi-Agent AVSR Extension for Pre-Trained ASR Models
机构 * Technische Hochschule Nuernberg(纽伦堡应用技术大学)
专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS
Comments Accepted at ICASSP 2025
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Technische Hochschule Nuernberg(纽伦堡应用技术大学)
专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS
Comments Accepted at ICASSP 2025
机构 * PRHLT Research Center, Universitat Politècnica de València(瓦伦西亚理工大学PRHLT研究中心) ; ValgrAI Valencian Graduate School and Research Network of Artificial Intelligence(瓦伦西亚ValgrAI人工智能研究生学院及研究网络) ; School of Communication, Universidad de Navarra(纳瓦拉大学传播学院)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
Journal ref Proceedings of the 17th International Conference on Agents and Artificial Intelligence (ICAART 2025), Porto, Portugal, February 23-25, 2025
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
Comments Technical Report
专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS
机构 * Zhejiang Lab(之江实验室) ; Li Auto(理想汽车) ; Harbin Institute of Technology(哈尔滨工业大学) ; Zhejiang University(浙江大学) ; Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
机构 * East China Normal University(华东师范大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
机构 * School of Artificial Intelligence and Advanced Computing, Xi’an Jiaotong-Liverpool University(西交利物浦大学人工智能与先进计算学院) ; Monash University(莫纳什大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
Comments 7pages
机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西交利物浦大学先进技术学院)
专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS
Comments Accepted at UIC 2024 proceedings. Accepted version
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS
Comments Accepted to ICASSP 2025
机构 * Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) ; Department of Automation Tsinghua University(清华大学自动化系)
专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS
机构 * Stanford University(斯坦福大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
Comments Project page: languageofmotion.github.io
机构 * Lund University(隆德大学) ; Arm(安谋科技) ; Sony(索尼) ; Tenstorrent
专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS
Comments IPIN 2024
机构 * Imperial College London(帝国理工学院) ; Technical University of Munich(慕尼黑工业大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI
Comments Accepted at CoRL 2024: Workshop on Lifelong Learning for Home Robots
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
Comments Outstanding paper at the ACL 2024 main conference
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
Comments 26 pages, 7 figures, accepted at NeurIPS 2024
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
Comments 8 pages, 13 figures, 4 tables
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
Comments Accepted by WACV 2025 in Round 1. First two authors contributed equally
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV
Comments Proceedings edited by Jorge Calvo-Zaragoza, Alexander Pacha and Elona Shatri
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
Comments 14 pages, 7 figures, 2 tables
Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 1st Workshop on Human Motion Generation, 2024, Seattle, Washington, USA
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV
Comments Accepted by ACM MM 2024
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
Comments Accepted at EMNLP'24 (Findings)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
Comments under review
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
Comments This work has been submitted to the IEEE for possible publication
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
Comments This work has been submitted to the IEEE for possible publication