English Pronunciation Evaluation without Complex Joint Training: LoRA Fine-tuned Speech Multimodal LLM
机构 * Enuma, Inc.(Enuma公司) ; Korea University(韩国大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Enuma, Inc.(Enuma公司) ; Korea University(韩国大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL
专题命中 多模态评测 :MLLM(title);multimodal(abstract);分类 cs.CV
机构 * Department of Engineering Science, University of Oxford(工程科学系,牛津大学) ; Department of Geotechnical Engineering, College of Civil Engineering, Tongji University(地质工程系,同济大学土木学院) ; Construction Engineering, University of Cambridge(建设工程,剑桥大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
机构 * Keio University(庆应大学) ; NVIDIA(英伟达)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted to ICCV Workshop 2025
机构 * College of Software Technology, Zhejiang University(浙江大学软件技术学院) ; College of Computer Science, Zhejiang University(浙江大学计算机科学学院)
专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学)
专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV
Comments The dataset and code used in this submission is available at: https://ucf-crcv.github.io/GAEA/
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学) ; Tsinghua University(清华大学) ; Ant Group(蚂蚁集团) ; Alibaba Group(阿里巴巴集团)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI
机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of Nottingham(诺丁汉大学) ; University of Sydney(悉尼大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
Comments 18 pages, 6 figures. Accepted Chinese Conference on Pattern Recognition and Computer Vision 2025
机构 * Shanghai Key Laboratory of Intelligent Sensing and Recognition(上海智能感知与识别重点实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Center of Digital Innovation(数字创新中心)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
Comments This work has been submitted to the IEEE for possible publication