MUCAR: Benchmarking Multilingual Cross-Modal Ambiguity Resolution for Multimodal Large Language Models
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(title,abstract);image-text(abstract);分类 cs.CL
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(title,abstract);image-text(abstract);分类 cs.CL
机构 * School of Internet, Anhui University, Hefei, China(安徽大学互联网学院) ; School of Computer Science and Information Engineering, Hefei University of Technology, Hefei, China(合肥工业大学计算机科学与信息工程学院) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center, Hefei, China(合肥综合国家科学中心人工智能研究院) ; Department of Computer Science, Hong Kong Baptist University, Hong Kong, China(香港 Baptist 大学计算机科学系)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; ByteDance(字节跳动) ; The University of Queensland(昆士兰大学) ; University of Southern California(南加州大学) ; University at Buffalo(布法罗大学) ; University of California, Merced(加州大学默塞德分校)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments Accepted to COLM 2025
机构 * University College London(伦敦大学学院) ; Institut Pasteur(巴斯德研究院)
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
Comments 9 pages, 6 figures. Accepted for publication in the Proceedings of the Artificial Life Conference 2025 (MIT Press)
机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI
机构 * Key Laboratory of Pervasive Computing, Tsinghua University(清华大学普适计算重点实验室) ; The University of New South Wales(新南威尔士大学) ; SKLSDE Lab, Beihang University(北航SKLSDE实验室)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
专题命中 图文多模态 :cross-modal(abstract)
机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) ; No. 59 Middle School of Urumqi(乌鲁木齐市第五十九中学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments Main paper (8 pages). Accepted for publication by ECAI( European Conference on Artificial Intelligence) 2025
机构 * University of Maryland, College Park(马里兰大学 College Park 分校)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.MM
机构 * Tsinghua University(清华大学) ; University of Cambridge(剑桥大学) ; ByteDance(字节跳动)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.CL
机构 * University of Southern California(南加州大学) ; University of Queensland(昆士兰大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; University of Buffalo(布法罗大学) ; University of California, Merced(加州大学默塞德分校)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
Comments 23 pages, 2 figures, 2 tables
机构 * CUHK MMLab(香港中文大学多媒体实验室) ; SenseTime Research(商汤科技研究院) ; CPII under InnoHK(创新香港下的CPII)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
机构 * Meta Reality Labs Research(Meta现实实验室)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV
Comments Accepted to IJCV
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; AMAP Speech(AMAP语音)
专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS
Comments conference paper about TTS
机构 * ByteDance(字节跳动)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
Comments Project Page at https://byteaigc.github.io/X-Streamer
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Sichuan University(四川大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of Macau(澳门大学) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
Comments 34 pages
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
Comments The version accepted for publication at International Journal of Human-Computer Studies
Journal ref International Journal of Human-Computer Studies (2025)
机构 * INSPER Institute of Teaching and Research(INSPER教学与研究机构) ; Research University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校研究大学)
专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS
机构 * SETLabs Resarch GmbH(SETL实验室)
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments 11 pages, 3 figures
机构 * Institute of Neuroinformatics, University of Zurich(神经信息学研究所,苏黎世大学) ; ETH Zurich(苏黎世联邦理工学院) ; Digital Society Initiative, University of Zurich(数字社会倡议,苏黎世大学) ; Department of Geography(地理系)
专题命中 视频多模态 :multimodal(title,abstract)
Comments 8 pages
机构 * School of Computer Science and Technology, Anhui University(计算机科学与技术学院,安徽大学)
专题命中 视频多模态 :multi-modal(abstract,comments);cross-modal(abstract);分类 cs.CV、cs.AI
Comments The First Work that Exploits Multi-modal Knowledge Graph for Pedestrian Attribute Recognition
机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; Peking University(北京大学) ; Nanjing University(南京大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) ; School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
Comments *Corresponding authors: Min Zhu (min.zhu@scu.edu.cn) and Junlong Cheng (jlcheng@scu.edu.cn)
机构 * HKUST (GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; HIT(哈尔滨工业大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; University of Central Florida(中央佛罗里达大学) ; Cisco Research(思科研究)
专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
机构 * Korea University(韩国大学) ; Sungkyunkwan University(全北大学) ; Hanwha Systems(韩华系统)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL
Comments Project Page: https://vatkg.github.io/
机构 * The HongKong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; University of Amsterdam(阿姆斯特丹大学) ; Vrije Universiteit Amsterdam(自由大学)
专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted by ACMMM-25
机构 * Fudan University(复旦大学) ; Tsinghua University(清华大学) ; Bytedance(字节跳动)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI