RCI: A Score for Evaluating Global and Local Reasoning in Multimodal Benchmarks
机构 * Oracle AI
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted in EMNLP 2025
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Oracle AI
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted in EMNLP 2025
机构 * Stomatology Hospital, School of Stomatology, Zhejiang University School of Medicine, Zhejiang University, Hangzhou(牙科医院,口腔医学院,浙江大学医学院,浙江大学,杭州) ; College of Computer Science and Technology, Zhejiang University-University of Illinois Urbana-Champaign Institute, Zhejiang University, Hangzhou(计算机科学与技术学院,浙江大学-伊利诺伊大学 Urbana-Champaign 院,浙江大学,杭州) ; Department of Orthodontics, Shanghai Ninth People’s Hospital, College of Stomatology, Shanghai Jiao Tong University School of Medicine(正畸科,上海第九人民医院,口腔医学院,上海交通大学医学院) ; Angelalign Technology Inc.(Angelalign 技术公司)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Shanghai Innovation Institute(上海创新研究院) ; Zhongguancun Academy(中关村学院) ; Tencent(腾讯) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) ; Lehigh University(莱斯大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments Technical Report
机构 * University of Padova(帕多瓦大学) ; Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Örebro University(奥雷布罗大学) ; NVIDIA Research(NVIDIA研究)
专题命中 图文多模态 :multimodal(title,abstract)
Comments Project page: https://j-dapt.github.io/. 9 pages, 6 figures
机构 * University of Southern California(南加州大学) ; Amazon AGI(亚马逊人工智能实验室)
专题命中 图文多模态 :multimodal(title);分类 cs.CV
机构 * School of Engineering, Westlake University, Hangzhou, China(西湖大学工程学院) ; School of Cyberspace Security, Nanjing University of Science and Technology, Nanjing, China(南京理工大学网络安全学院)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构 * Shanghai Jiao Tong University(上海交通大学) ; Eastern Institute of Technology(东部技术研究所) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV
机构 * Korea University(韩国大学) ; University of Seoul(首尔大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments 23 pages, 17 figures
机构 * Fudan University(复旦大学) ; University of Southern California(南加州大学) ; ByteDance(字节跳动)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Peng Cheng Lab(鹏城实验室)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Comments 16 pages, 6 figures
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
机构 * Brown University(布朗大学) ; Tel Aviv University(特拉维夫大学) ; University of Tübingen(图宾根大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
机构 * Shenzhen Campus of Sun Yat-sen University, China(中山大学深圳校区) ; The National University of Singapore, Singapore(新加坡国立大学) ; National Key Laboratory of Science and Technology on Information System Security, China(信息系统安全科学技术国家重点实验室)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
机构 * Savitribai Phule Pune University (SPPU)(萨维特里·布尔大学(SPPU))
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Comments 10 pages, 12 figures. Code for MATS released at https://github.com/thubZ09/mats-spatial-reasoning