SOLIDGEO: Measuring Multimodal Spatial Math Reasoning in Solid Geometry
专题命中 视觉推理 :multimodal large language model(abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :multimodal large language model(abstract)
机构 * Department of Computer Science and Engineering Bangladesh University of Engineering and Technology (BUET)(计算机科学与工程系,孟加拉国工程与技术大学) ; Statistics, Islamic University, Bangladesh(统计学,伊斯兰大学,孟加拉国) ; Faculty of Information Technology, Monash University, Melbourne, Australia(信息科技学院,墨尔本大学,澳大利亚) ; Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)
专题命中 视觉推理 :visual reasoning(abstract)
Comments ICML 2025 (Spotlight)
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Georgia Institute of Technology(佐治亚理工学院) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 视觉推理 :vision-language model(abstract)
Comments Accepted by ACL 2025 Findings
机构 * State Key Laboratory for Multimedia Information Processing, PKU-Anker LLM Lab(多媒体信息处理国家重点实验室,PKU-Anker LLM实验室) ; School of Computer Science, Peking University(北京大学计算机学院) ; HKUST(香港科技大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of Washington(华盛顿大学)
专题命中 视觉推理 :multimodal large language model(abstract)
Comments ACL 2025 Main Conference
机构 * Hanyang University(翰阳大学)
专题命中 视觉推理 :multimodal large language model(abstract)
Comments ACL 2025
机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) ; Graduate School of Metaverse, KAIST(元宇宙研究生院,韩国科学技术院) ; Graduate School of Culture Technology, KAIST(文化科技研究生院,韩国科学技术院)
专题命中 视觉推理 :grounding(abstract)
Comments ACL 2025
机构 * HKU(香港大学) ; TeleAI ; THU(清华大学) ; SJTU(上海交通大学) ; HKU Shanghai Intelligent Computing Center(香港大学上海智能计算中心)
专题命中 视觉推理 :visual reasoning(abstract)
机构 * IDEA Research, International Digital Economy Academy(IDEA研究院,国际数字经济学院) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; DataArc Tech Ltd.(DataArc科技有限公司) ; Hithink RoyalFlush Information Network Co., Ltd(Hithink皇家Flush信息网络有限公司)
专题命中 视觉推理 :grounding(abstract)
机构 * School of Computer Science and Engineering(计算机科学与工程学院) ; School of Systems Science and Engineering(系统科学与工程学院) ; School of Artificial Intelligence(人工智能学院)
专题命中 视觉推理 :grounding(abstract)
专题命中 视觉推理 :LLaVA(abstract)
专题命中 视觉推理 :multimodal large language model(abstract)
机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University China(清华大学人工智能对话组,国防科技大学,清华大学)
专题命中 视觉推理 :vision-language model(abstract)
专题命中 视觉推理 :multimodal large language model(abstract)
Comments Accepted at CHI 2025 Late Breaking Work
Journal ref Proceedings of the Extended Abstracts of the CHI Conference on Human Factors in Computing Systems, 2025, Article No. 535, Pages 1-6
专题命中 视觉推理 :multimodal large language model(abstract)
Comments This thesis was conducted under the guidance of Mohsen Amini Salehi. Special thanks to Minseo Kim and Jacob Bradshaw for their valuable contributions and support throughout the research process. 60 pages, 13 Figures, 2 Tables
机构 * Taobao & Tmall Group of Alibaba Beijing China(阿里巴巴北京公司)
专题命中 视觉推理 :multimodal large language model(abstract)
Comments 10 pages, 8 figures
专题命中 视觉推理 :multimodal large language model(abstract)
Comments Accepted by the Information Fusion Journal
专题命中 视觉推理 :multimodal large language model(abstract)
专题命中 视觉推理 :vision-language model(abstract)
Comments 12 pages
专题命中 视觉推理 :grounding(abstract)
Comments Preprint
专题命中 视觉推理 :multimodal large language model(abstract)
专题命中 视觉推理 :grounding(abstract)
Comments Accepted at NAACL KnowledgeNLP 2025
专题命中 视觉推理 :vision language model(abstract)
专题命中 视觉推理 :vision-language model(abstract)
专题命中 视觉推理 :multimodal large language model(abstract)
Comments NAACL 2025
专题命中 视觉推理 :visual reasoning(abstract)
专题命中 视觉推理 :multimodal large language model(abstract)
专题命中 视觉推理 :VLM(abstract)
Comments Authors' submitted version before final edits. Published in Nature Machine Intelligence on January 27, 2025: https://www.nature.com/articles/s42256-024-00975-8
Journal ref Nat Mach Intell (2025)
专题命中 视觉推理 :grounding(abstract)
专题命中 视觉推理 :VLM(abstract)
Comments Accepted to IROS 2024
专题命中 视觉推理 :multimodal large language model(abstract)
Comments 38th Conference on Neural Information Processing Systems (NeurIPS 2024)