WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构 * Sun Yat-sen University(中山大学) ; Lanzhou University(兰州大学) ; University of Hong Kong(香港大学) ; Hefei University of Technology(合肥工业大学) ; National University of Singapore(新加坡国立大学)
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV
机构 * Skywork AI(Skywork人工智能公司) ; Kunlun Inc.(昆仑公司)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * Microsoft Research(微软研究院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) ; Nanjing University(南京大学)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG
机构 * Department of Computer Science, Stony Brook University(计算机科学系,石板溪大学)
专题命中 视觉推理 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments 9 pages, 7 figures
机构 * Department of Computer Science, Yale University(耶鲁大学计算机科学系) ; Department of Computer Science, Brown University(布朗大学计算机科学系) ; School of Data Science, Fudan University(复旦大学数据科学学院) ; Shanghai Key Laboratory of Data Science(上海数据科学关键实验室) ; Datawiz LLC
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.LG
Comments Accepted to the Findings of the Association for Computational Linguistics (ACL 2025)
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; NVIDIA
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
Comments CVPR 2025. Project Page: https://yunzeman.github.io/argus/
机构 * Selftok Team(Selftok团队) ; Media Technology Institute(媒体技术研究所) ; Huawei(华为)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments 9 pages, 4 figures
机构 * School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) ; MOE KLINNS Lab, Xi’an Jiaotong University(教育部KLINNS实验室,西安交通大学) ; Zhongguancun Academy, Beijing(中关村学院,北京) ; Lenovo Research(联想研究)
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV
Comments 23 pages, 9 figures
专题命中 视觉推理 :visual reasoning(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.CV
Comments Github : https://github.com/mbzuai-oryx/ARB, Huggingface: https://huggingface.co/datasets/MBZUAI/ARB
机构 * School of Computer Science, Peking University(北京大学计算机学院) ; Department of Automation, Tsinghua University(清华大学自动化系) ; BeingBeyond
专题命中 视觉推理 :vision language model(abstract);VLM(abstract);分类 cs.CV
机构 * School of Remote Sensing and Information Engineering, Wuhan University(遥感与信息工程学院,武汉大学)
专题命中 视觉推理 :grounding(abstract);MLLM(abstract);分类 cs.CV
机构 * The Hong Kong Polytechnic University(香港理工大学) ; HKUST(香港科技大学) ; HKUST(GZ)(香港科技大学(广州))
专题命中 视觉推理 :visual question answering(abstract);MLLM(abstract);分类 cs.CV
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Lab(虎扑实验室) ; Zhejiang University(浙江大学) ; Singapore University of Technology and Design(新加坡科技设计大学)
专题命中 视觉推理 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments Home page: https://alibaba-damo-academy.github.io/VCBench/
专题命中 视觉推理 :vision-language model(abstract);visual language model(abstract);分类 cs.CV
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
Comments 10 pages, 5 figures
专题命中 视觉推理 :VLM(abstract);visual language model(abstract);分类 cs.AI
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.CV
Comments Project website: https://glab-caltech.github.io/vadar/
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.LG
专题命中 视觉推理 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
Comments 8 pages, 4 figures, 3 tables, github: https://github.com/ayesha-ishaq/DriveLMM-o1
专题命中 视觉推理 :InternVL(abstract);multimodal large language model(abstract);分类 cs.CV
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
专题命中 视觉推理 :LLaVA(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
Journal ref 30th International Conference on Intelligent User Interfaces (IUI'25), March 24-27, 2025, Cagliari, Italy. ACM, New York, NY, USA, 16 pages