Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title,abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title,abstract);分类 cs.CV、cs.AI
机构 * SandLogic Technologies Pvt Ltd(沙德逻辑技术 Pvt Ltd)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * UC Santa Barbara(加州大学圣芭芭拉分校) ; Amazon Stores Foundational AI(亚马逊商店基础人工智能) ; UC San Diego(加州大学圣地亚哥分校)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments EMNLP 2025 Findings
机构 * DP Technology(DP技术公司) ; Shanghai Jiao Tong University(上海交通大学) ; East China Normal University(华东师范大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG
机构 * University of Waterloo(滑铁卢大学) ; Sea AI Lab(Sea AI 实验室) ; University of Toronto(多伦多大学) ; Shanghai University(上海大学) ; HKUST(香港科技大学) ; M-A-P ; National University of Singapore(新加坡国立大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
Comments 32 pages, 5 figures, 13 tables
机构 * Stanford University(斯坦福大学) ; Jet Propulsion Laboratory(喷气推进实验室) ; California Institute of Technology(加州理工学院)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University(网络安全科学与工程学院,西安交通大学) ; School of Artificial Intelligence, Shandong University(人工智能学院,山东大学) ; School of Automation, Guangdong University of Technology(自动化学院,广东技术大学) ; College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI
Comments 25 pages,10 figures, 10 tables. Accepted by IEEE TCCN in Oct. 2025
机构 * School of Software, Tsinghua University(清华大学软件学院) ; BNRist, Tsinghua University(清华大学BNRist) ; Meituan Inc.(美团公司) ; Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
Comments NeurIPS 2025 Camera-ready Version
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉推理 :multimodal large language model(abstract)
Comments 20 pages, 13 figures