Teaching RL Agents to Act Better: VLM as Action Advisor for Online Reinforcement Learning
机构 * Wuhan University(武汉大学)
专题命中 GUI与屏幕智能体 :VLM(title);vision-language model(abstract);分类 cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Wuhan University(武汉大学)
专题命中 GUI与屏幕智能体 :VLM(title);vision-language model(abstract);分类 cs.AI、cs.LG
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments CoRL 2025. Project website: https://reasonnav.github.io/
机构 * Dekun Lu ∗ , Wei Gao ∗ and Kui Jia ∗(作者)
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI、cs.LG
Comments First two authors contribute equally. Project page: https://sites.google.com/view/imaginationpolicy
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI
Comments 17 pages, 12 figures
机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(智能空间机器人实验室,数字工程中心,斯克尔科夫科学与技术研究所)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
机构 * The ADAPT SFI Research Centre(ADAPT SFI研究机构) ; School of Computer Science, University College Dublin(大学学院计算机科学系) ; Amazon Development Center Germany GmbH(亚马逊德国开发中心) ; Beijing-Dublin International College(北京-都柏林国际学院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
Comments 6 pages, 3 figures