Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization
通过代理-Q估计和分步策略优化构建自主GUI导航
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) ; Ovis Team, Alibaba Group(阿里团队,阿里巴巴集团)
专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.AI、cs.CV
AI总结 本文提出基于代理-Q估计和分步策略优化的GUI自主导航框架,通过强化学习提升GUI交互能力,实验证明其在导航和基准测试中表现优异。