PerPilot: Personalizing VLM-based Mobile Agents via Memory and Exploration
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision language model(abstract);分类 cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision language model(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :VLM(title);vision-language model(abstract);分类 cs.CV
机构 * Nanyang Technological University(南洋理工大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI
Comments Project website is at: https://denghaoyuan123.github.io/SafeBimanip/
机构 * Stanford University(斯坦福大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) ; Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港科学与创新研究院人工智能与机器人中心) ; School of Computer and Information Engineering, Xiamen University of Technology(厦门理工大学计算机与信息工程学院)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV、cs.LG
Comments Preprint
机构 * Kunming University of Science and Technology(昆明理工大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV