Following Route Instructions using Large Vision-Language Models: A Comparison between Low-level and Panoramic Action Spaces
机构 * University of Oslo(奥斯陆大学) ; Norwegian Computing Center(挪威计算中心)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments This paper has been accepted to ICNSLP 2025