SE-VLN: A Self-Evolving Vision-Language Navigation Framework Based on Multimodal Large Language Models
专题命中 GUI与屏幕智能体 :multimodal large language model(title);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 GUI与屏幕智能体 :multimodal large language model(title);分类 cs.CV、cs.AI
机构 * Zhixuan Shen, Haonan Luo, Kexun Chen, Fengmao Lv, Tianrui Li(作者)
专题命中 GUI与屏幕智能体 :vision language model(abstract)
Comments 16 pages, 10 figures, Extended Version of accepted AAAI 2025 Paper