Improving Vision-Language-Action Model with Online Reinforcement Learning
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Accepted to ICRA 2025
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Accepted to ICRA 2025
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Preprint
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted at NeurIPS 2023
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.LG
Comments 16 Pages, 10 Figures
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
Comments Technical Report. Github: https://github.com/showlab/ShowUI
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI、cs.LG
Comments 18 pages, 3 figures, an abridged version to appear in NeurIPS 2024 AFM Workshop
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
Comments Accepted to EMNLP 2024 main conference
Journal ref https://aclanthology.org/2024.emnlp-main.310/
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments CoRL LangRob Workshop, 2024
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI、cs.LG
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI、cs.LG
Comments 25 pages, 16 figures
Journal ref CoRL 2024
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
Comments Paper accepted by IROS 2024
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI、cs.LG
Comments Published at 3rd Conference on Lifelong Learning Agents (CoLLAs), 2024
专题命中 GUI与屏幕智能体 :visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments V3: Fixed typo in Fig.1; V2: Minor formatting changes and added missing subfigure captions
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI、cs.LG
Comments Project page with code & videos: https://helper-agent-llm.github.io
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.LG
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.LG
Comments CVPR 2023
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
Journal ref Entropy 2022
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
Comments This paper has been accepted for publication at IEEE RA-L
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
Comments workshop paper at BAICS at ICLR 2020
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
Comments CVPR 2019 Oral
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
Comments ICLR 2019, code is available at https://github.com/chihyaoma/selfmonitoring-agent
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
Comments 21 pages, 7 figures, with supplementary material
专题命中 GUI与屏幕智能体 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments CVPR 2018 Spotlight presentation
专题命中 GUI与屏幕智能体 :grounding(abstract,comments);分类 cs.AI
Comments Accepted at the 1st Workshop on Language Grounding for Robotics at ACL 2017
视觉-语言-动作模型中用于令牌压缩的刚可察觉差异建模
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Nanyang Technological University(南洋理工大学) ; Bytedance Inc.(字节跳动公司) ; Shandong University(山东大学) ; CNRS(法国国家科学研究中心) ; CentraleSupelec(中央理工学院) ; Université Paris-Saclay(巴黎萨克雷大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
AI总结 本文针对视觉-语言-动作模型的令牌压缩问题,提出Action-JND方法,通过动作容忍度准则优化压缩,在LIBERO基准实验中提升了激进压缩下的压缩可靠性。
Comments 15 pages, 5 figures
看起来对,运行起来对:面向多屏移动应用生成的项目级基准测试
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI
AI总结 针对现有设计转代码基准的局限,提出首个项目级多屏移动应用生成基准MobileForge,通过五轴评估及两种测试方法,发现前沿多模态LLM构建的应用存在导航、保真度和可维护性问题。
Comments Accepted by EMNLP 2026 Main