arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-24 至 2025-09-24 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 4 篇

2509.18592 2025-09-24 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 75%

VLN-Zero: Rapid Exploration and Cache-Enabled Neurosymbolic Vision-Language Planning for Zero-Shot Transfer in Robot Navigation

Neel P. Bhatt, Yunhao Yang, Rohan Siva, Pranay Samineni, Daniel Milan, Zhangyang Wang, Ufuk Topcu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Codebase, datasets, and videos for VLN-Zero are available at: https://vln-zero.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18230 2025-09-24 cs.AI cs.LG 62%

Towards General Computer Control with Hierarchical Agents and Multi-Level Action Spaces

Zihan Dong, Xinyu Fan, Zixiang Tang, Yunqing Li

机构 * The University of Tokyo(东京大学) Lenovo US(联想美国) Advanced AI Technology Center(高级人工智能技术中心)

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18672 2025-09-24 cs.HC cs.AI 57%

NaviSense: A Multimodal Assistive Mobile application for Object Retrieval by Persons with Visual Impairment

Ajay Narayanan Sridhar, Fuli Qiao, Nelson Daniel Troncoso Aldas, Yanpei Shi, Mehrdad Mahdavi, Laurent Itti, Vijaykrishnan Narayanan

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Independent Researcher(独立研究者) University of Southern California(南加州大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18610 2025-09-24 cs.RO 50%

SINGER: An Onboard Generalist Vision-Language Navigation Policy for Drones

Maximilian Adang, JunEn Low, Ola Shorinwa, Mac Schwager

机构 * Department of Aeronautics and Astronautics, Stanford University(航空与航天系,斯坦福大学) Department of Mechanical Engineering, Stanford University(机械工程系,斯坦福大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏