arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-08-06 至 2025-08-06 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 4 篇

2508.02917 2025-08-06 cs.CV cs.AI cs.CL cs.RO 84%

Following Route Instructions using Large Vision-Language Models: A Comparison between Low-level and Panoramic Action Spaces

Vebjørn Haug Kåsene, Pierre Lison

机构 * University of Oslo(奥斯陆大学) Norwegian Computing Center(挪威计算中心)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments This paper has been accepted to ICNSLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03138 2025-08-06 cs.RO 78%

Language as Cost: Proactive Hazard Mapping using VLM for Robot Navigation

Mintaek Oh, Chan Kim, Seung-Woo Seo, Seong-Woo Kim

机构 * Seoul National University(首尔国立大学)

专题命中 GUI与屏幕智能体 :VLM(title);vision-language model(abstract)

Comments Accepted at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025. 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03298 2025-08-06 cs.SE 50%

GUI-ReRank: Enhancing GUI Retrieval with Multi-Modal LLM-based Reranking

Kristian Kolthoff, Felix Kretzer, Christian Bartelt, Alexander Maedche, Simone Paolo Ponzetto

专题命中 GUI与屏幕智能体 :MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03232 2025-08-06 cs.RO 50%

CookBench: A Long-Horizon Embodied Planning Benchmark for Complex Cooking Scenarios

Muzhen Cai, Xiubo Chen, Yining An, Jiaxin Zhang, Xuesong Wang, Wang Xu, Weinan Zhang, Ting Liu

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏