arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-13 至 2026-01-13 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 2 篇

2601.06031 2026-01-13 cs.HC cs.AI 79%

Beyond Clicking:A Step Towards Generalist GUI Grounding via Text Dragging

超越点击:通过文本拖动实现通用GUI定位的一步

Zeyi Liao, Yadong Lu, Boyu Gou, Huan Sun, Ahmed Awadallah

机构 * The Ohio State University(俄亥俄州立大学) Microsoft Research, Redmond(微软研究院(红mond))

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.AI

AI总结 本文提出GUI-Drag数据集和ScreenDrag基准,通过文本拖动提升GUI定位能力,实现更通用的GUI交互模型。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01149 2026-01-13 cs.AI 57%

A3: Android Agent Arena for Mobile GUI Agents with Essential-State Procedural Evaluation

A3: 用于移动GUI代理的Android代理竞技场:基于本质状态的程序评估

Yuxiang Chai, Shunye Tang, Han Xiao, Weifeng Lin, Hanhao Li, Jiayu Zhang, Liang Liu, Pengxiang Zhao, Guangyi Liu, Guozhi Wang, Shuai Ren, Rongduo Han, Haining Zhang, Siyuan Huang, Hongsheng Li

机构 * Nankai University(南开大学) vivo AI Lab(vivo 人工智能实验室) SJTU(上海交通大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 A3提出了一种基于本质状态的程序评估系统,通过动态在线应用的100个任务基准和工具包,提升移动GUI代理的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏