arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-08 至 2026-01-08 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 3 篇

2601.03928 2026-01-08 cs.CV cs.AI cs.CL cs.HC 84%

FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selection

FocusUI: 通过位置保持的视觉标记选择实现高效的UI接地

Mingyu Ouyang, Kevin Qinghong Lin, Mike Zheng Shou, Hwee Tou Ng

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 FocusUI通过位置保持的视觉标记选择实现高效UI接地,有效减少冗余标记并保持位置连续性,提升推理效率和性能。

Comments 14 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03956 2026-01-08 cs.RO 82%

CoINS: Counterfactual Interactive Navigation via Skill-Aware VLM

基于技能感知的反事实交互导航:通过技能感知视觉语言模型

Kangjie Zhou, Zhejia Wen, Zhiyong Zhuo, Zike Yan, Pengying Wu, Ieng Hou U, Shuaiyang Li, Han Gao, Kang Ding, Wenhan Cao, Wei Pan, Chang Liu

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系) College of Design and Engineering, National University Of Singapore(新加坡国立大学设计与工程学院) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract)

AI总结 CoINS通过整合技能感知推理与稳健执行,提升机器人在复杂环境中的交互导航能力。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21799 2026-01-08 cs.AI 57%

D-Artemis: A Deliberative Cognitive Framework for Mobile GUI Multi-Agents

D-Artemis:一种用于移动GUI多智能体的 deliberative 认知框架

Hongze Mi, Yibo Feng, Wenjie Lu, Yuqi Wang, Jinyuan Li, Song Cao, He Cui, Tengfei Tian, Xuelin Zhang, Haotian Luo, Di Sun, Jun Fang, Hua Chai, Naiqiang Tan, Gang Pan

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 D-Artemis通过引入细粒度提示检索和主动对齐机制,提升移动GUI多智能体任务的执行成功率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏