arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-03 至 2026-02-03 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 6 篇

2505.11891 2026-02-03 cs.CL cs.AI 79%

Mobile-Bench-v2: A More Realistic and Comprehensive Benchmark for VLM-based Mobile Agents

Mobile-Bench-v2: 一种更现实和全面的基于VLM的移动代理基准测试

Weikai Xu, Zhizheng Jiang, Yuxuan Liu, Pengzhi Gao, Wei Liu, Jian Luan, Yuanchun Li, Yunxin Liu, Bin Wang, Bo An

机构 * Nanyang Technological University(南洋理工大学) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 Gallagher人工智能学院) MiLM Plus, Xiaomi Inc.(小米公司 MiLM Plus) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究所)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);分类 cs.AI

AI总结 Mobile-Bench-v2通过引入基于槽位的指令生成方法,构建了一个更现实和全面的基准测试,以评估基于VLM的移动代理在处理噪声、多路径任务和主动交互方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00551 2026-02-03 cs.RO cs.CV 77%

APEX: A Decoupled Memory-based Explorer for Asynchronous Aerial Object Goal Navigation

APEX:一种解耦的记忆型探索者用于异步空中目标导航

Daoxuan Zhang, Ping Chen, Xiaobo Xia, Xiu Su, Ruichen Zhen, Jianqiang Xiao, Shuo Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学) National University of Singapore(新加坡国立大学) Central South University(中南大学) Meituan Academy of Robotics(美团机器人研究院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 APEX通过分层异步架构实现高效空中目标导航,提升探索效率与目标识别精度。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02454 2026-02-03 cs.RO cs.AI 70%

World-Gymnast: Training Robots with Reinforcement Learning in a World Model

World-Gymnast: 在世界模型中用强化学习训练机器人

Ansh Kumar Sharma, Yixiang Sun, Ninghao Lu, Yunzhe Zhang, Jiarao Liu, Sherry Yang

机构 * New York University(纽约大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 World-Gymnast通过在世界模型中进行强化学习微调,有效提升真实机器人性能,比监督学习和软件模拟更具优势。

Comments https://world-gymnast.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01644 2026-02-03 cs.LG cs.AI cs.CV cs.MA cs.RO 67%

From Perception to Action: Spatial AI Agents and World Models

从感知到行动:空间AI代理与世界模型

Gloria Felicia, Nolan Bryant, Handi Putra, Ayaan Gazali, Eliel Lobo, Esteban Rojas

机构 * AtlasPro AI

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出了一种统一的三轴分类法,将代理能力与空间任务联系起来,强调空间定位与符号定位的区别,并指出世界模型对跨尺度安全部署的重要性。

Comments 61 pages, 742 citations, 1 figure, 3 tables. Survey paper on spatial AI agents, embodied AI, graph neural networks, and world models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00743 2026-02-03 cs.RO cs.AI 57%

SA-VLA: Spatially-Aware Flow-Matching for Vision-Language-Action Reinforcement Learning

SA-VLA:面向视觉-语言-动作强化学习的空间感知流匹配

Xu Pan, Zhenglin Wan, Xingrui Yu, Xianwei Zheng, Youkai Ke, Ming Sun, Rui Wang, Ziwei Wang, Ivor Tsang

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 SA-VLA通过空间感知的RL适应框架,在强化学习微调中保持空间定位,提升视觉-语言-动作任务的鲁棒性和泛化能力。

Comments Version 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19199 2026-02-03 cs.AI 57%

MAGNET: Towards Adaptive GUI Agents with Memory-Driven Knowledge Evolution

MAGNET:迈向基于记忆驱动的知识演化的自适应GUI代理

Libo Sun, Jiwen Zhang, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) University of Southern California(南加州大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 MAGNET通过双层记忆机制和动态演化机制,提升GUI代理在界面变化中的适应性和任务执行性能。

详情

展开后加载摘要…

URL PDF HTML 收藏