arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-25 至 2026-02-25 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 6 篇

2602.20687 2026-02-25 cs.AI 83%

How Foundational Skills Influence VLM-based Embodied Agents:A Native Perspective

基础技能如何影响基于VLM的具身体验代理:一种原生视角

Bo Peng, Pi Bu, Keyu Pan, Xinrun Xu, Yinxiu Zhao, Miao Chen, Yang Du, Lin Li, Jun Song, Tong Xu

机构 * Alibaba-inc(阿里巴巴集团)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 本文提出NativeEmbodied基准测试,通过统一的原生低级动作空间评估VLM驱动具身体验代理的综合性能,并揭示基础技能缺陷对高级任务性能的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20502 2026-02-25 cs.AI cs.LG 73%

ActionEngine: From Reactive to Programmatic GUI Agents via State Machine Memory

ActionEngine: 通过状态机内存实现从响应式到程序化GUI代理的转变

Hongbin Zhong, Fazle Faisal, Luis França, Tanakorn Leesatapornwongsa, Adriana Szekeres, Kexin Rong, Suman Nath

机构 * Microsoft Research(微软研究院)

专题命中 GUI与屏幕智能体 :vision language model(abstract);grounding(abstract);分类 cs.AI、cs.LG

AI总结 ActionEngine通过状态机内存实现从响应式到程序化GUI代理的转变,提升效率和准确性,减少成本和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21015 2026-02-25 cs.CV 70%

From Perception to Action: An Interactive Benchmark for Vision Reasoning

从感知到行动:一个交互式基准测试用于视觉推理

Yuhao Wu, Maojia Song, Yihuai Lan, Lei Wang, Zhiqiang Hu, Yao Xiao, Heng Zhou, Weihua Zheng, Dylan Raharja, Soujanya Poria, Roy Ka-Wei Lee

机构 * Singapore University of Technology(新加坡科技设计大学) Singapore Management University (SMU), Singapore(新加坡管理学院) Nanyang Technological University (NTU), Singapore(南洋理工大学) University of Science(科学大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 CHAIN基准测试通过交互式3D物理驱动环境,评估模型在动态环境中理解、规划和执行基于物理约束的结构化动作序列的能力。

Comments Work in processing. Website: https://social-ai-studio.github.io/CHAIN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09082 2026-02-25 cs.CV cs.AI cs.CL cs.LG 67%

UI-Venus-1.5 Technical Report

UI-Venus-1.5 技术报告

Venus Team, Changlong Gao, Zhangxuan Gu, Yulin Liu, Xinyu Qiu, Shuheng Shen, Yue Wen, Tianyu Xia, Zhenyu Xu, Zhengwen Zeng, Beitong Zhou, Xingran Zhou, Weizhi Chen, Sunhao Dai, Jingya Dou, Yichen Gong, Yuan Guo, Zhenlin Guo, Feng Li, Qian Li, Jinzhen Lin, Yuqi Zhou, Linchao Zhu, Liang Chen, Zhenyu Guo, Changhua Meng, Weiqiang Wang

机构 * Ant Group(蚂蚁集团)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 UI-Venus-1.5通过统一的GUI代理和关键技术改进,在多个基准测试中实现了最先进的性能,展示了在现实世界应用中的强大导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20517 2026-02-25 cs.AI cs.CL cs.LG 62%

Inner Speech as Behavior Guides: Steerable Imitation of Diverse Behaviors for Human-AI coordination

内部言语作为行为引导:为人类-人工智能协调的可操控模仿

Rakshit Trivedi, Kartik Sharma, David C Parkes

机构 * Massachusetts Institute of Technology(麻省理工学院) Georgia Institute of Technology(佐治亚理工学院) Harvard University(哈佛大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 MIMIC通过语言作为内部表示,利用视觉语言模型和扩散策略实现人类-人工智能协调中的行为引导与多样化的模仿控制。

Comments Spotlight paper at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20566 2026-02-25 cs.RO cs.CV 57%

BFA++: Hierarchical Best-Feature-Aware Token Prune for Multi-View Vision Language Action Model

BFA++: 多视角视觉语言动作模型的分层最佳特征感知令牌剪枝

Haosheng Li, Weixin Mao, Zihan Lan, Hongwei Xiong, Hongan Wang, Chenyang Si, Ziwei Liu, Xiaoming Deng, Hua Chen

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) LimX Dynamic(LimX动态) Nanjing University(南京大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.CV

AI总结 BFA++通过分层最佳特征感知令牌剪枝提升多视角视觉语言动作模型的效率和成功率

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏