arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-17 至 2026-02-17 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 10 篇

2602.13653 2026-02-17 cs.AI cs.CL cs.CV cs.HC 79%

Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization

通过代理-Q估计和分步策略优化构建自主GUI导航

Yibo Wang, Guangda Huzhang, Yuwei Hu, Yu Xia, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Lijun Zhang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Ovis Team, Alibaba Group(阿里团队,阿里巴巴集团)

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于代理-Q估计和分步策略优化的GUI自主导航框架,通过强化学习提升GUI交互能力,实验证明其在导航和基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14974 2026-02-17 cs.RO 75%

DM0: An Embodied-Native Vision-Language-Action Model towards Physical AI

DM0:一种面向物理AI的具身原生视觉-语言-动作模型

En Yu, Haoran Lv, Jianjian Sun, Kangheng Lin, Ruitao Zhang, Yukang Shi, Yuyang Chen, Ze Chen, Ziheng Zhang, Fan Jia, Kaixin Liu, Meng Zhang, Ruitao Hao, Saike Huang, Songhan Xie, Yu Liu, Zhao Wu, Bin Xie, Pengwei Zhang, Qi Yang, Xianchi Deng, Yunfei Wei, Enwen Zhang, Hongyang Peng, Jie Zhao, Kai Liu, Wei Sun, Yajun Wei, Yi Yang, Yunqiao Zhang, Ziwei Yan, Haitao Yang, Hao Liu, Haoqiang Fan, Haowei Zhang, Junwen Huang, Yang Chen, Yunchao Ma, Yunhuan Yang, Zhengyuan Du, Ziming Liu, Jiahui Niu, Yucheng Zhao, Daxin Jiang, Wenbin Tang, Xiangyu Zhang, Zheng Ge, Erjin Zhou, Tiancai Wang

机构 * DM0 Team(DM0团队) Dexmal StepFun

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);grounding(abstract)

AI总结 DM0提出了一种面向物理AI的具身原生视觉-语言-动作模型,通过统一具身操作和导航,结合预训练、中训练和后训练流程,实现对复杂物理任务的高效处理。

Comments Authors are listed in alphabetical order. Code is available at https://github.com/Dexmal/dexbotic

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11526 2026-02-17 cs.RO cs.AI 70%

Foundation Models in Autonomous Driving: A Survey on Scenario Generation and Scenario Analysis

自动驾驶中的基础模型:场景生成与场景分析的综述

Yuan Gao, Mattia Piccinini, Yuchen Zhang, Dingrui Wang, Korbinian Moller, Roberto Brusnicki, Baha Zarrouki, Alessio Gambi, Jan Frederik Totz, Kai Storms, Steven Peters, Andrea Stocco, Bassam Alrifaee, Marco Pavone, Johannes Betz

专题命中 GUI与屏幕智能体 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文综述了基础模型在自动驾驶场景生成与分析中的应用,探讨了相关模型、方法及挑战。

Comments IEEE Open Journal of Intelligent Transportation Systems

Journal ref IEEE Open Journal of Intelligent Transportation Systems, 03 February 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16713 2026-02-17 cs.RO cs.AI cs.CL 70%

A Pragmatist Robot: Learning to Plan Tasks by Experiencing the Real World

务实型机器人:通过体验现实世界学习任务规划

Kaixian Qu, Guowei Lan, René Zurbrügg, Changan Chen, Christopher E. Mower, Haitham Bou-Ammar, Marco Hutter

机构 * Robotic Systems Lab, ETH Zürich(瑞士联邦理工学院机器人系统实验室) ETH AI Center, ETH Zürich(瑞士联邦理工学院人工智能中心) Huawei Noah’s Ark Lab, London, UK(华为诺亚实验室,伦敦,英国) UCL Centre for AI, London, UK(伦敦大学学院人工智能中心)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 PragmaBot 通过现实世界经验学习任务规划,利用 STM 自我反思和 RAG 提高任务成功率

Comments Accepted to RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20037 2026-02-17 cs.RO 67%

Visio-Verbal Teleimpedance Interface: Enabling Semi-Autonomous Control of Physical Interaction via Eye Tracking and Speech

视觉-语言远阻抗接口:通过眼动追踪和语音实现物理交互的半自主控制

Henk H. A. Jekel, Alejandro Díaz Rosales, Luka Peternel

机构 * Department of Cognitive Robotics, Delft University of Technology(认知机器人系,代尔夫特理工大学) European Organization for Nuclear Research (CERN)(欧洲核子研究中心)

专题命中 GUI与屏幕智能体 :VLM(abstract);visual language model(abstract)

AI总结 本文提出一种结合眼动追踪和语音交互的视觉-语言远阻抗接口,用于通过生成刚度矩阵实现远程机械臂的半自主物理交互控制。

Journal ref Frontiers in Robotics and AI, Volume 13, 1749105, February 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02456 2026-02-17 cs.RO 67%

InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation

InternVLA-A1:统一理解、生成和行动以实现机器人操作

Junhao Cai, Zetao Cai, Jiafei Cao, Yilun Chen, Zeyu He, Lei Jiang, Hang Li, Hengjie Li, Yang Li, Yufei Liu, Yanan Lu, Qi Lv, Haoxiang Ma, Jiangmiao Pang, Yu Qiao, Zherui Qiu, Yanqing Shen, Xu Shi, Yang Tian, Bolun Wang, Hanqing Wang, Jiaheng Wang, Tai Wang, Xueyuan Wei, Chao Wu, Yiman Xie, Boyang Xing, Yuqiang Yang, Yuyin Yang, Qiaojun Yu, Feng Yuan, Jia Zeng, Jingjing Zhang, Shenghan Zhang, Shi Zhang, Zhuoma Zhaxi, Bowen Zhou, Yuanzhen Zhou, Yunsong Zhou, Hongrui Zhu, Yangkun Zhu, Yuchen Zhu

机构 * InternVLA-A1 Team(InternVLA-A1团队)

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract)

AI总结 InternVLA-A1通过统一的Transformer架构,结合语义理解和动态预测能力,提升了机器人操作任务的性能。

Comments Homepage: https://internrobotics.github.io/internvla-a1.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13329 2026-02-17 cs.CV cs.AI cs.RO 62%

HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving

HiST-VLA:一种用于端到端自动驾驶的分层时空视觉-语言-动作模型

Yiru Wang, Zichong Gu, Yu Gao, Anqing Jiang, Zhigang Sun, Shuo Wang, Yuwen Heng, Hao Sun

机构 * Bosch Corporate Research(博世企业研究) School of Communication and Information Engineering(信息工程学院)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 HiST-VLA通过分层时空视觉-语言-动作模型提升自动驾驶轨迹生成的精度与效率,实现端到端的自动驾驶系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14083 2026-02-17 cs.AI 57%

Plan-MCTS: Plan Exploration for Action Exploitation in Web Navigation

Plan-MCTS:网页导航中的计划探索用于动作利用

Weiming Zhang, Jihong Wang, Jiamu Zhou, Qingyao Li, Xinbei Ma, Congmin Zheng, Xingyu Lou, Weiwen Liu, Zhuosheng Zhang, Jun Wang, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO Research Institute(OPPO研究院)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 Plan-MCTS通过将网页导航探索转移到语义计划空间,提升动作利用效率,实现更高效的导航任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10556 2026-02-17 cs.RO cs.AI 57%

LAP: Language-Action Pre-Training Enables Zero-shot Cross-Embodiment Transfer

LAP:语言-动作预训练实现零样本跨躯体迁移

Lihan Zha, Asher J. Hancock, Mingtong Zhang, Tenny Yin, Yixuan Huang, Dhruv Shah, Allen Z. Ren, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 LAP通过语言-动作预训练实现零样本跨躯体迁移,首次在无需特定躯体微调的情况下达到显著的迁移效果,提升性能达两倍。

Comments Project website: https://lap-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14326 2026-02-17 cs.NI 50%

Diffusion-based Dynamic Contract for Federated AI Agent Construction in Mobile Metaverses

基于扩散的动态合同用于移动元宇宙中联邦AI代理的构建

Jinbo Wen, Jiawen Kang, Yang Zhang, Yue Zhong, Dusit Niyato, Jie Xu, Jianhang Tang, Chau Yuen

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出基于扩散模型的EDMSAC算法,通过动态合同机制优化边缘-云协作下的AI代理构建,提升移动元宇宙中服务的低延迟与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏