arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1576 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1576 篇

2412.13194 2024-12-18 cs.LG cs.AI cs.CV 67%

Proposer-Agent-Evaluator(PAE): Autonomous Skill Discovery For Foundation Model Internet Agents

Yifei Zhou, Qianlan Yang, Kaixiang Lin, Min Bai, Xiong Zhou, Yu-Xiong Wang, Sergey Levine, Erran Li

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10742 2024-12-17 cs.CL 67%

WEPO: Web Element Preference Optimization for LLM-based Web Navigation

Jiarun Liu, Jia Hao, Chunhong Zhang, Zheng Hu

专题命中 GUI与屏幕智能体 :visual language model(abstract);grounding(abstract)

Comments Published at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03037 2024-12-05 cs.SE 67%

Seeing is Believing: Vision-driven Non-crash Functional Bug Detection for Mobile Apps

Zhe Liu, Cheng Li, Chunyang Chen, Junjie Wang, Mengzhuo Chen, Boyu Wu, Yawen Wang, Jun Hu, Qing Wang

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19650 2024-12-02 cs.RO cs.AI cs.CL cs.CV cs.LG 67%

CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation

Qixiu Li, Yaobo Liang, Zeyu Wang, Lin Luo, Xi Chen, Mozheng Liao, Fangyun Wei, Yu Deng, Sicheng Xu, Yizhong Zhang, Xiaofan Wang, Bei Liu, Jianlong Fu, Jianmin Bao, Dong Chen, Yuanchun Shi, Jiaolong Yang, Baining Guo

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project Webpage: https://cogact.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12202 2024-11-20 cs.RO cs.AI cs.CV cs.LG 67%

OK-Robot: What Really Matters in Integrating Open-Knowledge Models for Robotics

Peiqi Liu, Yaswanth Orru, Jay Vakil, Chris Paxton, Nur Muhammad Mahi Shafiullah, Lerrel Pinto

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Github repo: https://github.com/ok-robot/ok-robot

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11609 2024-11-19 cs.RO 67%

VLN-Game: Vision-Language Equilibrium Search for Zero-Shot Semantic Navigation

Bangguo Yu, Yuzhen Liu, Lei Han, Hamidreza Kasaei, Tingguang Li, Ming Cao

专题命中 GUI与屏幕智能体 :vision-language model(abstract);vision language model(abstract)

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04152 2024-10-08 cs.RO cs.AI cs.CV cs.LG 67%

VoxAct-B: Voxel-Based Acting and Stabilizing Policy for Bimanual Manipulation

I-Chun Arthur Liu, Sicheng He, Daniel Seita, Gaurav Sukhatme

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to the Conference on Robot Learning (CoRL) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09053 2024-09-18 cs.RO 67%

Navi2Gaze: Leveraging Foundation Models for Navigation and Target Gazing

Jun Zhu, Zihao Du, Haotian Xu, Fengbo Lan, Zilong Zheng, Bo Ma, Shengjie Wang, Tao Zhang

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00203 2024-08-02 cs.CV cs.AI cs.CL cs.LG 67%

OmniParser for Pure Vision Based GUI Agent

Yadong Lu, Jianwei Yang, Yelong Shen, Ahmed Awadallah

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07392 2024-07-11 cs.RO cs.AI cs.CV cs.LG 67%

Malicious Path Manipulations via Exploitation of Representation Vulnerabilities of Vision-Language Navigation Systems

Chashi Mahiul Islam, Shaeke Salman, Montasir Shams, Xiuwen Liu, Piyush Kumar

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 8 pages, 5 figures. This paper has been accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.13166 2023-07-07 cs.AI cs.CV cs.LG cs.RO 67%

ESC: Exploration with Soft Commonsense Constraints for Zero-shot Object Navigation

Kaiwen Zhou, Kaizhi Zheng, Connor Pryor, Yilin Shen, Hongxia Jin, Lise Getoor, Xin Eric Wang

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05714 2023-03-09 cs.RO cs.AI cs.CL cs.CV cs.LG 67%

Visual Language Maps for Robot Navigation

Chenguang Huang, Oier Mees, Andy Zeng, Wolfram Burgard

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at the 2023 IEEE International Conference on Robotics and Automation (ICRA). Project page: https://vlmaps.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.02185 2022-07-06 cs.CV cs.AI cs.CL cs.LG 67%

CLEAR: Improving Vision-Language Navigation with Cross-Lingual, Environment-Agnostic Representations

Jialu Li, Hao Tan, Mohit Bansal

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments NAACL 2022 Findings (18 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.05692 2021-12-13 cs.CV cs.AI cs.HC cs.LG 67%

VUT: Versatile UI Transformer for Multi-Modal Multi-Task User Interface Modeling

Yang Li, Gang Li, Xin Zhou, Mostafa Dehghani, Alexey Gritsenko

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.13415 2021-06-28 cs.CV cs.AI cs.LG cs.RO 67%

Building Intelligent Autonomous Navigation Agents

Devendra Singh Chaplot

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments CMU Ph.D. Thesis, March 2021. For more details see http://devendrachaplot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.00047 2018-06-04 cs.AI cs.CL cs.CV cs.LG cs.RO 67%

Following High-level Navigation Instructions on a Simulated Quadcopter with Imitation Learning

Valts Blukis, Nataly Brukhim, Andrew Bennett, Ross A. Knepper, Yoav Artzi

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments To appear in Robotics: Science and Systems (RSS), 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12611 2026-08-14 cs.CV cs.LG 新提交 62%

From Visual Widgets to UI Code: Efficient Tool-Grounded Generation

从视觉控件到UI代码:高效的基于工具的生成

Houston H. Zhang, Tao Zhang, Li Gu, Linfeng Ye, Yuanhao Yu, Xinxin Zuo, Yang Wang, Zhixiang Chi

机构 * McMaster University(麦克马斯特大学) University of Toronto(多伦多大学) Concordia University(康考迪亚大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本研究提出轻量级工具框架WidgetGen,在6个多模态模型和1000个控件上,其视觉重建指标优于直接提示和Widget2Code,且重建的图像-代码对可提升Qwen系列模型性能

Comments ECCV2026 (MUCG Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03148 2026-08-05 cs.LG cs.AI 新提交 62%

Lightweight Chunk Selection for Mobile Retrieval-Augmented Generation

面向移动端检索增强生成的轻量级分块选择

Sicong Chang, Yidan Shen, Wen Yu, Jiefu Chen, Xin Fu, Renjie Hu

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文针对移动端RAG部署的成本问题,提出结合LLM侧查询意图、MoE路由信号与检索分块嵌入的轻量级分块选择方法,提升了排名1的证据选择性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28227 2026-07-31 cs.AI cs.CV 新提交 62%

Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents

Qwen-UI-Agent技术报告:面向下一代以真实世界为中心的基础图形用户界面智能体

Hanzhang Zhou, Panrong Tong, Xu Zhang, Quyu Kong, Chenglin Cai, Tianyu Xia, Gongjie Zhang, Jianan Zhang, Long Li, Long Chen, Lei Wang, Gaole Dai, Pengxiang Li, Liangyu Chen, Yue Wang, Steven Hoi

机构 * Alibaba Group(阿里巴巴集团)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究推出以真实世界为中心的基础GUI智能体Qwen-UI-Agent,结合多环境与数据飞轮等机制,在移动端基准达最优,在多类任务上表现具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26041 2026-07-31 cs.AI cs.CV 版本更新 62%

Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions?

桌面增量基准测试:计算机使用模型是否理解桌面GUI转换?

Abhishek Pillai, Samir Kumar Nayak, Yuan Chen

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究计算机使用模型对桌面GUI转换的理解,引入桌面增量基准测试(DDB)及其实例、任务,评估多个模型家族,发现排序不饱和,任务上下文对匹配有影响,单动作推断家族更难,DDB填补诊断层,助力改进桌面CUA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22721 2026-07-28 cs.CV cs.AI 新提交 62%

An Interactive Vision Language Platform for Cognitive Remediation in Schizophrenia

用于精神分裂症认知康复的交互式视觉语言平台

Nassira Ait Mehdi, Milissa Temmam, Slimane Larabi

机构 * Computer Science Faculty, USTHB University(USTHB大学计算机科学学院) RIIMA Laboratory(RIIMA实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对精神分裂症患者认知康复任务中动作评估依赖人工观察的问题,提出基于视觉语言模型的自动化框架,通过分析视频和微调模型验证动作,收集数据集评估,有效连接物理与临床反馈,提供可扩展客观方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21670 2026-07-27 cs.RO cs.AI cs.LG 新提交 62%

Ordered Action Tokens for Visuomotor Policy Learning

用于视觉运动策略学习的有序动作令牌

Chaoqi Liu, Yue Zhao, Haonan Chen, Xiaoshen Han, Jiawei Gao, Ehsan Adeli, Yilun Du

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对动作令牌化存在的问题,提出有序动作令牌化(OAT)方法,利用带特定机制的变换器将动作块离散化,满足高压缩率等三个需求,在多种策略和任务中验证,能提升策略性能并增强推理灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20988 2026-07-24 cs.CV cs.AI 新提交 62%

HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving

HyWorldVLA:一种用于自动驾驶的具有混合世界建模的视觉-语言-动作模型

Quanfu Yu, Xian Wu, Hao Xu, Liulong Ma

机构 * Automotive New Technology Research Institute, BYD Company Limited(比亚迪汽车新技术研究院)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究针对自动驾驶中视觉-语言-动作模型的不足,提出HyWorldVLA框架,统一像素级监督与潜在表征学习。预训练阶段预测视频潜在并重建帧,微调阶段预测潜在特征生成轨迹,实验表明其性能优于基线,还建立了世界模型噪声鲁棒性评估新基准。

Comments 20 pages with 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18042 2026-07-24 cs.CV cs.AI 版本更新 62%

Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation

行动前预测:基于未来状态条件的视觉语言导航

Lingfeng Zhang, Zhanguang Zhang, Liheng Ma, Tongtong Cao, Yingxue Zhang

机构 * Noah’s Ark Lab, 2012 Labs, Huawei(诺亚方舟实验室,2012实验室,华为)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言导航中标准行为克隆问题,提出FSC-VLN方法,通过添加未来查询令牌并经训练后移除的目标分支将其隐藏状态与未来视觉嵌入对齐,实验表明该方法在R2R val-unseen上提升了相关指标。

Comments 9 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13597 2026-07-21 cs.RO cs.AI cs.CV 版本更新 62%

Semantic Anchoring for Robotic Action Representations

用于机器人动作表示的语义锚定

Yuan Xu, Youheng Shi, Chengyang Li, Wentao Zhu, Yizhou Wang

机构 * Peking University(北京大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究VLA模型微调后动作表示结构受损问题,受镜像神经元理论启发,通过系统探测证实结构变化与任务表现相关。提出即插即用方法,将动作表示锚定到语义流形并分解通道,经多基准测试验证,有效提升了模型在真实世界任务中的表现。

Comments Project Page: https://xy02-05.github.io/SemanticMN

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14635 2026-07-17 cs.AI cs.CV cs.RO 新提交 62%

Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models

动作QFormer:视觉-语言-动作模型中动作监督下的结构化表示塑造

Yufeng Ji, Wenhao Tang, Haoyi Niu, Koushil Sreenath, Yi Wu, Zhongyu Li

机构 * Shanghai Qizhi Institute(上海期智研究院) The Chinese University of Hong Kong(香港中文大学) Hong Kong Embodied AI Lab(香港具身人工智能实验室) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究视觉-语言-动作模型中动作监督问题,提出动作QFormer,通过基于指令的查询重组多模态信息。在零样本模拟到真实导航中提升了任务成功率、动作生成正确性等,还改变动作监督塑造多模态表示的方式,为提高VLA性能提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25170 2026-07-17 cs.LG cs.AI cs.ET cs.RO 版本更新 62%

Grow-Prune-Freeze Networks: Adaptive & Continual Learning Technique for Olfactory Navigation

生长-剪枝-冻结网络:用于嗅觉导航的自适应与持续学习技术

Kordel K. France, Ovidiu Daescu

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出生长-剪枝-冻结(GPF)网络框架,通过动态调整策略网络层数实现持续学习,在湍流羽流导航任务中达到94%成功率,并推广到其他机器学习任务。

Comments Accepted as poster to the Reinforcement Learning in Big Worlds Workshop at the 2026 Reinforcement Learning Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09818 2026-07-14 cs.RO cs.AI cs.CV 新提交 62%

TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging

TS-Mask VLA:用于视觉-语言-动作模型的具有有效桥接的二维时空掩码

Shengzhuo Yang, Ronghao Yu, Chuanjie Lv, Linpeng Peng, Hang Yu, Jie Ren, Jiajun Lv, Yong Liu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学网络系统与控制研究所) Tongji University(同济大学)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究针对视觉-语言-动作模型问题,提出TS-Mask VLA框架,基于离散扩散动作专家和时空二维掩码策略,在模拟基准和现实任务实验中表现出色,验证了设计有效性。

Comments 9 pages, 5 figures, accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06706 2026-07-09 cs.RO cs.AI cs.LG 新提交 62%

Vision Language Action (VLA) Models for Unmanned Aerial Robotics and Bimanual Manipulation: A Review

用于无人机机器人和双手操作的视觉语言动作(VLA)模型综述

Inkyu Sa, Chanoh Park, Hea-Min Lee, Donghee Noh, Ho Seok Ahn

机构 * Chef Robotics RovifyLab IT Application Research Center, Jeonbuk Regional Branch Department of Electrical, Computer and Software Engineering(电气与计算机软件工程系)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 综述2017 - 2026年183篇文献,围绕视觉语言动作模型在无人机机器人和双手操作方面的应用,涵盖多维度,表明双手VLA相关策略可转移至无人机系统,还确定了两领域的14个研究方向。

Comments 56 pages, 11 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06306 2026-07-08 cs.SE cs.AI cs.CV 新提交 62%

UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation

UI2App:可执行Web应用程序生成中视觉交互推理的基准测试

Grace Man Chen, Litao Guo, Yifan Wu, Yiyu Chen, Yenchi Tseng, Sicheng Liu, Yuyu Luo, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对现有网页生成基准测试对交互能力评估不足的问题,引入UI2App基准测试,通过设计端到端管道沿四个维度评估工件,实验发现视觉与交互能力不匹配,复杂交互是瓶颈,为相关研究提供了参考。

详情

展开后加载摘要…

URL PDF HTML 收藏