arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1576 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1576 篇

2512.16295 2025-12-19 cs.AI 57%

OS-Oracle: A Comprehensive Framework for Cross-Platform GUI Critic Models

OS-Oracle: 一个跨平台GUI批评模型的综合框架

Zhenyu Wu, Jingjing Xie, Zehao Li, Bowen Yang, Qiushi Sun, Zhaoyang Liu, Zhoumianze Liu, Yu Qiao, Xiangyu Yue, Zun Wang, Zichen Ding

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港大学MMLab) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI

AI总结 OS-Oracle提出了一种跨平台GUI批评模型框架,通过合成数据和两阶段训练方法,实现了在移动、网页和桌面平台上的高效批评评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14130 2025-12-17 cs.CR cs.AI 57%

UIXPOSE: Mobile Malware Detection via Intention-Behaviour Discrepancy Analysis

基于意图-行为不一致分析的移动恶意软件检测:UIXPOSE

Amirmohammad Pasdar, Toby Murray, Van-Thuan Pham

机构 * School of Computing and Information Systems(计算与信息系统学院) The University of Melbourne(墨尔本大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 UIXPOSE通过意图-行为不一致分析提升移动恶意软件的动态检测能力

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21307 2025-12-16 cs.CV 57%

Towards Physically Executable 3D Gaussian for Embodied Navigation

迈向可物理执行的3D高斯用于具身导航

Bingchen Miao, Rong Wei, Zhiqi Ge, Xiaoquan sun, Shiqi Gao, Jingzhe Zhu, Renhan Wang, Siliang Tang, Jun Xiao, Rui Tang, Juncheng Li

机构 * Zhejiang University(浙江大学) Manycore Tech Inc(Manycore科技公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 SAGE-3D通过引入语义和物理对齐的3D高斯环境,提升视觉-语言导航任务的可执行性和泛化能力。

Comments Project Page: https://sage-3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00846 2025-12-12 cs.CV 57%

AFRAgent : An Adaptive Feature Renormalization Based High Resolution Aware GUI agent

AFRAgent:一种基于自适应特征归一化的高分辨率感知GUI代理

Neeraj Anand, Rishabh Jain, Sohan Patnaik, Balaji Krishnamurthy, Mausoom Sarkar

机构 * Media and Data Science Research, Adobe(Adobe媒体与数据科学研究所)

专题命中 GUI与屏幕智能体 :visual language model(abstract);分类 cs.CV

AI总结 AFRAgent通过自适应特征归一化技术,在保持高分辨率细节的同时,实现了更高效的GUI自动化性能,比现有模型小四分之一。

Comments Accepted at WACV 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02427 2025-12-12 cs.CV cs.RO 57%

From the Laboratory to Real-World Application: Evaluating Zero-Shot Scene Interpretation on Edge Devices for Mobile Robotics

从实验室到现实应用:评估边缘设备上用于移动机器人的零样本场景解读

Nicolas Schuler, Lea Dewald, Nick Baldig, Jürgen Graf

机构 * Laboratories for Cognitive Systems and Robotics(认知系统与机器人实验室) University of Luxembourg(卢森堡大学)

专题命中 GUI与屏幕智能体 :visual language model(abstract);分类 cs.CV

AI总结 本文评估了适用于移动机器人边缘设备的小型视觉语言模型在零样本场景解读任务中的性能与应用潜力。

Comments 15 pages, 6 figures, 1 table; accepted for AI-2025 Forty-fifth SGAI International Conference on Artificial Intelligence CAMBRIDGE, ENGLAND 16-18 DECEMBER 2025

Journal ref Artificial Intelligence XLII. SGAI-AI 2025. Lecture Notes in Computer Science, vol 16302. Springer, Cham (2026), pp 301-315

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03724 2025-12-09 cs.CV cs.RO 57%

PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention

PosA-VLA: 通过姿态条件化锚点注意力增强动作生成

Ziwen Li, Xin Wang, Hanlue Zhang, Runnan Chen, Runqi Lin, Xiao He, Han Huang, Yandong Guo, Fakhri Karray, Tongliang Liu, Mingming Gong

机构 * MBZUAI AI2 Robotics The University of Sydney(悉尼大学) The University of Melbourne(墨尔本大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 PosA-VLA通过姿态条件化锚点注意力机制提升动作生成的精度和效率,适用于多样化的机器人任务和复杂环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18229 2025-12-09 cs.RO cs.AI 57%

BEDI: A Comprehensive Benchmark for Evaluating Embodied Agents on UAVs

BEDI:一种用于无人机上具身智能体评估的综合基准

Mingning Guo, Mengwei Wu, Jiarun He, Shaoxian Li, Haifeng Li, Chao Tao

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 BEDI提出了一种标准化的无人机具身智能体评估基准,通过动态任务范式和混合测试平台,全面评估UAV-EAs的六个核心技能,并揭示现有VLMs在具身任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12679 2025-12-05 cs.CV 57%

TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents

TongUI: 通过多模态网络教程构建大规模GUI代理

Bofei Zhang, Zirui Shang, Zhi Gao, Wang Zhang, Rui Xie, Xiaojian Ma, Tao Yuan, Xinxiao Wu, Song-Chun Zhu, Qing Li

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 TongUI通过多模态网络教程构建大规模GUI代理,利用GUI-Net数据集提升定位和导航性能,优于基线代理10%。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04105 2025-12-05 cs.CY cs.AI cs.HC 57%

LegalWebAgent: Empowering Access to Justice via LLM-Based Web Agents

LegalWebAgent:通过基于大语言模型的网络代理赋能正义获取

Jinzhe Tan, Karim Benyekhlef

机构 * Cyberjustice Laboratory, Faculty of Law, University of Montreal, Canada(法律正义实验室,法学院,蒙特利尔大学,加拿大)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 LegalWebAgent通过多模态大语言模型实现网络代理,解决普通公民在法律问题中的获取障碍,实现从查询到行动的全流程自动化,实验结果显示其在复杂场景中的高自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02631 2025-12-03 cs.LG 57%

SeeNav-Agent: Enhancing Vision-Language Navigation with Visual Prompt and Step-Level Policy Optimization

SeeNav-Agent: 通过视觉提示和分步策略优化增强视觉语言导航

Zhengcheng Wang, Zichuan Lin, Yijun Yang, Haobo Fu, Deheng Ye

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG

AI总结 SeeNav-Agent通过视觉提示和分步策略优化提升视觉语言导航性能,实验显示其在导航成功率上优于现有模型。

Comments 12 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02423 2025-12-03 cs.CV 57%

GUI Exploration Lab: Enhancing Screen Navigation in Agents via Multi-Turn Reinforcement Learning

GUI探索实验室:通过多轮强化学习提升代理的屏幕导航

Haolong Yan, Yeqing Shen, Xin Huang, Jia Wang, Kaijun Tan, Zhixuan Liang, Hongxin Li, Zheng Ge, Osamu Yoshie, Si Li, Xiangyu Zhang, Daxin Jiang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) StepFun Waseda University(早稻田大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.CV

AI总结 GUI探索实验室通过多轮强化学习提升代理屏幕导航能力,结合监督微调和交互式试错,实现更高效和通用的GUI代理训练。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01009 2025-12-02 cs.RO cs.CV 57%

FOM-Nav: Frontier-Object Maps for Object Goal Navigation

FOM-Nav:用于目标导航的前沿-对象地图

Thomas Chabal, Shizhe Chen, Jean Ponce, Cordelia Schmid

机构 * Inria(法国国家信息与自动化技术研究院) Department of Computer Science, École normale supérieure (ENS-PSL, CNRS, Inria)(高等师范学院计算机科学系) Courant Institute of Mathematical Sciences and Center for Data Science, New York University(纽约大学Courant数学科学研究所和数据科学中心)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 FOM-Nav通过前沿-对象地图和视觉-语言模型提升机器人在未知环境中的目标导航效率,实现最先进的导航性能。

Comments Project page: https://www.di.ens.fr/willow/research/fom-nav/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22697 2025-12-01 cs.RO cs.CL cs.CV 57%

Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations

通过少样本示范机制性微调视觉-语言-动作模型

Chancharik Mitra, Yusen Luo, Raj Saravanan, Dantong Niu, Anirudh Pai, Jesse Thomason, Trevor Darrell, Abrar Anwar, Deva Ramanan, Roei Herzig

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出Robotic Steering方法,通过少样本示范机制性微调视觉-语言-动作模型,提升其在机器人任务中的适应性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21398 2025-11-27 cs.AI cs.CL cs.HC cs.MA 57%

Prune4Web: DOM Tree Pruning Programming for Web Agent

Prune4Web: 面向Web代理的DOM树剪枝编程

Jiayuan Zhang, Kaiquan Chen, Zhihao Lu, Enshen Zhou, Qian Yu, Jing Zhang

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 Prune4Web通过DOM树剪枝编程提升Web自动化精度,实现25-50倍候选元素减少,显著提高接地任务准确性至88.28%。

Comments Paper accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21202 2025-11-27 cs.CV 57%

Towards an Effective Action-Region Tracking Framework for Fine-grained Video Action Recognition

迈向细粒度视频动作识别的有效动作-区域跟踪框架

Baoli Sun, Yihan Wang, Xinzhu Ma, Zhihui Wang, Kun Lu, Zhiyong Wang

机构 * DUT-RU International School of Information Science & Engineering, Dalian University of Technology, China(大连理工大学国际信息科学与工程学院,大连理工大学,中国) Beihang University, China(北京航空航天大学,中国) The University of Sydney, Australia(悉尼大学,澳大利亚)

专题命中 GUI与屏幕智能体 :visual language model(abstract);分类 cs.CV

AI总结 本文提出了一种动作-区域跟踪框架,通过查询-响应机制捕捉细粒度动作细节,提升视频动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11127 2025-11-27 cs.CL cs.AI 57%

UITron-Speech: Towards Automated GUI Agents Based on Speech Instructions

UITron-Speech: 向基于语音指令的自动化GUI代理迈进

Wenkang Han, Zhixiong Zeng, Jing Huang, Shu Jiang, Liming Zheng, Longrong Yang, Haibo Qiu, Chang Yao, Jingyuan Chen, Lin Ma

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 UITron-Speech通过语音指令和截图处理,实现首个端到端GUI代理,提升无障碍人机交互的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20067 2025-11-26 cs.AI cs.HC 57%

"Are We Done Yet?": A Vision-Based Judge for Autonomous Task Completion of Computer Use Agents

我们完成了吗?

Marta Sumyk, Oleksandr Kosovan

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于视觉的评估机制,通过视觉-语言模型评估计算机使用代理的任务完成情况,提升了任务完成的准确性和可靠性。

Comments This work has been accepted to appear at the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19033 2025-11-25 cs.CV 57%

ReEXplore: Improving MLLMs for Embodied Exploration with Contextualized Retrospective Experience Replay

ReEXplore: 通过上下文化回顾经验回放提升具身探索的MLLMs

Gengyuan Zhang, Mingcong Ding, Jingpei Wu, Ruotong Liao, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) TU Munich(慕尼黑技术大学)

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.CV

AI总结 ReEXplore通过回顾经验回放和分层前沿选择,提升MLLMs在具身探索中的效率和性能。

Comments 8 main pages plus 13 pages Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00416 2025-11-25 cs.RO cs.CV 57%

Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding

Evo-0:具有隐式空间理解的视觉-语言-动作模型

Tao Lin, Gen Li, Yilei Zhong, Yanwen Zou, Yuxin Du, Jiting Liu, Encheng Gu, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) EvoMind Tech(EvoMind科技) IAAR-Shanghai(IAAR-上海) University of Cambridge(剑桥大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 Evo-0通过隐式整合3D几何特征,提升视觉-语言-动作模型在现实世界中的空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17889 2025-11-25 cs.RO cs.CV 57%

MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots

MobileVLA-R1: 为移动机器人强化视觉-语言-动作

Ting Huang, Dongjian Li, Rui Yang, Zeyu Zhang, Zida Yang, Hao Tang

机构 * Peking University(北京大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 MobileVLA-R1通过结合监督CoT对齐与GRPO强化学习,提升四足机器人在复杂环境中的视觉-语言-动作控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16048 2025-11-21 cs.RO cs.AI cs.HC 57%

Semantic Glitch: Agency and Artistry in an Autonomous Pixel Cloud

语义裂隙:自主像素云中的代理与艺术性

Qing Zhang, Jing Huang, Mingyang Xu, Jun Rekimoto

机构 * The University of Tokyo(东京大学) Tokyo University of the Arts(东京艺术大学) Keio University(庆应大学) SONY CSL Kyoto(索尼 CSL 京都)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出语义裂隙,通过多模态大语言模型实现自主导航,展示低 fidelity方法在创造不完美但富有艺术性的机器人同伴中的应用。

Comments NeurIPS 2025 Creative AI Track, The Thirty-Ninth Annual Conference on Neural Information Processing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23596 2025-11-20 cs.AI 57%

Agent-SAMA: State-Aware Mobile Assistant

Linqiang Guo, Wei Liu, Yi Wen Heng, Tse-Hsun, Chen, Yang Wang

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

Comments Accepted to AAAI-26 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12405 2025-11-18 cs.CV 57%

VLA-R: Vision-Language Action Retrieval toward Open-World End-to-End Autonomous Driving

Hyunki Seong, Seongwoo Moon, Hojin Ahn, Jehun Kang, David Hyunchul Shim

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04614 2025-11-18 cs.AI 57%

Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation

Yuyang Wanyan, Xi Zhang, Haiyang Xu, Haowei Liu, Junyang Wang, Jiabo Ye, Yutong Kou, Ming Yan, Fei Huang, Xiaoshan Yang, Weiming Dong, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences, China(自动化研究所,中国科学院,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(中国科学院大学人工智能学院,中国) Alibaba Group(阿里巴巴集团)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20900 2025-11-18 cs.RO cs.AI 57%

DexGraspVLA: A Vision-Language-Action Framework Towards General Dexterous Grasping

Yifan Zhong, Xuchuan Huang, Ruochong Li, Ceyao Zhang, Zhang Chen, Tianrui Guan, Fanlian Zeng, Ka Num Lui, Yuyao Ye, Yitao Liang, Yaodong Yang, Yuanpei Chen

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10615 2025-11-14 cs.CV cs.CL 57%

Towards Blind and Low-Vision Accessibility of Lightweight VLMs and Custom LLM-Evals

Shruti Singh Baghel, Yash Pratap Singh Rathore, Sushovan Jena, Anurag Pradhan, Amit Shukla, Arnav Bhavsar, Pawan Goyal

机构 * Indian Institute of Technology Mandi(印度理工学院曼迪分校) Vellore Institute of Technology(韦洛雷理工学院) Indian Institute of Technology Kharagpur(印度理工学院哈里科普分校)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08892 2025-11-13 cs.AI 57%

Lumine: An Open Recipe for Building Generalist Agents in 3D Open Worlds

Weihao Tan, Xiangyang Li, Yunhao Fang, Heyuan Yao, Shi Yan, Hao Luo, Tenglong Ao, Huihui Li, Hongbin Ren, Bairen Yi, Yujia Qin, Bo An, Libin Liu, Guang Shi

机构 * ByteDance Seed(字节跳动种子) NTU(国立科技大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06840 2025-11-11 cs.CV cs.RO 57%

PanoNav: Mapless Zero-Shot Object Navigation with Panoramic Scene Parsing and Dynamic Memory

Qunchao Jin, Yilin Wu, Changhao Chen

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted as a poster in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04307 2025-11-11 cs.AI 57%

GUI-360$^\circ$: A Comprehensive Dataset and Benchmark for Computer-Using Agents

Jian Mu, Chaoyun Zhang, Chiming Ni, Lu Wang, Bo Qiao, Kartik Mathur, Qianhui Wu, Yuhang Xie, Xiaojun Ma, Mengyu Zhou, Si Qin, Liqun Li, Yu Kang, Minghua Ma, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

机构 * Nanjing University(南京大学) Microsoft(微软) ZJU-UIUC(浙大-UIUC) Peking University(北京大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19012 2025-11-11 cs.RO cs.AI 57%

Pure Vision Language Action (VLA) Models: A Comprehensive Survey

Dapeng Zhang, Jing Sun, Chenghui Hu, Xiaoyan Wu, Zhenlong Yuan, Rui Zhou, Fei Shen, Qingguo Zhou

机构 * Lanzhou University, China(兰州大学) National University of Singapore, Singapore(新加坡国立大学) Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所) NExT++ Research Centre, National University of Singapore, Singapore(新加坡国立大学NExT++研究中心)

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏