arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1576 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1576 篇

2601.22528 2026-02-02 cs.AI 70%

Darwinian Memory: A Training-Free Self-Regulating Memory System for GUI Agent Evolution

达尔文记忆:一种无训练的自调节记忆系统用于GUI代理进化

Hongze Mi, Yibo Feng, WenJie Lu, Song Cao, Jinyuan Li, Yanming Li, Xuelin Zhang, Haotian Luo, Songyang Peng, He Cui, Tengfei Tian, Jun Fang, Hua Chai, Naiqiang Tan

机构 * Didichuxing Co. Ltd(滴滴出行有限公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tianjin University(天津大学) Sun Yat-sen University(中山大学) Fudan University(复旦大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 达尔文记忆系统通过自进化架构提升GUI代理的执行稳定性与成功率,无需额外训练或架构开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04769 2026-02-02 cs.CV 70%

Vision-Language-Action (VLA) Models: Concepts, Progress, Applications and Challenges

视觉-语言-动作(VLA)模型:概念、进展、应用与挑战

Ranjan Sapkota, Yang Cao, Konstantinos I. Roumeliotis, Manoj Karkee

机构 * Cornell University(康奈尔大学) The Hong Kong University of Science and Technology(香港科学与技术大学) University of the Peloponnese(希腊皮洛斯大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);vision language model(abstract);分类 cs.CV

AI总结 本文综述了视觉-语言-动作(VLA)模型的概念、进展、应用与挑战,探讨了其在自动驾驶、医疗机器人等领域的应用及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20966 2026-01-30 cs.RO cs.AI 70%

Parallels Between VLA Model Post-Training and Human Motor Learning: Progress, Challenges, and Trends

VLA模型后训练与人类运动学习的类比:进展、挑战与趋势

Tian-Yu Xiang, Ao-Qun Jin, Xiao-Hu Zhou, Mei-Jiang Gui, Xiao-Liang Xie, Shi-Qi Liu, Shuang-Yi Wang, Sheng-Bin Duan, Fu-Chao Xie, Wen-Kai Wang, Si-Cheng Wang, Ling-Yun Li, Tian Tu, Zeng-Guang Hou

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Grainger College of Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院) CAS Center for Excellence in Brain Science and Intelligence Technology(中国科学院脑科学与智能技术卓越创新中心) Joint Laboratory of Intelligence Science and Technology, Institute of Systems Engineering, Macau University of Science and Technology(澳门科技大学系统工程学院智能科学与技术联合实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文从人类运动学习角度综述了VLA模型后训练的进展、挑战与趋势,提出四类后训练方法并探讨了其在机器人操作中的应用与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18712 2026-01-27 cs.CV 70%

LLaVAction: evaluating and training multi-modal large language models for action understanding

LLaVAction:评估和训练多模态大语言模型进行动作理解

Haozhe Qi, Shaokai Ye, Alexander Mathis, Mackenzie W. Mathis

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 LLaVAction通过引入动作标记和两阶段流程提升多模态大语言模型的动作理解能力,显著提升基准测试性能。

Comments https://github.com/AdaptiveMotorControlLab/LLaVAction

Journal ref International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10046 2026-01-27 cs.AI 70%

SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration

SimWorld-Robotics: 为多模态机器人导航与协作合成逼真动态城市环境

Yan Zhuang, Jiawei Ren, Xiaokang Ye, Jianzhi Shen, Ruixuan Zhang, Tianai Yue, Muhammad Faayez, Xuhong He, Ziqiao Ma, Lianhui Qin, Zhiting Hu, Tianmin Shu

机构 * University of Virginia(弗吉尼亚大学) UC San Diego(加州大学圣地亚哥分校) Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 SimWorld-Robotics通过合成逼真动态城市环境,提出两个多模态机器人基准测试,评估机器人在复杂场景中的导航、协作与通信能力。

Comments Conference: NeurIPS 2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08470 2026-01-14 cs.CV 70%

Towards Safer Mobile Agents: Scalable Generation and Evaluation of Diverse Scenarios for VLMs

迈向更安全的移动代理:为视觉语言模型(VLMs)可扩展生成和评估多样化场景

Takara Taniguchi, Kuniaki Saito, Atsushi Hashimoto

机构 * OMRON SINIC X

专题命中 GUI与屏幕智能体 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本研究提出HazardForge框架,用于生成多样化场景以评估VLM在复杂环境中的安全决策能力,构建MovSafeBench基准测试并验证VLM在异常场景下的性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24164 2026-01-09 cs.LG cs.RO 70%

$π_0$: A Vision-Language-Action Flow Model for General Robot Control

π₀:一种面向通用机器人控制的视觉-语言-动作流模型

Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, Lachy Groom, Karol Hausman, Brian Ichter, Szymon Jakubczak, Tim Jones, Liyiming Ke, Sergey Levine, Adrian Li-Bell, Mohith Mothukuri, Suraj Nair, Karl Pertsch, Lucy Xiaoyang Shi, James Tanner, Quan Vuong, Anna Walling, Haohuan Wang, Ury Zhilinsky

机构 * Physical Intelligence

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.LG

AI总结 本文提出了一种基于预训练视觉-语言模型的流匹配架构,用于通用机器人控制,通过零样本学习和微调实现多样任务的执行。

Comments See project website for videos: https://physicalintelligence.company/blog/pi0 Published in RSS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24851 2026-01-07 cs.CV cs.RO 70%

VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation agents

VLN-MME: 诊断MLLMs作为语言引导的视觉导航代理

Xunyi Zhao, Gengze Zhou, Qi Wu

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 VLN-MME通过统一评估框架揭示MLLMs在具身导航任务中的局限性,发现其3D空间推理能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22615 2026-01-06 cs.CV cs.CL 70%

Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone

Dream-VL & Dream-VLA: 基于扩散语言模型的开放视觉语言和视觉语言-动作模型

Jiacheng Ye, Shansan Gong, Jiahui Gao, Junming Fan, Shuang Wu, Wei Bi, Haoli Bai, Lifeng Shang, Lingpeng Kong

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 基于扩散语言模型构建的Dream-VL和Dream-VLA在视觉语言和视觉语言-动作任务中表现出色,实现了领先的性能。

Comments Add real-world experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20188 2025-12-24 cs.RO cs.AI 70%

Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation

异步快速-慢速视觉-语言-动作策略用于全身机器人操作

Teqiang Zou, Hongliang Zeng, Yuxuan Nong, Yifan Li, Kehui Liu, Haotian Yang, Xinyang Ling, Xin Li, Lianyang Ma

机构 * AstriBot Team(AstriBot团队)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 DuoCore-FS通过异步快速-慢速框架提升全身机器人操作的实时性能与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14014 2025-12-17 cs.AI 70%

MobileWorldBench: Towards Semantic World Modeling For Mobile Agents

MobileWorldBench: 向移动智能体的语义世界建模迈进

Shufan Li, Konstantinos Kallidromitis, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Aditya Grover

机构 * UCLA(加州大学洛杉矶分校) Panasonic AI Research(松下人工智能研究) Salesforce AI Research(Salesforce人工智能研究)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 MobileWorldBench通过语义世界模型提升移动智能体任务成功率

Comments 21 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11315 2025-12-15 cs.LG 70%

Benchmarking the Generality of Vision-Language-Action Models

对视觉-语言-动作模型通用性的基准测试

Pranav Guruprasad, Sudipta Chowdhury, Harsh Sikka, Mridul Sharma, Helen Lu, Sean Rivera, Aryan Khurana, Hangliang Ren, Yangyue Wang

机构 * Manifold Research Metarch AI Georgia Tech(佐治亚理工学院) Tufts University(塔夫茨大学) Northeastern University(东北大学) Birla Institute of Technology and Science, Pilani(比拉理工学院,帕利尼) Institute for Research and Innovation in Intelligent Systems (IRIIS)(智能系统研究与创新研究所)

专题命中 GUI与屏幕智能体 :vision language model(abstract);grounding(abstract);分类 cs.LG

AI总结 本文提出MultiNet v1.0基准,评估视觉-语言-动作模型在六个基础能力领域的跨领域泛化能力,发现现有模型在未见领域和模态转移时表现显著退化。

Comments 23 pages, 7 figures, and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11218 2025-12-15 cs.RO cs.CV 70%

Seeing to Act, Prompting to Specify: A Bayesian Factorization of Vision Language Action Policy

视觉与语言动作政策的贝叶斯分解:看见以行动,提示以指定

Kechun Xu, Zhenjie Zhu, Anzhe Chen, Shuqi Zhao, Qing Huang, Yifei Yang, Haojian Lu, Rong Xiong, Masayoshi Tomizuka, Yue Wang

机构 * Zhejiang University(浙江大学) UC Berkeley(伯克利大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出BayesVLA,通过贝叶斯分解策略,解决VLA模型中因模态不平衡导致的灾难性遗忘问题,提升泛化能力和指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05642 2025-11-11 cs.RO cs.AR cs.CV cs.SY eess.SY 70%

Lite VLA: Efficient Vision-Language-Action Control on CPU-Bound Edge Robots

Justin Williams, Kishor Datta Gupta, Roy George, Mrinmoy Sarkar

机构 * Department of Cyber-Physical Systems, Clark Atlanta University(克雷克阿特拉大学计算机物理系统系) Siemens Corporation(西门子公司)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13757 2025-11-11 cs.MA cs.AI cs.CL cs.HC 70%

MobA: Multifaceted Memory-Enhanced Adaptive Planning for Efficient Mobile Task Automation

Zichen Zhu, Hao Tang, Yansi Li, Dingye Liu, Hongshen Xu, Kunyao Lan, Danyang Zhang, Yixuan Jiang, Hao Zhou, Chenrun Wang, Situo Zhang, Liangtai Sun, Yixiao Wang, Yuheng Sun, Lu Chen, Kai Yu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

Comments NAACL 2025 Demo Track [code] https://github.com/OpenDFM/MobA [dataset] https://huggingface.co/datasets/OpenDFM/MobA-MobBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19816 2025-10-31 cs.RO cs.CV 70%

CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling

Hao Li, Shuai Yang, Yilun Chen, Xinyi Chen, Xiaoda Yang, Yang Tian, Hanqing Wang, Tai Wang, Dahua Lin, Feng Zhao, Jiangmiao Pang

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments 39 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05020 2025-10-28 cs.RO cs.AI 70%

Hierarchical Language Models for Semantic Navigation and Manipulation in an Aerial-Ground Robotic System

Haokun Liu, Zhaoqi Ma, Yunong Li, Junichiro Sugihara, Yicheng Chen, Jinjie Li, Moju Zhao

机构 * DRAGON Lab at Department of Mechanical Engineering, The University of Tokyo(东京大学机械工程系DRAGON实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

Comments 18 pages, 10 figures

Journal ref Advanced Intelligent Systems, Oct. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19336 2025-10-23 cs.CV 70%

DaMo: Data Mixing Optimizer in Fine-tuning Multimodal LLMs for Mobile Phone Agents

Kai Shi, Jun Yang, Ni Yang, Binqiang Pan, Qingsong Xie, Chao Zhang, Zhenyu Yang, Tianhuang Su, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18483 2025-10-22 cs.AI 70%

StarBench: A Turn-Based RPG Benchmark for Agentic Multimodal Decision-Making and Information Seeking

Haoran Zhang, Chenhao Zhu, Sicong Guo, Hanzhe Guo, Haiming Li, Donglin Yu

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学) University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13054 2025-10-16 cs.RO cs.AI 70%

VLA-0: Building State-of-the-Art VLAs with Zero Modification

Ankit Goyal, Hugo Hadfield, Xuning Yang, Valts Blukis, Fabio Ramos

机构 * NVIDIA

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04246 2025-10-07 cs.RO cs.AI 70%

ContextVLA: Vision-Language-Action Model with Amortized Multi-Frame Context

Huiwon Jang, Sihyun Yu, Heeseung Kwon, Hojin Jeon, Younggyo Seo, Jinwoo Shin

机构 * KAIST(韩国科学技术院) RLWRLD UC Berkeley(伯克利大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

Comments Project page: https://huiwon-jang.github.io/contextvla

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03612 2025-10-07 cs.AI cs.CR 70%

Cross-Modal Content Optimization for Steering Web Agent Preferences

Tanqiu Jiang, Min Bai, Nikolaos Pappas, Yanjun Qi, Sandesh Swamy

机构 * Stony Brook University(石溪大学) AWS AI Labs(亚马逊人工智能实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25047 2025-09-30 cs.AI 70%

Scaling Synthetic Task Generation for Agents via Exploration

Ram Ramrakhya, Andrew Szot, Omar Attia, Yuhao Yang, Anh Nguyen, Bogdan Mazoure, Zhe Gan, Harsh Agrawal, Alexander Toshev

机构 * Apple(苹果公司)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08052 2025-09-30 cs.CV cs.RO 70%

ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving

Yongkang Li, Kaixin Xiong, Xiangyu Guo, Fang Li, Sixu Yan, Gangwei Xu, Lijun Zhou, Long Chen, Haiyang Sun, Bing Wang, Kun Ma, Guang Chen, Hangjun Ye, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22644 2025-09-29 cs.CL cs.AI 70%

WebGen-Agent: Enhancing Interactive Website Generation with Multi-Level Feedback and Step-Level Reinforcement Learning

Zimu Lu, Houxing Ren, Yunqiao Yang, Ke Wang, Zhuofan Zong, Junting Pan, Mingjie Zhan, Hongsheng Li

机构 * Multimedia Laboratory (MMLab)(多媒体实验室)

专题命中 GUI与屏幕智能体 :VLM(abstract);visual language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21969 2025-09-29 cs.RO cs.AI 70%

DORAEMON: Decentralized Ontology-aware Reliable Agent with Enhanced Memory Oriented Navigation

Tianjun Gu, Linfeng Li, Xuhong Wang, Chenghua Gong, Jingyu Gong, Zhizhong Zhang, Yuan Xie, Lizhuang Ma, Xin Tan

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21279 2025-09-29 cs.AI 70%

XBOUND: Exploring Capability Boundaries of Device-Control Agents at the State Level

Shaoqing Zhang, Kehai Chen, Zhuosheng Zhang, Rumei Li, Rongxiang Weng, Yang Xiang, Min Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) Shanghai Jiao Tong University(上海交通大学) Meituan(美团)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17328 2025-09-23 cs.CV cs.HC 70%

UIPro: Unleashing Superior Interaction Capability For GUI Agents

Hongxin Li, Jingran Su, Jingfan Chen, Zheng Ju, Yuntao Chen, Qing Li, Zhaoxiang Zhang

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) New Laboratory of Pattern Recognition (NLPR), CASIA(中国科学院自动化所模式识别新实验室) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), CASIA(中国科学院多模态人工智能系统国家重点实验室) Hong Kong Institute of Science & Innovation, CASIA(中国科学院香港创新科学研究院) PolyU Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11824 2025-09-18 cs.HC cs.AI 70%

AppAgent v2: Advanced Agent for Flexible Mobile Interactions

Yanda Li, Chi Zhang, Wenjia Jiang, Wanqi Yang, Bin Fu, Pei Cheng, Xin Chen, Ling Chen, Yunchao Wei

机构 * University of Technology Sydney(悉尼技术大学) Tencent(腾讯) Beijing Jiaotong University(北京交通大学) Westlake University(西湖大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17406 2025-09-16 cs.CV 70%

Seeing the Undefined: Chain-of-Action for Generative Semantic Labels

Meng Wei, Zhongnian Li, Peng Ying, Xinzheng Xu

机构 * 1 School of Computer Science Technology / School of Artificial Intelligence, China University of Mining Technology Xuzhou China 2 Mine Digitization Engineering Research Center of the Ministry of Education Xuzhou China Technology Xuzhou China 2 The State Key Laboratory of CAD\&CG, Zhejiang University Hangzhou China 3 Mine Digitization Engineering Research Center of the Ministry of Education Xuzhou China 2 Mine Digitization Engineering Research Center of the Ministry of Education 2 The State Key Laboratory of CAD\&CG, Zhejiang University 3 Mine Digitization Engineering Research Center of the Ministry of Education

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏