arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1576 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1576 篇

2604.05014 2026-04-08 cs.RO cs.AI cs.CV 73%

StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing

StarVLA:一种积木式代码库,用于视觉-语言-动作模型开发

StarVLA Community

机构 * Von Neumann Institute, HKUST(香港科技大学冯·诺依曼研究所)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 StarVLA通过模块化架构、可重用训练策略和统一评估接口,解决VLA方法碎片化问题,提升可复现性和跨架构兼容性。

Comments Open-source VLA infra, Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01371 2026-04-03 cs.CV cs.AI cs.RO eess.IV 73%

AffordTissue: Dense Affordance Prediction for Tool-Action Specific Tissue Interaction

AffordTissue: 密集的工具-动作特定组织交互 affordance 预测

Aiza Maksutova, Lalithkumar Seenivasan, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Yiqing Shen, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AffordTissue框架,通过多模态方法预测手术中工具-动作特定的组织affordance区域,改进了视觉语言模型在密集手术affordance预测中的表现,为安全手术自动化提供空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00055 2026-04-02 cs.RO cs.CV cs.LG 73%

Generalizable Dense Reward for Long-Horizon Robotic Tasks

可泛化的密集奖励用于长周期机器人任务

Silong Yong, Stephen Sheng, Carl Qi, Xiaojie Wang, Evan Sheehan, Anurag Shivaprasad, Yaqi Xie, Katia Sycara, Yesh Dattatreya

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Robotics(亚马逊机器人) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出VLLR框架,结合外部奖励和内部奖励提升长周期机器人任务性能,通过任务分解和自信心引导实现无需人工奖励工程的高效训练。

Comments Project page: https://silongyong.github.io/vllr_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26837 2026-03-31 cs.RO cs.AI cs.CV 73%

SpatialAnt: Autonomous Zero-Shot Robot Navigation via Active Scene Reconstruction and Visual Anticipation

SpatialAnt:通过主动场景重建与视觉预判实现自主零样本机器人导航

Jiwen Zhang, Xiangyu Shi, Siyuan Wang, Zerui Li, Zhongyu Wei, Qi Wu

机构 * Fudan University(复旦大学) University of Southern California(南加州大学) Adelaide University(阿德莱德大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 SpatialAnt通过主动场景重建和视觉预判机制,解决零样本机器人导航中自建场景的不完整和噪声问题,提升导航性能。

Comments 10 pages, 4 figures, 5 tables. Homepage: https://imnearth.github.io/Spatial-X/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15624 2026-03-18 cs.CV cs.AI cs.RO 73%

Exploring the Use of VLMs for Navigation Assistance for People with Blindness and Low Vision

探索视觉语言模型在帮助视障和低视力人士导航中的应用

Yu Li, Yuchen Zheng, Giles Hamilton-Fletcher, Marco Mezzavilla, Yao Wang, Sundeep Rangan, Maurizio Porfiri, Zhou Yu, John-Ross Rizzo

机构 * Columbia University(哥伦比亚大学) New York University(纽约大学) Politecnico di Milano(米兰理工大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本文评估了多种VLMs在基础视觉技能和导航任务中的表现,发现GPT-4o在空间推理和场景理解上表现最佳,而开源模型在复杂环境中存在不足,需进一步改进以提升实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09079 2026-03-11 cs.CV cs.AI cs.RO 73%

GST-VLA: Structured Gaussian Spatial Tokens for 3D Depth-Aware Vision-Language-Action Models

GST-VLA: 结构化高斯空间标记用于3D深度感知视觉-语言-动作模型

Md Selim Sarowar, Omer Tariq, Sungho Kim

机构 * Yeungnam University(延世大学) Korea Advanced Institute of Science and Technology, KAIST(韩国科学技术院)

专题命中 GUI与屏幕智能体 :VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 GST-VLA通过结构化高斯空间标记和深度感知链式思维提升3D视觉-语言-动作模型的精度和性能。

Comments The results presented in this paper are preliminary. Please note that the experiments are currently ongoing, and the final data is subject to change upon the completion of the study. All ideas, results, methods, and any content herein are the sole property of the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02951 2026-03-10 cs.LG cs.CV 73%

CGL: Advancing Continual GUI Learning via Reinforcement Fine-Tuning

CGL: 通过强化微调推进连续GUI学习

Zhenquan Yao, Zitong Huang, Yihan Zeng, Jianhua Han, Hang Xu, Chun-Mei Feng, Jianwei Ma, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University College Dublin(都柏林大学) Peking University(北京大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 CGL通过强化微调与监督微调的协同优化,解决GUI连续学习中遗忘旧任务的问题,提出AndroidControl-CL基准验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08714 2026-03-05 cs.CV cs.CL cs.LG 73%

Generating Fine Details of Entity Interactions

生成实体交互的细节

Xinyi Gu, Jiayuan Mao

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种基于多模态大语言模型的方法,通过分解和细化过程提升图像中实体交互细节的生成质量。

Comments EMNLP 2025. Project Page: https://detailscribe.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20502 2026-02-25 cs.AI cs.LG 73%

ActionEngine: From Reactive to Programmatic GUI Agents via State Machine Memory

ActionEngine: 通过状态机内存实现从响应式到程序化GUI代理的转变

Hongbin Zhong, Fazle Faisal, Luis França, Tanakorn Leesatapornwongsa, Adriana Szekeres, Kexin Rong, Suman Nath

机构 * Microsoft Research(微软研究院)

专题命中 GUI与屏幕智能体 :vision language model(abstract);grounding(abstract);分类 cs.AI、cs.LG

AI总结 ActionEngine通过状态机内存实现从响应式到程序化GUI代理的转变,提升效率和准确性,减少成本和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08629 2025-12-10 cs.AI cs.CV cs.HC 73%

See-Control: A Multimodal Agent Framework for Smartphone Interaction with a Robotic Arm

See-Control: 一种多模态代理框架用于智能手机与机械臂的交互

Haoyu Zhao, Weizhong Ding, Yuhao Yang, Zheng Tian, Linyi Yang, Kun Shao, Jun Wang

机构 * University College London(伦敦大学学院) Imperial College London(伦敦帝国学院) Huawei Noah’s Ark Lab(华为诺亚实验室) ShanghaiTech University(上海科技大学) Southern University of Science(南方科技大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 See-Control通过直接与机械臂交互实现智能手机操作,无需ADB或系统后台访问,提供了一个平台无关的多模态代理框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24838 2025-11-11 cs.CV cs.AI 73%

VideoCAD: A Dataset and Model for Learning Long-Horizon 3D CAD UI Interactions from Video

Brandon Man, Ghadi Nehme, Md Ferdous Alam, Faez Ahmed

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21724 2025-10-29 cs.CV cs.AI cs.HC 73%

OmniResponse: Online Multimodal Conversational Response Generation in Dyadic Interactions

Cheng Luo, Jianghui Wang, Bing Li, Siyang Song, Bernard Ghanem

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24183 2025-09-30 cs.CL cs.AI cs.LG 73%

Retrieval-augmented GUI Agents with Generative Guidelines

Ran Xu, Kaixin Ma, Wenhao Yu, Hongming Zhang, Joyce C. Ho, Carl Yang, Dong Yu

机构 * Emory University(埃默里大学) Tencent AI Lab(腾讯AI实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21189 2025-09-26 cs.RO cs.AI cs.CV 73%

Human-like Navigation in a World Built for Humans

Bhargav Chandaka, Gloria X. Wang, Haozhe Chen, Henry Che, Albert J. Zhai, Shenlong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments CoRL 2025. Project website: https://reasonnav.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07406 2025-08-12 cs.RO cs.AI cs.CV 73%

AgriVLN: Vision-and-Language Navigation for Agricultural Robots

Xiaobei Zhao, Xingqi Lyu, Xiang Li

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24044 2025-07-01 cs.CV cs.AI cs.RO 73%

A Survey on Vision-Language-Action Models for Autonomous Driving

Sicong Jiang, Zilin Huang, Kangan Qian, Ziang Luo, Tianze Zhu, Yang Zhong, Yihong Tang, Menglin Kong, Yunlong Wang, Siwen Jiao, Hao Ye, Zihao Sheng, Xin Zhao, Tuopu Wen, Zheng Fu, Sikai Chen, Kun Jiang, Diange Yang, Seongjin Choi, Lijun Sun

机构 * McGill University(麦吉尔大学) Tsinghua University(清华大学) Xiaomi Corporation(小米公司) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Minnesota–Twin Cities(明尼苏达大学双城分校) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(智能绿色车辆与移动国家重点实验室,清华大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09172 2025-06-18 cs.LG cs.CV 73%

An Open-Source Software Toolkit & Benchmark Suite for the Evaluation and Adaptation of Multimodal Action Models

Pranav Guruprasad, Yangyue Wang, Sudipta Chowdhury, Jaewoo Song, Harshvardhan Sikka

机构 * Metarch Manifold Research Georgia Institute of Technology(佐治亚理工学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

Comments ICML CodeML Workshop, 13 Pages, 6 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08012 2025-06-10 cs.AI cs.CV 73%

GUI-Reflection: Empowering Multimodal GUI Models with Self-Reflection Behavior

Penghao Wu, Shengnan Ma, Bo Wang, Jiaheng Yu, Lewei Lu, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院)

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Project Page at https://penghao-wu.github.io/GUI_Reflection/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19381 2025-06-04 cs.AI cs.CV cs.RO 73%

DiffVLA: Vision-Language Guided Diffusion Planning for Autonomous Driving

Anqing Jiang, Yu Gao, Zhigang Sun, Yiru Wang, Jijun Wang, Jinghao Chai, Qian Cao, Yuweng Heng, Hao Jiang, Yunda Dong, Zongzheng Zhang, Xianda Guo, Hao Sun, Hao Zhao

机构 * RIX, Bosch(博世 RIX) AIR, Tsinghua University(清华大学人工智能研究院) Shanghai University(上海大学) Shanghai Jiao Tong University(上海交通大学) Southeast University Team(东南大学团队)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 4pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05485 2025-05-13 cs.RO cs.AI cs.CV 73%

HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation

Yi Li, Yuquan Deng, Jesse Zhang, Joel Jang, Marius Memmel, Raymond Yu, Caelan Reed Garrett, Fabio Ramos, Dieter Fox, Anqi Li, Abhishek Gupta, Ankit Goyal

机构 * NVIDIA University of Washington(华盛顿大学) University of Southern California(南加州大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments update related work and results on VQA benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19854 2025-04-29 cs.RO cs.AI cs.CV 73%

NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks

Chia-Yu Hung, Qi Sun, Pengfei Hong, Amir Zadeh, Chuan Li, U-Xuan Tan, Navonil Majumder, Soujanya Poria

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Lambda Labs(Lambda实验室)

专题命中 GUI与屏幕智能体 :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09612 2025-04-03 cs.CV cs.AI cs.CL 73%

Olympus: A Universal Task Router for Computer Vision Tasks

Yuanze Lin, Yunsheng Li, Dongdong Chen, Weijian Xu, Ronald Clark, Philip H. S. Torr

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted to CVPR 2025, Project webpage: http://yuanze-lin.me/Olympus_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10819 2025-03-25 cs.CV cs.AI cs.CL 73%

GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding

Dongping Chen, Yue Huang, Siyuan Wu, Jingyu Tang, Liuyi Chen, Yilin Bai, Zhigang He, Chenlong Wang, Huichi Zhou, Yiqiang Li, Tianshuo Zhou, Yue Yu, Chujie Gao, Qihui Zhang, Yi Gui, Zhen Li, Yao Wan, Pan Zhou, Jianfeng Gao, Lichao Sun

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11905 2025-02-25 cs.AI cs.CL cs.CV cs.HC 73%

Tur[k]ingBench: A Challenge Benchmark for Web Agents

Kevin Xu, Yeganeh Kordi, Tanay Nayak, Adi Asija, Yizhong Wang, Kate Sanders, Adam Byerly, Jingyu Zhang, Benjamin Van Durme, Daniel Khashabi

专题命中 GUI与屏幕智能体 :vision-language model(abstract);InternVL(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10342 2025-02-04 cs.CV cs.AI 73%

Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining

Zhiqi Ge, Juncheng Li, Xinglei Pang, Minghe Gao, Kaihang Pan, Wang Lin, Hao Fei, Wenqiao Zhang, Siliang Tang, Yueting Zhuang

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05273 2025-02-04 cs.CV cs.AI cs.RO 73%

HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers

Jianke Zhang, Yanjiang Guo, Xiaoyu Chen, Yen-Jen Wang, Yucheng Hu, Chengming Shi, Jianyu Chen

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Accepted to CORL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08768 2024-11-14 cs.CV cs.AI 73%

Sharingan: Extract User Action Sequence from Desktop Recordings

Yanting Chen, Yi Ren, Xiaoting Qin, Jue Zhang, Kehong Yuan, Lu Han, Qingwei Lin, Dongmei Zhang, Saravan Rajmohan, Qi Zhang

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11872 2024-10-18 cs.HC cs.AI cs.LG 73%

ClickAgent: Enhancing UI Location Capabilities of Autonomous Agents

Jakub Hoscilowicz, Bartosz Maj, Bartosz Kozakiewicz, Oleksii Tymoshchuk, Artur Janicki

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

Comments The code for ClickAgent is available at github.com/Samsung/ClickAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17523 2024-09-27 cs.CV cs.AI 73%

EAGLE: Egocentric AGgregated Language-video Engine

Jing Bi, Yunlong Tang, Luchuan Song, Ali Vosoughi, Nguyen Nguyen, Chenliang Xu

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted by ACMMM 24

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09029 2024-03-15 cs.HC cs.AI cs.CV 73%

Unlocking the conversion of Web Screenshots into HTML Code with the WebSight Dataset

Hugo Laurençon, Léo Tronchon, Victor Sanh

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏