arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-09-01 至 2026-09-01 共收录 18 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 18 篇

2508.13073 2026-09-01 cs.RO cs.CV 版本更新 91%

Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey

用于机器人操作的基于大型VLM的视觉-语言-动作模型:综述

Rui Shao, Wei Li, Lingsen Zhang, Renshan Zhang, Zhiyang Liu, Ran Chen, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(计算机科学与技术学院,哈尔滨工业大学(深圳))

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 本综述首次系统分类梳理用于机器人操作的基于大型VLM的VLA模型,明确其定义与两类架构,考察其与先进领域的集成等内容,整合进展并提供更新项目页面

Comments Under Minor Revision at IEEE TPAMI, Project Page: https://github.com/JiuTian-VL/Large-VLM-based-VLA-for-Robotic-Manipulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30396 2026-09-01 cs.AI cs.RO 新提交 86%

Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation

将基础模型搭建为物理世界智能体以推动长时程导航前沿

Zixing Lei, Gengze Zhou, Xiong-Hui Chen, Jiazhao Zhang, Yiyang Huang, Hang Yin, Haoqi Yuan, Qi Wu, Weixin Li, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Inc(阿里巴巴集团) Zhongguancun Academy(中关村学院) Adelaide University(阿德莱德大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出NavMCP框架,结合VLM推理智能体与NFM执行器实现长时程导航,在多个具身问答基准及Unitree Go2机器人上取得优于基线的性能,验证了该方法的有效性。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29483 2026-09-01 cs.CV cs.CL 新提交 83%

GeoAgent: Evaluating VLM Geolocalization Through Embodied Navigation

GeoAgent:通过具身导航评估视觉语言模型的地理定位能力

Arka Mukherjee, Soham Roy, Kartikeya Trivedi, Shreya Ghosh

机构 * KIIT Bhubaneswar(布巴内斯瓦尔KIIT大学) IIT Bhubaneswar(布巴内斯瓦尔印度理工学院)

专题命中 GUI与屏幕智能体 :VLM(title);vision-language model(abstract,abstract_cn);分类 cs.CV

AI总结 本研究提出基于街景导航的GeoAgent基准,发现VLMs在地理定位中难区分区域模式,智能体导航可提升准确率,但模型存在地区偏差且自我改进能力差,明确了具身地理定位的挑战

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29208 2026-09-01 cs.RO cs.LG 新提交 77%

AdaVLA: Adaptive Step Flow Matching for Training-free Acceleration of Vision-Language-Action Models

AdaVLA:用于无需训练的视觉-语言-动作模型加速的自适应步长流匹配

Sunghwan Han, Youngtae Han, Youngmin Yi

机构 * Sogang University(西江大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.LG

AI总结 本研究提出AdaVLA,一种无需训练的自适应框架,通过流匹配轨迹曲率度量动态调整推理步骤与MLP剪枝率,在LIBERO基准等测试中实现VLA模型加速且性能下降可忽略。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30142 2026-09-01 cs.HC 新提交 75%

LandmarkLens: Predicting and Presenting Effective Landmarks for Mixed-Reality Urban Exploration

LandmarkLens:为混合现实城市探索预测并呈现有效地标

Chu Li, Yotam Sechayk, Jared Hwang, Jon E. Froehlich, Takeo Igarashi

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 该研究针对方向感差人群空间导航困难问题,构建混合现实导航系统LandmarkLens,经实验验证其可提升方向感差者的场景识别性能,助力空间知识获取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29181 2026-09-01 cs.LG cs.AI cs.CV 版本更新 75%

SERUM: State Extraction and Refinement for User Modeling

SERUM:面向用户建模的状态提取与优化

Andy J. Phu, Karin de Langis, James Mooney, Khanh Chi Le, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 SERUM是首个无需人工标注即可从非结构化自我中心屏幕视频生成可解释过程模型的多阶段框架,经61段跨领域视频验证,其优化后的标签在马尔可夫模型预测与人工评估中均表现优异,为用户建模提供了可扩展方案。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30821 2026-09-01 cs.CV cs.AI 新提交 73%

Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling

Lucida:用于可组合真实到仿真场景建模的解析、生成与放置

Minghan Qin, Yuang Wang, Xiuyu Yang, Yushi Long, Yujian Zhang, Ruihuan Wang, Kai Ye, Yangang Zhang, Hang Li

机构 * ByteDance Seed(字节跳动Seed) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 Lucida是一种可组合真实到仿真场景建模方法,通过重新分配流程要求,在三个步骤中利用真实采集的可靠信息,结合GizmoAct策略提升了场景建模相关任务的性能。

Comments Project Page: https://lucida-r2s.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17511 2026-09-01 cs.RO cs.AI cs.CV 版本更新 73%

MagicSim: A Unified Infrastructure for Executable Embodied Interaction

MagicSim: 可执行具身交互的统一基础设施

Haoran Lu, Songling Liu, Yue Chen, Guo Ye, Mutian Shen, Shuyang Yu, Yu Xiao, Shang Wu, Jiayi Wang, Jianshu Zhang, Jihai Zhao, Xiangtian Gui, Chuye Hong, Yuran Wang, Maojiang Su, Ruihai Wu, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Peking University(北京大学) University of California, Berkeley(加州大学伯克利分校) ShanghaiTech University(上海科技大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出MagicSim,一个基于确定性批处理运行时和共享MDP的具身交互基础设施,通过YAML规范解耦内容、放置、行为和智能体暴露,统一世界构建、执行、评估和自动生成轨迹。

Comments v2:Expanded the supplementary materials by adding three sections-Scene YAML, Robot Embodiment List, and Atomic Skill List-corrected typographical errors, and corrected author-affiliation information that was inaccurate in the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29114 2026-09-01 cs.RO cs.AI 新提交 70%

CGFM-Nav: Cognitive Graph-Field Memory for Semantic-Guided Lifelong Multimodal Embodied Navigation

CGFM-Nav:用于语义引导的终身多模态具身导航的认知图场记忆

Yuxiang Xiao, Xibei Chen, Xin Zhou, Jie Chen, Yifeng Zhang, Guillaume Sartoretti

机构 * National University of Singapore(新加坡国立大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对视觉与语言导航中环境表征的不足,提出CGFM及基于其的CGFM-Nav框架,在GOAT-Bench实验中提升了导航的成功率与SPL,验证了方法的有效性。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04412 2026-09-01 cs.AI cs.CL cs.HC 版本更新 70%

Beyond Pixels: Exploring DOM Downsampling for LLM-Based Web Agents

超越像素:探索面向基于大语言模型的智能体的DOM下采样

Thassilo M. Schiepanski, Nicholas Piël

专题命中 GUI与屏幕智能体 :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出D2Snap算法对DOM下采样,解决原始DOM令牌占用过大的问题,经评估其在GPT-4o智能体上的成功率达73%,接近基于GUI快照的基线性能。

Comments 21 pages, LaTeX, print version; updated figures (2, 4)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28718 2026-09-01 cs.RO cs.AI cs.CV cs.ET cs.SY eess.SY 新提交 62%

RoboPhys-3D: A Comprehensive Embodied World Model Evaluation via 3D Reconstruction

RoboPhys-3D:通过三维重建进行全面的具身世界模型评估

Tianyi Wang, Jiazhou Chen, Yiming Xu, Xiangyu Li, Tianyi Zeng, Chih-Hsien Chou, Ning Lu, Liang Peng, Junfeng Jiao, Christian Claudel

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Purdue University(普渡大学) Futurewei Technologies, Inc(星纪时代科技公司)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究推出基于RoboTwin 2.0的三维具身世界模型基准RoboPhys-3D,含50个操作任务等数据,提出两个评估分数,发现Cosmos 3的RoboPhyscore最高,该分数与人类评估一致性强。

Comments 66 pages, 12 figures, 55 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30760 2026-09-01 cs.LG 新提交 57%

PRACTICE: From Experience to Expertise in Self-Evolving Embodied Agents

PRACTICE:从经验到自进化具身智能体的专业能力

Ziyi Bai, Siqi Li, Tinglei Huang, Börje F. Karlsson

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院(BAAI)) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.LG

AI总结 PRACTICE通过训练技能学习者维护技能库,结合两阶段课程训练与在线编辑蒸馏,在EB-ALFRED等任务上实现优于基线的自进化具身智能体性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30369 2026-09-01 cs.AI cs.HC 新提交 57%

Augmenting Human Performance with an XR Agent Learning from Online Behavior and BCI Evidence

利用从在线行为和BCI证据学习的XR智能体增强人类表现

Ziheng Li, Xichen He, Haoyan Chen, Charlie Zou, Sheng Bai, Benjamin Yang, Mengyuan Wu, Jake Ledner, Yi-Jie Cheng, Akito Yamauchi, Dishita G Turakhia, Steven Feiner, Paul Sajda

机构 * Columbia University(哥伦比亚大学) Emory University(埃默里大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 研究人员提出OLIVE框架,通过融合EEG与XR游戏行为信号,适配基础模型生成实时辅助智能体,在目标切换时收敛更快,可提升用户目标检测能力且不依赖个人技能。

Comments To appear in ACM UIST 2026. 30 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30207 2026-09-01 cs.CR cs.AI 新提交 57%

SIR: Self-improving Red-teaming for Compute Use Agents

SIR:面向计算使用智能体的自改进红队测试

Chen Xiong, Zhiyuan He, Pin-Yu Chen, Stjepan Picek, Tsung-Yi Ho

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出SIR,一种针对操作系统层面计算使用智能体的黑盒间接提示注入攻击,通过迭代反馈循环提炼策略,使攻击成功率显著提升且可跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29387 2026-09-01 cs.AI cs.SE 新提交 57%

EvoGenUI-Bench: Evaluating LLMs as Multi-Turn Generative UI Assistants

EvoGenUI-Bench:评估大型语言模型作为多轮生成式UI助手的性能

Yue Peng, Lanke Xia, Zihan Wang, Jiahao Ye, Ke Ning, Hongyi Wen

机构 * New York University Shanghai(上海纽约大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 本文提出EvoGenUI-Bench多轮生成式UI评估基准,发现现有8个大型语言模型在该基准上轮次通过率最高74.9%、五轮回合完成率仅37.3%,且工具接地任务的跨轮次保留率更低,揭示生成式UI需关注多轮状态同步问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30117 2026-09-01 cs.AI 版本更新 57%

VLA-Trace: Diagnosing Vision-Language-Action Models through Representation and Behavior Tracing

VLA-Trace: 通过表示与行为追踪诊断视觉-语言-动作模型

Haoyuan Shi, Xiancong Ren, Yingji Zhang, Qinfan Zhang, Jiayu Hu, Haozhe Shan, Han Dong, Jinpeng Lu, Yinda Chen, Yi Zhang, Yong Dai, Xiaozhu Ju

机构 * University of Science and Technology of China(中国科学技术大学) University of Manchester(曼彻斯特大学) Beihang University(北航) Fudan University(复旦大学) University of New South Wales(新南威尔士大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 提出VLA-Trace诊断框架,通过表示演化、因果控制归因和行为表现分析,揭示VLA模型在多模态知识向具身控制转化中的机制,发现不同模型在微调适应、多模态路由和语义遵循上的差异与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13318 2026-09-01 cs.AI cs.CL 版本更新 57%

WebXSkill: Skill Learning for Autonomous Web Agents

WebXSkill:自主网页代理的技能学习

Zhaoyang Wang, Qianhui Wu, Xuchao Zhang, Chaoyun Zhang, Wenlin Yao, Fazle Elahi Faisal, Baolin Peng, Si Qin, Suman Nath, Qingwei Lin, Chetan Bansal, Dongmei Zhang, Saravan Rajmohan, Jianfeng Gao, Huaxiu Yao

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft(微软)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 WebXSkill通过可执行技能框架解决自主网页代理在长周期任务中的执行与适应问题,提升任务成功率。

Comments Accepted to Findings of EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23263 2026-09-01 cs.AI 版本更新 57%

GUI-PRA: Process Reward Agent for GUI Tasks

GUI-PRA:面向GUI任务的过程奖励智能体

Tao Xiong, Xavier Hu, Yurun Chen, Yuhang Liu, Changqiao Wu, Pengzhi Gao, Wei Liu, Jian Luan, Shengyu Zhang

机构 * Zhejiang University(浙江大学) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 针对长程GUI自动化的错误累积与视觉歧义问题,本文提出GUI-PRA,通过主动调查式评估实现性能提升,在AndroidWorld等数据集上较标准PRM取得显著进步。

详情

展开后加载摘要…

URL PDF HTML 收藏