arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-26 至 2026-08-26 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 7 篇

2608.24885 2026-08-26 cs.RO cs.CV 新提交 70%

Do Robotic World Models Really Follow Actions? Diagnosing and Aligning Action-Conditioned Generation for Policy Learning

机器人世界模型真的会遵循动作吗?面向策略学习的动作条件生成诊断与对齐

Sixiang Chen, Jiaming Liu, Jixian Wu, Yichen Guo, Tinghao Wang, Siyuan Qian, Hao Chen, Jiajun Cao, Jian Tang, Shanghang Zhang

机构 * Peking University(北京大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) New York University(纽约大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 GUI与屏幕智能体 :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本文针对动作条件世界模型的动作遵循问题,提出WorldEcho诊断工具与WorldSync改进方法,经实验验证WorldSync可提升动作遵循性能,作为可靠模拟器助力策略改进并提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00188 2026-08-26 cs.CV cs.AI cs.LG 版本更新 67%

ST-Lite: Training-Free KV Cache Compression with Spatio-Trajectory Guidance for Long-Horizon GUI Agents

通过无训练KV缓存压缩实现高效的长周期GUI代理

Bowen Zhou, Zhou Xu, Wanli Li, Jingyu Xiao, Pingan Gan, Haoqian Wang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ST-Lite通过无训练的KV缓存压缩方法,提升GUI代理的解码效率,实现2.45倍加速并保持性能优势。

Comments Accepted to Findings of EMNLP 2026. Camera-ready version. 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18532 2026-08-26 cs.CV cs.AI cs.RO 版本更新 62%

VLANeXt: Recipes for Building Strong VLA Models

VLANeXt: 构建强大VLA模型的配方

Xiao-Ming Wu, Bin Fan, Kang Liao, Jian-Jian Jiang, Runze Yang, Yihang Luo, Zhonghua Wu, Wei-Shi Zheng, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过统一框架和评估设置重新审视VLA设计空间,系统分析了基础组件、感知要素和动作建模视角,总结出12项关键发现,提出了一种简单有效的VLA模型VLANeXt,并在LIBERO和LIBERO-plus基准测试中超越了现有方法,同时提供了易于使用的代码库。

Comments Accepted in ICML 2026, Project Page: this https URL (https://dravenalg.github.io/VLANeXt/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24680 2026-08-26 cs.CV 新提交 57%

Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training

Game2World引擎:解锁野外游戏视频用于世界模型训练

Wenxuan Shen, Dongna Jin, Dongping Chen

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 针对游戏视频界面干扰世界模型训练的问题,提出GameUI-Taxonomy与G2WEngine框架构建Game2World数据集,研发无掩码UI去除模型GameCleaner,提升了世界模型训练效果与UI去除性能。

Comments We are currently building Gaming World Model and data engine that transfers game dynamics to robotics. Feel free to contact Dongping Chen (dongpingchen0612@gmail.com) if you are interested in research collaboration or financial support

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24138 2026-08-26 cs.CV 新提交 57%

Rubrics as Visual-Repair Context for Self-Evolving UI-to-Code Generation

作为自演进UI转代码生成视觉修复上下文的评分标准

Tianyi Xiong, Zhengyuan Yang, Xiaofei Wang, Chung-Ching Lin, Ruichun Ma, Kevin Lin, Zhendong Wang, Linjie Li, Chenxi Liu, Ruibo Chen, Ramani Duraiswami, Heng Huang, Lijuan Wang

机构 * University of Maryland(马里兰大学) Microsoft(微软公司)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 该研究针对视觉语言模型UI转代码自演进不稳定的问题,提出RubSE框架,利用评分标准作为视觉修复上下文,在多模型多基准上显著提升了生成性能与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24043 2026-08-26 cs.CV 新提交 57%

ConsensusTAS: Self-Supervised Temporal Action Segmentation for Long-Horizon Construction Videos

ConsensusTAS:面向长时程施工视频的自监督时序动作分割

Xiaoshan Zhou, Yafei Sun

机构 * School of Project Management, University of Sydney(悉尼大学项目管理学院) School of Civil and Environmental Engineering, University of New South Wales(新南威尔士大学土木与环境工程学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出自监督时序动作分割模型ConsensusTAS,无需标注且可在CPU运行,在公开数据集及真实施工视频上的性能优于现有最优方法,可用于人机协同与视频监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24295 2026-08-26 cs.IR 新提交 50%

RecGPT-Mobile-V2 Technical Report

RecGPT-Mobile-V2 技术报告

Lingqing Zhang, Bin Zhang, Weipeng Huang, Chengfei Lv, Chengyu Lai, Chuxin Chen, Dimin Wang, Han Zhu, Hongtao Cheng, Jialin Zhu, Jian Wang, Jiuning Lin, Junqing Wu, Li Chen, Qichao Ma, Ruiquan Lan, Shuai Zhong, Tao Wang, Xiaodong Zhu, Yinjiang Cai, Yinnan Song, Yipeng Yu, Yuan Liu, Yuning Jiang, Zhaode Wang, Zhibo Xiao, Zhixin Ma, Zihong Huang

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 本文提出 RecGPT-Mobile-V2 端到端框架,解决个性化查询预测的设备端挑战,经实验验证其在查询质量、失败率等指标上表现更优,推理策略更具针对性。

详情

展开后加载摘要…

URL PDF HTML 收藏