Proposer-Agent-Evaluator(PAE): Autonomous Skill Discovery For Foundation Model Internet Agents
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 GUI与屏幕智能体 :visual language model(abstract);grounding(abstract)
Comments Published at AAAI 2025
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract)
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project Webpage: https://cogact.github.io/
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Github repo: https://github.com/ok-robot/ok-robot
专题命中 GUI与屏幕智能体 :vision-language model(abstract);vision language model(abstract)
Comments 15 pages, 9 figures
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted to the Conference on Robot Learning (CoRL) 2024
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 8 pages, 5 figures. This paper has been accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2024
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted at the 2023 IEEE International Conference on Robotics and Automation (ICRA). Project page: https://vlmaps.github.io
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments NAACL 2022 Findings (18 pages)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments CMU Ph.D. Thesis, March 2021. For more details see http://devendrachaplot.github.io/
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments To appear in Robotics: Science and Systems (RSS), 2018
从视觉控件到UI代码:高效的基于工具的生成
机构 * McMaster University(麦克马斯特大学) ; University of Toronto(多伦多大学) ; Concordia University(康考迪亚大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.LG
AI总结 本研究提出轻量级工具框架WidgetGen,在6个多模态模型和1000个控件上,其视觉重建指标优于直接提示和Widget2Code,且重建的图像-代码对可提升Qwen系列模型性能
Comments ECCV2026 (MUCG Workshop)
面向移动端检索增强生成的轻量级分块选择
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文针对移动端RAG部署的成本问题,提出结合LLM侧查询意图、MoE路由信号与检索分块嵌入的轻量级分块选择方法,提升了排名1的证据选择性能。
Qwen-UI-Agent技术报告:面向下一代以真实世界为中心的基础图形用户界面智能体
机构 * Alibaba Group(阿里巴巴集团)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本研究推出以真实世界为中心的基础GUI智能体Qwen-UI-Agent,结合多环境与数据飞轮等机制,在移动端基准达最优,在多类任务上表现具竞争力。
桌面增量基准测试:计算机使用模型是否理解桌面GUI转换?
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 研究计算机使用模型对桌面GUI转换的理解,引入桌面增量基准测试(DDB)及其实例、任务,评估多个模型家族,发现排序不饱和,任务上下文对匹配有影响,单动作推断家族更难,DDB填补诊断层,助力改进桌面CUA。
用于精神分裂症认知康复的交互式视觉语言平台
机构 * Computer Science Faculty, USTHB University(USTHB大学计算机科学学院) ; RIIMA Laboratory(RIIMA实验室)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 针对精神分裂症患者认知康复任务中动作评估依赖人工观察的问题,提出基于视觉语言模型的自动化框架,通过分析视频和微调模型验证动作,收集数据集评估,有效连接物理与临床反馈,提供可扩展客观方案。
用于视觉运动策略学习的有序动作令牌
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 研究针对动作令牌化存在的问题,提出有序动作令牌化(OAT)方法,利用带特定机制的变换器将动作块离散化,满足高压缩率等三个需求,在多种策略和任务中验证,能提升策略性能并增强推理灵活性。
HyWorldVLA:一种用于自动驾驶的具有混合世界建模的视觉-语言-动作模型
机构 * Automotive New Technology Research Institute, BYD Company Limited(比亚迪汽车新技术研究院)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 研究针对自动驾驶中视觉-语言-动作模型的不足,提出HyWorldVLA框架,统一像素级监督与潜在表征学习。预训练阶段预测视频潜在并重建帧,微调阶段预测潜在特征生成轨迹,实验表明其性能优于基线,还建立了世界模型噪声鲁棒性评估新基准。
Comments 20 pages with 13 figures
行动前预测:基于未来状态条件的视觉语言导航
机构 * Noah’s Ark Lab, 2012 Labs, Huawei(诺亚方舟实验室,2012实验室,华为)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究视觉语言导航中标准行为克隆问题,提出FSC-VLN方法,通过添加未来查询令牌并经训练后移除的目标分支将其隐藏状态与未来视觉嵌入对齐,实验表明该方法在R2R val-unseen上提升了相关指标。
Comments 9 pages, 1 figure, 4 tables
用于机器人动作表示的语义锚定
机构 * Peking University(北京大学) ; Eastern Institute of Technology, Ningbo(宁波东方理工大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究VLA模型微调后动作表示结构受损问题,受镜像神经元理论启发,通过系统探测证实结构变化与任务表现相关。提出即插即用方法,将动作表示锚定到语义流形并分解通道,经多基准测试验证,有效提升了模型在真实世界任务中的表现。
Comments Project Page: https://xy02-05.github.io/SemanticMN
动作QFormer:视觉-语言-动作模型中动作监督下的结构化表示塑造
机构 * Shanghai Qizhi Institute(上海期智研究院) ; The Chinese University of Hong Kong(香港中文大学) ; Hong Kong Embodied AI Lab(香港具身人工智能实验室) ; Tsinghua University(清华大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 研究视觉-语言-动作模型中动作监督问题,提出动作QFormer,通过基于指令的查询重组多模态信息。在零样本模拟到真实导航中提升了任务成功率、动作生成正确性等,还改变动作监督塑造多模态表示的方式,为提高VLA性能提供新思路。
生长-剪枝-冻结网络:用于嗅觉导航的自适应与持续学习技术
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 提出生长-剪枝-冻结(GPF)网络框架,通过动态调整策略网络层数实现持续学习,在湍流羽流导航任务中达到94%成功率,并推广到其他机器学习任务。
Comments Accepted as poster to the Reinforcement Learning in Big Worlds Workshop at the 2026 Reinforcement Learning Conference
TS-Mask VLA:用于视觉-语言-动作模型的具有有效桥接的二维时空掩码
机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学网络系统与控制研究所) ; Tongji University(同济大学)
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.AI
AI总结 研究针对视觉-语言-动作模型问题,提出TS-Mask VLA框架,基于离散扩散动作专家和时空二维掩码策略,在模拟基准和现实任务实验中表现出色,验证了设计有效性。
Comments 9 pages, 5 figures, accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
用于无人机机器人和双手操作的视觉语言动作(VLA)模型综述
机构 * Chef Robotics ; RovifyLab ; IT Application Research Center, Jeonbuk Regional Branch ; Department of Electrical, Computer and Software Engineering(电气与计算机软件工程系)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 综述2017 - 2026年183篇文献,围绕视觉语言动作模型在无人机机器人和双手操作方面的应用,涵盖多维度,表明双手VLA相关策略可转移至无人机系统,还确定了两领域的14个研究方向。
Comments 56 pages, 11 figures, 16 tables
UI2App:可执行Web应用程序生成中视觉交互推理的基准测试
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对现有网页生成基准测试对交互能力评估不足的问题,引入UI2App基准测试,通过设计端到端管道沿四个维度评估工件,实验发现视觉与交互能力不匹配,复杂交互是瓶颈,为相关研究提供了参考。