What Limits Vision-and-Language Navigation ?
什么是限制视觉-语言导航的因素?
机构 * HKUST(GZ)(香港科技大学(广州)) ; JD Explore Academy(京东探索研究院)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出StereoNav框架,通过引入目标-位置先验和立体视觉,提升真实环境导航一致性,实验显示其在RGB性能和参数效率上优于现有方法。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
什么是限制视觉-语言导航的因素?
机构 * HKUST(GZ)(香港科技大学(广州)) ; JD Explore Academy(京东探索研究院)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出StereoNav框架,通过引入目标-位置先验和立体视觉,提升真实环境导航一致性,实验显示其在RGB性能和参数效率上优于现有方法。
STAR:语义-时间自适应表示学习用于少样本动作识别
机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) ; Engineering Research Center of Key Software Technologies for Smart City Perception and Planning, Ministry of Education(教育部智能城市感知与规划关键软件技术工程研究中心)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 STAR通过语义对齐和时间感知模块,解决少样本动作识别中的语义-时间对齐和多尺度时间动态建模问题,提升模型在有限样本下的泛化能力。
Comments Accepted for publication in IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)
GUIGuard-Bench:面向隐私保护GUI代理的通用评估
机构 * Beijing Normal University(北京师范大学) ; Zhongguancun Academy(中关村学院) ; University of Science and Technology of China(中国科学技术大学) ; A*STAR ; Zhongguancun Institution of Artificial Intelligence(中关村人工智能研究所)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 GUIGuard-Bench通过241个真实GUI代理轨迹和4080张截图,评估隐私保护GUI代理的隐私识别、规划一致性和保护策略影响,揭示隐私识别是实际应用中的关键瓶颈。
WebGym: 通过现实任务扩大视觉网络代理的训练环境
机构 * Microsoft(微软) ; UIUC(伊利诺伊大学香槟分校) ; CMU(卡内基梅隆大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 WebGym通过大规模现实任务和异步轨迹采样系统提升视觉网络代理训练效果,使基座模型在分布外测试集上的成功率显著提升。
Comments Completed acknowledgements
基于LLM引导的动作空间的强化学习用于可合成先导优化
机构 * Emory University(埃默里大学) ; University of Oxford(牛津大学) ; Independent Researcher(独立研究者)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文提出MolReAct框架,通过合成约束的动作空间和GRPO算法优化先导分子,提升性质同时保证合成可行性,实现高效分子生成。
VERTIGO:用于电影摄像机轨迹生成的视觉偏好优化
机构 * Shanghai University Shanghai Engineering Research Center of Motion Picture Special Effects LIX, \'Ecole Polytechnique, CNRS, IPP magenta http://vertigo.magic-lab.tech/
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出VERTIGO,通过视觉偏好优化提升摄像机轨迹生成的质量,通过实时渲染和视觉语言模型优化,提高画面构图和视觉效果。
Comments 28 pages, 10 figures
VLA-Forget:面向具身基础模型的视觉-语言-动作去学习
机构 * Florida International University(佛罗里达国际大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出VLA-Forget框架,通过结合感知选择性编辑与层选择性推理去学习,提升去学习效果,保留感知特性和推理能力,减少量化恢复。
Comments 18 pages, 9 figures, Accepted to ACL-2026, KnowFM
OpenMobile: 通过任务和轨迹合成构建开放移动代理
机构 * Nanjing University(南京大学) ; SenseTime(秒速) ; Nanyang Technological University(南洋理工大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; The University of Hong Kong(香港大学) ; Xi’an Jiaotong University(西安交通大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出OpenMobile框架,通过可扩展的任务合成管道和策略切换策略生成高质量任务指令和轨迹,实现移动代理在AndroidWorld等基准测试中取得显著成绩。
Comments Work in progress
RiskWebWorld: 电子商务风险管理中GUI代理的现实交互基准
机构 * Ant Group(蚂蚁集团)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 RiskWebWorld是一个用于评估GUI代理在电子商务风险管理中能力的现实交互基准,揭示了通用模型与专用模型在长周期专业任务中的显著能力差距。
WebChain:一个大规模的人工标注的真实世界网页交互轨迹数据集
机构 * Fudan University(复旦大学) ; IMean AI ; WebAgentLab
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出WebChain数据集,包含31,725条轨迹和318k步,通过视觉、结构和动作数据的三元对齐提供多模态监督,提出双中层训练方法,实现了WebChainBench等公开GUI基准的最先进性能。
StarVLA-$α$:降低视觉-语言-动作系统复杂度
机构 * HKUST(香港科技大学) ; XJTU(西安交通大学) ; CUHK(香港中文大学) ; THU(清华大学) ; Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) ; SmartMore Ltd.(SmartMore有限公司)
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.AI
AI总结 本文提出StarVLA-$α$,通过简化架构与流程降低实验干扰,系统分析VLA设计关键因素,在多个基准测试中表现优异,优于现有模型20%。
InstrAct:迈向指令视频中的动作中心理解
机构 * Pennsylvania State University(宾夕法尼亚州立大学) ; Microsoft Research(微软研究院) ; Nanyang Technological University(南洋理工大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出InstrAction框架,通过数据驱动策略和辅助目标提升指令视频中动作识别与建模,建立InstrAct基准测试集,优于现有视频基础模型。
GPA:从演示中学习图形用户界面过程自动化
机构 * Salesforce AI Research(Salesforce AI 研究院)
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.CV、cs.AI
AI总结 GPA是一种轻量但通用的基于视觉的机器人流程自动化方法,通过单次演示实现快速稳定的过程回放,解决了传统RPA的脆弱性和当前基于视觉语言模型的GUI代理的非确定性风险,具备鲁棒性、确定性和隐私保护等核心优势。
压缩间隙:为什么离散标记化限制了视觉-语言-动作模型的扩展
机构 * Shibattic Inc.
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文探讨了在视觉-语言-动作模型中,离散标记化导致的压缩间隙问题,指出信息瓶颈的位置决定了模型扩展效果,而非统一增加模型或数据规模。
Comments 11 pages, 1 figure
UI-Oceanus:通过合成环境动态扩展GUI代理
机构 * Key Lab of HCST (PKU), MOE(高可信软件技术教育部重点实验室(北京大学);北京大学计算机学院) ; School of Computer Science, Peking University(北京通明湖信息技术应用创新中心) ; Beijing Tongming Lake Information Technology Application Innovation Center(腾讯微信) ; WeChat, Tencent Inc.(西蒙菲莎大学) ; Simon Fraser University(德克萨斯大学达拉斯分校) ; University of Texas at Dallas(复旦大学系统与先进计算研究所) ; Fudan University Institute of Systems for Advanced Computing(上海开放计算系统研究所) ; Shanghai Institute of Systems for Open Computing
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文提出UI-Oceanus框架,通过地面真实环境反馈掌握交互物理,解决GUI代理扩展中的数据瓶颈问题,实验表明其在离线和在线导航中均优于基线方法。
局部强化学习与基于动作的均方Q函数
机构 * Carnegie Mellon University(卡内基梅隆大学) ; New York University(纽约大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于动作的均方Q函数,通过时间差分学习实现局部强化学习,优于现有无反向传播方法,在MinAtar和DeepMind控制套件中表现优异。
Comments 18 pages, 11 figures
FLEX:一个大规模多模态、多视角数据集,用于学习结构化表示以评估健身动作质量
机构 * School of Biomedical Engineering (Suzhou), USTC(中国科学技术大学苏州生物医学工程学院) ; Suzhou Institute of Biomedical Engineering and Technology, CAS(中国科学院苏州生物医学工程技术研究所) ; Institute of High-Performance Computing, A*STAR, Singapore(新加坡科技研究局高性能计算研究所) ; School of Psychology, Beijing Sports University(北京体育大学心理学院) ; School of Competitive Sports, Beijing Sports University(北京体育大学竞技体育学院) ; Department of Robotics, University of Michigan(密歇根大学机器人系)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 FLEX数据集通过多模态融合和结构化知识图谱提升健身动作质量评估的准确性与解释性,支持跨模态预测和生物力学导向的表示学习。
Comments Dataset and code are available at https://github.com/HaoYin116/FLEX . Link to Project page https://haoyin116.github.io/FLEX_Dataset
在生成3D世界中扩展机器人视觉语言动作的强化学习
机构 * Horizon Robotics(地平线机器人)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出利用生成3D世界模型来提升机器人视觉语言动作模型的泛化能力,通过生成多样化的交互场景,提高模拟到现实的迁移效果,并展示在真实世界中的性能提升。
超越文本知识的多模态知识库用于增强视觉-语言导航
机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) ; Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing(丝绸之路多语言认知计算联合国际研究实验室)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出BTK框架,通过整合环境特定文本知识与生成图像知识库,提升视觉-语言导航中的语义 grounding 和跨模态对齐,实验表明在R2R和REVERIE数据集上性能显著提升。
Comments Main paper (37 pages). Accepted for publication by the Information Processing and Management,Volume 63,Issue 6,September 2026,104766
基于语言的视觉导航世界建模
机构 * University of Washington(华盛顿大学) ; National University of Singapore(新加坡国立大学) ; Clemson University(克莱姆森大学) ; Drexel University(德雷塞尔大学) ; Microsoft Research(微软研究院)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文研究了基于语言的视觉导航问题,提出LCVN数据集并开发了两种模型家族,通过语言 grounding、未来状态预测和动作生成实现统一任务学习。
Comments 19 pages, 6 figures, Code: https://github.com/F1y1113/LCVN
连续GUI代理
机构 * Department of Computer Science and Technology, Tsinghua University, China(计算机科学与技术系,清华大学,中国) ; College of Computer Science, Zhejiang University, China(浙江大学计算机科学学院,中国) ; College of Computer Science, Beijing University of Posts and Telecommunications, China(北京邮电大学计算机科学学院,中国)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.LG
AI总结 本文提出连续GUI代理任务,通过引入GUI-Anchoring in Flux框架,解决GUI分布变化时持续学习稳定性问题,实验显示其优于现有方法。
Comments Code is available at: https://github.com/xavierliu34/GUI-AiF
Ego2Web:一种基于第一人称视频的网络代理基准测试
机构 * Google DeepMind(谷歌DeepMind) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 Ego2Web通过结合真实世界第一人称视频与网络任务,解决网络代理在现实物理环境中的感知问题,提出LLM-as-a-Judge评估方法,揭示当前代理在视觉理解和任务规划上的不足。
Comments CVPR 2026. Project page: https://ego2web.github.io/
AerialVLA:一种用于无人机导航的视觉-语言-动作模型 via 最小化端到端控制
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出AerialVLA,一种基于视觉-语言-动作的端到端控制模型,通过减少视觉冗余并整合连续3D运动指令与内在着陆信号,实现无人机自主导航。实验表明其在可见环境和未知场景中均表现优异。
Comments 18 pages, 4 figures. Code and demo videos will be available at: https://github.com/XuPeng23/AerialVLA
MobileKernelBench: LLMs能否为移动设备编写高效的内核?
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文探讨LLMs能否为移动设备编写高效内核,提出MobileKernelBench框架,发现现有模型在移动框架中表现不佳,提出MoKA多智能体系统提升编译成功率和性能。
Comments Paper webpage: https://zeezou-isee.github.io/Mobilekernelbench/
PVI:插件式视觉注入用于视觉-语言-动作模型
机构 * Lionrock AI Lab(Lionrock人工智能实验室) ; China Merchants Group(中国商人集团)
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.LG
AI总结 本文提出PVI模块,通过零初始化残差路径注入辅助视觉特征,提升视觉-语言-动作模型的时间信息处理能力,实验证明其在多阶段任务中优于静态图像特征。
通过概念门控视觉蒸馏克服视觉杂乱
机构 * University of Technology Sydney(技术大学悉尼大学) ; Western Sydney University(西悉尼大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出概念门控视觉蒸馏方法,通过视觉蒸馏技术解决杂乱环境中视觉语言动作模型的精度-推理间隙问题,显著提升机器人操作的成功率。
Comments 7 pages, 4 figures, 3 tables
混合自进化结构记忆用于GUI代理
机构 * University of California, San Diego(加州大学圣迭戈分校)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 HyMEM通过结合离散符号节点与连续轨迹嵌入,提升GUI代理的结构化记忆与自进化能力,使开源模型性能超越闭源模型。
NavSpace: 导航代理如何遵循空间智能指令
机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 NavSpace基准测试通过评估导航代理的空间感知与推理能力,提出SNav模型在指令遵循任务中表现优异,为具身智能研究提供新基准。
Comments ICRA 2026
CuriousBot: 通过可操作的3D关系物体图进行交互式移动探索
机构 * School of Engineering and Applied Science, Columbia University(工程与应用科学学院,哥伦比亚大学) ; Robotics and AI Institute(机器人与人工智能研究所)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 CuriousBot通过可操作的3D关系物体图实现交互式移动探索,优于仅依赖视觉-语言模型的方法。
Comments Accepted to IEEE Robotics and Automation Letters (RA-L). Project Page: https://curiousbot.theaiinstitute.com/
移动端智能体在线强化学习中的泛化能力
机构 * Mila – Québec AI Institute(魁北克AI研究所) ; Concordia University(康科迪亚大学) ; Université de Montréal(蒙特利尔大学) ; CIFAR AI Chair(CIFAR人工智能主席) ; University of Toronto(多伦多大学) ; McMaster University(麦马斯特大学)
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.LG
AI总结 本文提出AndroidWorld-Generalization基准,通过整合GRPO与可扩展回放系统,评估移动端智能体在未见任务实例、模板和应用上的泛化能力,并展示RL在提升性能上的效果。