GPT-4V(ision) is a Generalist Web Agent, if Grounded
专题命中 GUI与屏幕智能体 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 GUI与屏幕智能体 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
专题命中 GUI与屏幕智能体 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
Comments Website: https://robotics-transformer.github.io/
专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments 8 pages, Accepted at LangRob Workshop at Conference on Robot Learning (CoRL), 2022
专题命中 GUI与屏幕智能体 :vision-language model(title)
Comments International Conference on Robotics and Automation (ICRA)
专题命中 GUI与屏幕智能体 :grounding(title)
Comments To Appear in RO-MAN 2023
瞬间动作预见:多模态线索能替代视频到何种程度?
机构 * Universidad de Alicante(阿利坎特大学) ; Foundation for Research and Technology-Hellas(希腊基础研究与技术基金会) ; University of Crete(克里特大学) ; Hellenic Mediterranean University(希腊地中海大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract,abstract_cn);分类 cs.CV
AI总结 AAG通过结合单帧RGB特征与深度线索及先前动作信息,实现了多模态单帧动作预见,能与视频聚合基线和先进方法在教学活动数据集上竞争。
Comments Accepted in WACV 2026 - Applications Track
Journal ref 2026 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV)
如果、那么、否则:诊断视觉-语言导航中的条件分支
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Collins Aerospace(柯林斯航空航天公司)
专题命中 GUI与屏幕智能体 :grounding(abstract,abstract_cn);分类 cs.CV
AI总结 针对视觉-语言导航智能体的条件分支诊断需求,提出基于场景图的基准CondVLN及轻量级神经符号分支选择模型,可暴露智能体的逻辑决策失败并提升性能2倍。
Comments 11 pages, 1 figure, 3 tables. Project page: https://condvln.github.io/
Act2Intention:通过从GUI操作推断用户意图开发主动移动智能体的基准
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.AI
AI总结 本文提出Act2Intention框架及基准数据集,构建主动移动智能体,经实验验证该基准可显著提升智能体意图理解、预测与执行性能,为主动智能体研究提供标准化平台。
在重建中迷失:将视觉-语言-动作模型中的动作表示与语言对齐
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract);分类 cs.AI
AI总结 该研究针对视觉-语言-动作模型中动作表示与语言脱节的问题,提出SALT语义对齐动作标记器,在SimplerEnv中使策略平均成功率达71.9%,显著优于基线方法。
NormAct:具身规划中隐藏社会规范遵守的基准
机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院) ; China Academy of Information and Communications Technology(中国信息通信研究院) ; ShanghaiTech University(上海科技大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
AI总结 提出NormAct基准,评估多模态大语言模型在具身规划中遵守隐藏社会规范的能力,发现模型在67.3%情况下达成显式目标,但仅26.4%遵守隐藏规范;提出NormPerceptor方法将任务成功率从24.2%提升至46.7%。
Comments This version revises the paper content and adds substantial details on the benchmark design and experimental setup
通过注意力集中进行偏好重定向:对计算机使用代理的一种攻击
机构 * Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出PRAC攻击,通过重定向模型注意力操纵CUA选择过程,揭示了视觉模态的漏洞,威胁到基于开放权重模型的CUA安全。
Journal ref Conference on Language Modeling (COLM) 2026
超越像素:探索面向基于大语言模型的智能体的DOM下采样
专题命中 GUI与屏幕智能体 :grounding(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出D2Snap算法对DOM下采样,解决原始DOM令牌占用过大的问题,经评估其在GPT-4o智能体上的成功率达73%,接近基于GUI快照的基线性能。
Comments 21 pages, LaTeX, print version; enhanced algorithm, settled on non-inferiority claim, added downsampling monotonicity and linearity results
从路线到步骤:在视觉语言导航中分离语义进展与局部执行
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV
AI总结 本研究针对视觉语言导航中进展与执行错误难区分的问题,提出Route2Step框架,通过步骤级接口分离语义进展跟踪与动作生成,在R2R-CE数据集上显著提升了导航性能,且在真实环境中具备实用性。
Comments 16 pages, 9 figures
SSTG-Nav:用于可重复物体导航的度量空间语义拓扑图
专题命中 GUI与屏幕智能体 :grounding(abstract,abstract_cn);分类 cs.AI
AI总结 该研究提出SSTG-Nav,将一次性勘测转化为可执行物体目标,在HM3D-v2数据集实验中显著提升语义导航的成功率与SPL,验证了预探索在可靠重复语义导航中的实用性。
Jetson-PI:通过前瞻对齐异步推理实现机载实时机器人控制
机构 * Peking University(北京大学) ; AIRS(无合适中文名,保留英文) ; PrimeBot Research Institute(PrimeBot 研究院)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.AI
AI总结 研究针对低功耗机载设备部署VLA模型的挑战,提出Jetson-PI方法。通过训练轻量级未来校正模块解决感知-执行未对齐,引入基于置信度的调度优化减少反应时间,辅以系统级加速,实验显示其显著提升控制频率和成功率。
Comments 16 pages, 10 figures
WCM:用于视觉-语言-动作强化学习的世界评论者模型
机构 * Tongji University(同济大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV
AI总结 该研究针对视觉-语言-动作强化学习中评论者与机器人部分可观测性不匹配的问题,提出WCM模型,联合预测未来潜态与值估计,在149个仿真任务和7个真实任务上均实现最优性能与泛化性。
世界动作规划器:基于动作条件世界模型的通用决策方法
机构 * Harvard University(哈佛大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract);分类 cs.AI
AI总结 本研究提出World Action Planner机器人规划系统,结合VLMs与多任务位姿图像条件世界模型,可迭代优化动作规划,在组合任务、新布局等场景中泛化性能优于VLAs、WAMs等端到端策略模型。
Comments Project page at worldactionplanner.github.io
无需训练,飞行更佳:用于无人机导航的测试时缩放视觉语言模型
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 研究如何将测试时缩放应用于无人机视觉语言导航,通过迭代细化和多标准评分函数,无需额外训练,使冻结模型自我校正,生成更准确可靠飞行计划,实现最优性能。
PGN:基于盘古多模态基础模型的视觉语言导航系统的设计与实现
机构 * University of Electronic Science and Technology of China(电子科技大学) ; School of Information and Communication Engineering(信息与通信工程学院)
专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);分类 cs.AI
AI总结 研究基于盘古多模态基础模型设计实现视觉语言导航系统PGN,训练分两阶段,先对齐视觉与语言编码器,再使模型适应专家轨迹,结合多种计算方式,在特定评估下取得一定指标,量化了离线专家动作对齐情况。
Comments 6 pages, 5 figures
ReflectVLN:通过反思推理训练视觉语言导航智能体
机构 * Amap, Alibaba Group(高德软件有限公司,阿里巴巴集团) ; Beihang University(北京航空航天大学)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV
AI总结 研究针对现有视觉语言导航方法缺乏闭环机制问题,提出ReflectVLN框架,通过双向交互智能体决策,引入行动思维链训练方案,实验证明该框架在有限数据下提升成功率和路径效率,且具良好训练成本与可解释性。
DSWAM:用于细粒度机器人操作的双系统世界行动基础模型
机构 * AIRC, Midea Group(美的集团美云智数) ; Tongji University(同济大学)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.AI
AI总结 研究针对世界行动模型在复杂任务指令分解及VLA与WAM执行能力对比方面的不足,引入DSWAM,通过双系统结合,利用视觉历史和任务提示预测子任务,经多种训练及加速等实现细粒度机器人操作并进行公平对比。
Comments 13 pages, 1 figures
PixelPilot:用于端到端自动驾驶的可扩展视觉-语言-动作模型
机构 * MoE Key Lab of Artificial Intelligence, Institute of AI, Shanghai Jiao Tong University(教育部人工智能重点实验室,上海交通大学人工智能研究院) ; Central Research Institute, Huawei(华为中央研究院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV
AI总结 针对现有视觉-语言-动作模型在自动驾驶场景中数据可扩展性有限等问题,提出PixelPilot,采用解耦规划和提升范式,通过知识灌输策略学习,提升了模型性能。
Comments Accepted by ECCV 2026
运动聚焦的潜在动作使跨实体VLA训练能从人类自我中心视频中学习
机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; Tianfu Jiangxi Laboratory(天府江西实验室)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出基于潜在动作的框架,利用混合解耦VQ-VAE从无标签人类视频中提取通用动作先验,通过意图-感知解耦策略减少动作幻觉,仅需50条轨迹即可适配下游任务。
Comments Accepted by IROS 2026
Z-1: 面向视觉-语言-动作模型的高效强化学习
机构 * Zioneer Robot Team(Zioneer机器人团队)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出Z-1框架,结合共享前缀生成、树状轨迹分支、完成感知奖励校准和选择性联合训练,通过GRPO策略在24个RoboCasa任务上平均成功率80.6%,较SFT提升13.2%。
Efficient-VLN: 一种高效且强大的视觉语言导航基线
机构 * The Chinese University of Hong Kong(香港中文大学) ; Weitu AI
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 Efficient-VLN通过三个简单有效机制解决视觉语言导航中的系统瓶颈,提升推理效率和训练稳定性,在R2R-CE和RxR-CE基准上取得新突破。
丢弃-再恢复:视觉-语言-动作模型有多冗余?
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; Cisco Research(思科研究院)
专题命中 GUI与屏幕智能体 :VLM(abstract_cn);grounding(abstract);分类 cs.AI
AI总结 通过提出Drop-Then-Recovery分析协议和GateProbe敏感性指标,发现VLA模型中语言骨干高度冗余,而视觉和动作路径对移除更敏感。
Reflective VLA:上下文动作后果使VLA具备泛化能力
机构 * Futian Laboratory(福田实验室) ; International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA)) ; Visincept
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出Reflective VLA,通过引入观察-动作-后果三元组作为上下文,使VLA模型能感知动作的环境特异性映射,在分布偏移下平均成功率提升5.4和4.2个百分点。
Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界模型
机构 * Qwen Team(Qwen团队)
专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出Qwen-RobotWorld,一种以自然语言为统一动作接口的语言条件视频世界模型,通过双流MMDiT、大规模具身世界知识语料和渐进式课程训练,在机器人操作、自动驾驶等任务中实现物理一致的未来视觉轨迹预测,在多个基准上取得最优结果。
FineVLA:面向可操控视觉-语言-动作策略的细粒度指令对齐
机构 * XLANG Lab, The University of Hong Kong(XLANG实验室,香港大学) ; Qwen Team, Alibaba Inc.(通义团队,阿里巴巴公司)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出FineVLA框架,通过构建细粒度数据集和训练策略,在保持任务成功率的同时实现机器人动作的细粒度可控性。
Comments 26 pages, 7 figures, 25 tables