MLLM-Search: A Zero-Shot Approach to Finding People using Multimodal Large Language Models
专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);MLLM(title,abstract);分类 cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);MLLM(title,abstract);分类 cs.AI、cs.LG
GUI-AIMA: 对齐内在多模态注意力与上下文锚点以实现GUI定位
机构 * University at Buffalo(布法罗大学) ; Adobe Research(Adobe研究院)
专题命中 GUI与屏幕智能体 :grounding(title,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 GUI-AIMA通过多模态注意力对齐与上下文锚点,实现高效的GUI定位,无需坐标生成,提升数据效率和性能。
隐藏的幽灵之手:揭示MLLM驱动的移动GUI代理中的后门漏洞
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Huawei Inc.(华为公司)
专题命中 GUI与屏幕智能体 :MLLM(title,title_cn);multimodal large language model(abstract)
AI总结 本研究提出AgentGhost框架,通过组合目标和交互层触发器,利用监督对比学习和微调注入后门,在移动GUI代理中实现高成功率和隐蔽性,攻击准确率达99.7%。
Comments EMNLP-Findings 2025 (Correcting model settings)
Mobile-Aptus: 基于MLLM的手机使用代理中的置信度驱动的主动与鲁棒交互
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; GenAI, Meta(Meta的GenAI)
专题命中 GUI与屏幕智能体 :MLLM(title,title_cn);multimodal large language model(abstract)
AI总结 针对手机使用代理中的过度执行和过度请求问题,提出一种置信度驱动的主动与鲁棒交互框架,通过监督微调和置信度偏差校正实现最优性能。
Comments Accepted by TASLP
探索VLM-LLM导航中的瓶颈:3D场景理解能力如何影响零样本VLN
机构 * Shanghai Key Laboratory of Navigation and Location Based Services, Shanghai Jiao Tong University(上海导航与基于位置的服务关键实验室,上海交通大学)
专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract)
AI总结 本文研究了零样本视觉-语言导航中3D场景理解能力对性能的影响,提出了统计成功率上限,揭示了感知饱和现象,建议转向导航相关的核心词汇和准确的边界框比例。
Comments Accepted by ICRA Workshop MM-Spatial AI, Oral
SG-WAM:面向世界-动作模型的文本 grounded 与空间感知语义引导
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Ola Dimensions(奥拉维度公司)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract,abstract_cn);grounding(abstract);分类 cs.CV
AI总结 针对现有世界-动作模型(WAM)存在的视频与指令语义不对齐问题,提出基于视觉-语言模型(VLM)的SG-WAM语义引导方法,通过注入文本接地且空间感知的语义前瞻,提升了WAM的指令遵循与操纵精度,经仿真和真实实验验证有效。
CLAP:通过语言-动作基础实现从视觉语言模型到视觉语言动作模型的直接适配
机构 * Ochanomizu University(御茶水女子大学) ; University of Tokyo(东京大学) ; OMRON SINIC X Corp(欧姆龙(中国)有限公司)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);grounding(title);分类 cs.AI
AI总结 研究如何将预训练视觉语言模型直接转换为视觉语言动作模型,核心方法是提出CLAP,通过在数字动作序列前加自然语言描述来解决输出分布不匹配问题,单轮微调效果良好,还将发布多尺度紧凑VLA家族助力能力转移分析。
Comments Project website: https://omron-sinicx.github.io/clap/
SCoPE VLM:面向视觉语言模型高效文档导航的 selective context processing
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Konkuk University(韩国康克伦大学)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(title,abstract);分类 cs.CV
AI总结 SCoPE VLM通过引入滚动链机制和定制强化学习方法,实现高效文档导航,提升视觉语言模型在多页文档问答中的代理阅读能力。
机构 * KIOS Research and Innovation Centre of Excellence (KIOS CoE)(KIOS研究中心卓越创新中心) ; Department of Computer Science, University of Cyprus(计算机科学系,塞浦路斯大学)
专题命中 GUI与屏幕智能体 :vision language model(title,abstract);VLM(title,abstract);分类 cs.AI
Journal ref 2025 International Conference on Unmanned Aircraft Systems (ICUAS)
SEDualVLN:一种空间增强的双系统用于视觉语言导航
机构 * Hong Kong Polytechnic University(香港理工大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);MLLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract)
AI总结 本文提出SEDualVLN,一种空间增强的双系统框架,用于解决视觉语言导航中的长距离导航和动态推理问题,通过两个系统协同工作实现高效导航。
专题命中 GUI与屏幕智能体 :vision language model(title,abstract);VLM(title,abstract)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(title,abstract)
无幻觉的GUI定位:基于无回归的布局感知匹配
机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)
专题命中 GUI与屏幕智能体 :grounding(title,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI
AI总结 该研究提出无回归框架,通过解耦指令理解与布局感知定位,在ScreenSpot-Pro和Mind2Web数据集上显著提升GUI定位的准确率、成功率及元素选择率,抑制了坐标幻觉。
通过视觉反馈学习具有空间推理能力的 GUI 定位
机构 * University of Edinburgh(爱丁堡大学) ; Microsoft(微软)
专题命中 GUI与屏幕智能体 :grounding(title,abstract);VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV
AI总结 本文提出将 GUI 定位重构为交互式搜索任务,利用多步在线强化学习训练 GUI-Cursor 模型,通过光标视觉反馈提升空间推理能力,在 GUI 定位和代理任务上超越强基线。
Comments Accepted at ICML 2026
GoClick:轻量级元素接地模型用于自主GUI交互
机构 * 1 University of Chinese Academy of Sciences, Beijing, China. 2 New Laboratory of Pattern Recognition, State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China. 3 Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences, Hong Kong, China. Zhaoxiang Zhang
专题命中 GUI与屏幕智能体 :grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 本文提出GoClick,一种轻量级GUI元素接地模型,通过改进架构和数据精炼流程,在保持高精度的同时降低参数规模,适用于资源受限设备的低延迟GUI交互任务。
Comments Technical Report
专题命中 GUI与屏幕智能体 :grounding(title,abstract);MLLM(title);分类 cs.CV、cs.AI
机构 * National Yang Ming Chiao Tung University(国家阳明交通大学) ; National Taiwan University(国立台湾大学)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments CoRL 2025. Project page: https://spf-web.pages.dev
Journal ref Proceedings of The 9th Conference on Robot Learning, PMLR 305:4697-4708, 2025
机构 * Algoma University(阿尔戈马大学)
专题命中 GUI与屏幕智能体 :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments Code available at https://github.com/ant-8/GUI-Grounding-via-Iterative-Narrowing
PearlVLA:潜在空间中的渐进式具身动作计划精炼
机构 * Imperial College London(帝国理工学院) ; Tsinghua University(清华大学)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.AI
AI总结 提出PearlVLA框架,通过在VLM潜在空间中进行迭代计划精炼,平衡动作生成效率与显式推理,在LIBERO基准上达到最先进性能。
Comments 21 pages, 2 figures. Preprint
视觉语言模型能否评判动作质量?一项实证评估
机构 * Sword Health ; Instituto Superior Técnico, Universidade de Lisboa(里斯本大学高等技术学院) ; INESC-ID(INESC-ID研究所)
专题命中 GUI与屏幕智能体 :vision language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文评估了视觉语言模型在动作质量评估中的表现,发现现有模型在多个领域仅略高于随机水平,且存在预测偏差,提示细粒度动作质量评估存在根本性困难。
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Purdue University(普渡大学)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.AI、cs.LG
专题命中 GUI与屏幕智能体 :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments 12 pages, 5 figures, 3 tables
专题命中 GUI与屏幕智能体 :vision language model(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
LocalNav: 蒸馏前沿视觉语言模型与具身强化学习用于设备端物体目标导航
机构 * Center for Project-Based Learning(项目学习中心) ; Integrated Systems Laboratory(集成系统实验室)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision language model(abstract);grounding(abstract)
AI总结 提出蒸馏策略将大型VLM的空间语义推理迁移至轻量级本地VLM,结合E-RLVR与令牌生成正则化,在嵌入式设备上实现低延迟物体目标导航。
DIAL: 通过潜在世界建模解耦意图与动作以实现端到端VLA
机构 * The University of Hong Kong(香港大学) ; XPENG Robotics(小鹏机器人) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 DIAL通过潜在意图瓶颈解耦意图与动作,利用VLM进行潜在世界建模并结合轻量策略实现端到端VLA,实验表明其在RoboCasa GR1任务中优于现有方法,且在真实世界部署中表现稳健。
Comments Project page: https://xpeng-robotics.github.io/dial
专题命中 GUI与屏幕智能体 :grounding(title,abstract);multimodal large language model(title)
预测熵连接校准与改写敏感性在医疗视觉-语言模型中
机构 * SAIL Lab, University of New Haven(纽黑文大学SAIL实验室)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.LG
AI总结 本文研究医疗视觉语言模型在部署中的校准和改写敏感性问题,通过预测熵方法发现决策边界接近性是共同原因,并展示单一熵阈值能有效识别不可靠和改写敏感的预测。
StepX-Edge:一种通过架构-训练-部署协同设计的端侧用户界面视觉语言模型
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV
AI总结 研究旨在解决端侧视觉语言模型在准确性和效率间的矛盾,提出StepX-Edge模型,通过架构、训练和部署协同设计,在多项任务中表现出色,参数少且运行稳定,还将开源相关数据、方法和管道。
ViTL:基于视觉语言模型的时间逻辑引导零样本自然语言导航
机构 * Lehigh University(里海大学)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.LG
AI总结 提出ViTL框架,利用大语言模型将自然语言命令编译为线性时序逻辑公式,并引入方向性评分,实现零样本多目标时序约束导航。
一次前向胜过两次:InnerZoom 实现准确高效的 GUI 定位
机构 * Alibaba Group(阿里巴巴集团) ; Tongyi Lab(通义实验室) ; University of Technology Sydney(悉尼大学) ; Adelaide University(阿德莱德大学)
专题命中 GUI与屏幕智能体 :grounding(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出 InnerZoom 框架,通过跨层证据桥接在单次前向传播中实现精确 GUI 元素定位,无需额外裁剪重跑,在六个基准上达到最优性能,同时降低延迟和计算量。