Retrieving and Highlighting Action with Spatiotemporal Reference
专题命中 GUI与屏幕智能体 :visual reasoning(abstract);分类 cs.CV
Comments Accepted to ICIP 2020
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 GUI与屏幕智能体 :visual reasoning(abstract);分类 cs.CV
Comments Accepted to ICIP 2020
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
Comments To appear at 2019 Conference on Robot Learning (CoRL)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
Comments Accepted at SpLU-RoboNLP 2019 (workshop at NAACL)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
SuperMap:用于视觉-语言导航的时空SLAM系统
机构 * The Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 本文提出SuperMap,一种结合几何SLAM与开放词汇感知的4D时空建图框架,用于视觉-语言导航,可稳定维护目标身份,经基准与真实机器人验证后开源。
Journal ref Proceedings of Robotics: Science and Systems (RSS 2026)
ViTacPhys:基于人类视觉-触觉演示的感知物体物理属性的抓取方法
机构 * Xiaomi Robotics(小米机器人)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 该研究提出ViTacPhys视觉-触觉框架,可从人类演示中估计物体物理属性,迁移至机器人后实现高抓取成功率,力曲线更贴合人类遥操作。
Comments 11 pages, 7 figures. Project page: https://vitacphys.github.io/ViTacPhys/
GAPL:面向基于大语言模型的轨迹规划的接地动作效果策略学习
机构 * University of Oslo(奥斯陆大学) ; Aalborg University(奥尔堡大学) ; University of Sydney(悉尼大学) ; Nanjing University of Information Science and Technology(南京信息工程大学) ; Simula Research Laboratory(西穆拉研究院)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 针对LLM用于自动驾驶轨迹规划时存在的幻觉、接地不足等问题,提出GAPL框架,整合三类模块并经实验验证其性能优于基线方法
Comments 11 pages, 5 figures, 6 tables
面向动作感知无线边缘网络的边缘原生具身智能
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 该研究提出边缘原生具身智能(ENEI)框架,整合6G技术与具身智能,通过双向循环解决具身智能部署的资源与延迟问题,经案例验证可支撑自适应具身无线系统。
面向健康与福祉的移动及可穿戴传感器融合对话智能体设计
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 本教程面向健康领域,旨在教授参与者使用WSDWAS工具,将可穿戴传感器数据与LLM驱动的对话智能体结合,实现从被动监测到可操作福祉对话的转变。
Comments 6 pages, 3 figures. Accepted as a Tutorial at the 28th International Conference on Mobile Human-Computer Interaction (MobileHCI '26)
Journal ref In 28th International Conference on Mobile Human-Computer Interaction (MobileHCI '26), August 31-September 03, 2026, Swansea, United Kingdom
融合UI结构与语义的面向特征的应用屏幕检索与聚类
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 该研究针对UI编程中代码与图形表示的抽象鸿沟,提出多模态神经符号嵌入技术FRAME,在三项基准测试中提升了屏幕检索与聚类的性能,可增强自动化UI设计与测试工具。
Comments 12 pages, 8 figures, 6 tables. Accepted at the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), Benevento, Italy
CrossTracer:基于VLA模型推理与轨迹残差自适应的跨 embodiments 导航
机构 * Peng Cheng Laboratory(鹏城实验室) ; Southern University of Science and Technology(南方科技大学) ; Innovation Investment Research Institute(创新投资研究院) ; Soochow University(苏州大学)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 本研究提出跨 embodiment 导航框架 CrossTracer,通过 VL-Tracer 和 CE-Adapter 优化轨迹,在 NaviTrace 基准得分 45.68,优于 Gemini-2.5-Pro,实际部署于轮式、腿式机器人效果良好。
超越扁平策略:面向机器人操作具身智能体的分层后训练
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 针对现有VLA模型扁平策略难以处理长时程操作的问题,提出HiRoC分层后训练框架,通过解耦规划与执行并对齐分布,在机器人操作基准上取得优于强基线的性能。
MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型
机构 * Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; East China University of Science and Technology(华东理工大学) ; Huawei Celia Team(华为Celia团队) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; OpenHelix Robotics
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 本文提出MMaDA-VLA模型,通过统一多模态理解与生成框架,解决机器人操控中的时序不一致和长周期误差累积问题,实现高效视觉-语言-动作生成。
Comments Accepted by ACM MM 2026
“允许”达成目标:移动GUI智能体中任务完成驱动的弹窗决策的意外代价
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)
AI总结 研究移动GUI智能体的权限素养,发现其存在应用信任偏差、任务优先级覆盖等问题,提示干预效果不一,建议将任务执行与权限授权分离。
通过强化学习学习检测用户界面原则违规
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 研究小型语言模型和编码代理生成的网页前端代码违反界面质量原则的问题,通过统一多来源的界面质量原则,构建数据集并利用强化学习训练轻量级视觉语言模型作为评判器,提升检测效果并发布相关方法支持评估和后续工作。
面向视觉-语言-动作模型的鲁棒指令泛化的基础语义重绑定
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 针对视觉-语言-动作模型因指令释义导致性能骤降的架构问题,提出GSR方法,在LIBERO-Para基准提升成功率44.6%,推出ParaVLA模型,规避低效数据扩展,实现鲁棒指令泛化。
Comments 23 pages, 8 figures
EndoWAM:用于通用内窥镜导航的基于接地的世界-动作模型
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 EndoWAM是首个用于通用机器人内窥镜导航的世界-动作模型,通过未来接地机制结合轻量型扩散Transformer与离散动作专家,在EndoMotion数据集上优于基线,具强零样本泛化能力。
SelfWAM:一种用于快速机器人控制的自 grounded 统一世界动作模型
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 SelfWAM是一种基于MoT架构的统一自 grounded WAM,通过联合预测动作等改进机器人控制,在RoboTwin 2.0等实验中提升了策略性能与推理速度。
超越单一评判者:用于生成式UI评估的社会角色面板模拟
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 该研究针对GenUI评估问题,提出三阶段ESPP方法,通过多样化角色面板提升评估保真度,揭示用户子群体的结构性分歧,代码已公开。
世界动作模型是否比视觉语言动作模型表现更好?一项鲁棒性研究
机构 * Huawei Technologies(华为技术有限公司) ; University of Toronto(多伦多大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 本文比较了最新状态的VLA策略和最近发布的WAMs,在不同视觉和语言扰动下评估其性能,发现WAMs在鲁棒性上表现更强,而VLA需要大量训练数据和多样化学习目标。
Vision-TL-Action:基于视觉观测和时序逻辑的神经符号轨迹生成
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 本文提出Vision-TL-Action模型,通过融合视觉与TL节点标记生成动作轨迹,在Panda、AntMaze任务中优于或接近基线,实现无需物体几何信息的视觉到TL目标的轨迹生成。
Comments 17 pages, 15 figures
DSCD-Nav: 双视角协作辩论用于物体导航
机构 * School of Electronic Engineering, Xidian University, Xi' an 710071, China.(西安电子科技大学电子工程学院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 DSCD-Nav通过双视角协作辩论机制提升机器人在部分可观测环境中的导航可靠性与效率。
VL-LN基准:通过主动对话实现长视界目标导向导航
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; The University of Hong Kong(香港大学)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 VL-LN基准通过引入主动对话机制,提升长视界目标导向导航任务的性能和可靠性。
ZONDA:多楼层环境中具有动态避障功能的零样本目标导航
机构 * Southern University of Science and Technology(南方科技大学) ; Guangdong Direct Drive Technology Limited(广东直驱技术有限公司) ; South China University of Technology(华南理工大学) ; Great Bay University(大湾区大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 研究针对目标导航任务中现有方法局限,提出ZONDA框架,集成启发式多楼层规划、多视图目标验证、动态行人避障三个核心组件,通过真实机器人及模拟测试取得显著改进结果,在动态基准测试中表现优于现有基线。
GeoWorldAD:用于自动驾驶的几何世界行动模型
机构 * Nanyang Technological University(南洋理工大学) ; Xiaomi EV(小米汽车) ; Zhejiang University(浙江大学) ; Harvard University(哈佛大学)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 研究自动驾驶中安全高效规划决策问题,提出GeoWorldAD模型,通过在自我对齐3D空间中规划轨迹、用潜在未来几何标记预测场景演变,并逐步聚合多尺度几何线索,实验证明该模型在自动驾驶方面性能先进。
HyperDCM:用于跨场景连续机器人导航的双曲空间动态集群记忆回放
机构 * Software Engineering Institute, East China Normal University(华东师范大学软件工程学院) ; School of Geospatial Information, Information Engineering University(信息工程大学地理空间信息学院) ; University of Shanghai for Science and Technology(上海理工大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 针对视觉导航持续学习难题,提出HyperDCM,通过场景图建模和记忆回放增强导航。利用视觉语言模型提取三元组,经R-GCN编码投影到双曲空间,采用动态聚类等策略。实验证明其在保留导航能力和泛化性上优于基线。
逻辑引导的社会感知机器人导航世界模型
机构 * School of Applied and Creative Computing, Purdue University(应用与创意计算学院,普渡大学) ; Department of Computer Science, Purdue University(计算机科学系,普渡大学) ; Department of Applied Artificial Intelligence, Sungkyunkwan University(应用人工智能系,成均馆大学) ; Department of Computer Science and Department of Intelligent Systems Engineering, Indiana University Bloomington(计算机科学系和智能系统工程系,印第安纳大学布卢明顿分校)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 提出NaviWM,通过结合结构化世界模型和逻辑驱动推理链,增强大语言模型在动态人类空间中生成社交合规且物理安全的导航决策的能力。
Comments The authors have decided to withdraw this manuscript due to concerns regarding its current scope, framing, and presentation. Please do not cite this version
闭环言语强化学习用于任务级机器人规划
机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克尔科夫科学与技术研究所)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 提出闭环言语强化学习框架,通过大语言模型与视觉语言模型交互,在符号规划层迭代优化行为树,实现可解释的任务级规划与执行不确定性下的自适应。
Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026
AC-VLA:通过组合学习实现稳健的分布外动作执行
机构 * Shenzhen Technology University(深圳技术大学) ; Shenzhen University of Advanced Technology(深圳先进技术大学) ; Tongji University(同济大学) ; Great Bay University(大湾区大学)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 研究VLA模型在分布外泛化的问题,提出AC-VLA框架,含组合学习模块和状态条件不对称掩码策略,无需修改架构可集成到VLA主干,在LIBERO和LIBERO-OOD基准测试中,该框架在组合OOD任务上有显著改进,分布内性能良好。
CosFly-VLA:一种用于无人机跟踪的空间感知视觉-语言-动作模型
机构 * Autel Robotics(大疆创新科技有限公司) ; Northeast Normal University(东北师范大学) ; Southern University of Science and Technology(南方科技大学) ; Peking University(北京大学) ; University of Hong Kong(香港大学)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 针对复杂城市环境中无人机动态目标跟踪问题,提出CosFly-VLA模型,通过结构化预测接口联合定位目标、估计可见性并生成飞行动作。经多阶段训练,该模型在开环误差和闭环成功率上有显著提升,实现从可见帧模仿到空间基础动作闭环控制的进展。