Incremental Scene Synthesis
专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);分类 cs.LG
Journal ref 33rd Conference on Neural Information Processing Systems (NeurIPS 2019)
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);分类 cs.LG
Journal ref 33rd Conference on Neural Information Processing Systems (NeurIPS 2019)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.LG
Comments Accepted at ICCV 2019
专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI
Journal ref 2018 IEEE Conference on Decision and Control (CDC), FL, USA, 2018, pp. 3335-3342
专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI
Comments 10 pages, 3 figure
专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract);autonomous agent(comments)
Comments To appear in the International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2023)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG;planning(journal_ref)
Comments 7 pages, 8 figures
Journal ref Third Workshop in Machine Learning in the Planning and Control of Robot Motion at ICRA, 2018
专题命中 GUI与网页智能体 :planning(abstract,comments);agent(abstract)
Comments IROS 2017: 9th Workshop on Planning, Perception and Navigation for Intelligent Vehicles
测量悬赏清单中的证明负担:RentAHuman案例研究
专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract)
AI总结 本研究以RentAHuman平台为案例,通过审核981个悬赏清单,测量证明负担,发现56.2%的清单证明负担评分达4或5分,且智能体/机器人标记的清单更常要求现实世界行动等证明。
Comments Accepted at ACM HCOMP 2026 (2026 ACM Conference on Human-AI Complementarity and Alignment), September 27-30, 2026, Alexandria, VA, USA. 10 pages, 4 figures, 3 tables. Camera-ready version; published version DOI: 10.1145/3834580.3838744
具身导航器:指向、思考、记忆与对齐以实现高效导航
机构 * ZJU(浙江大学)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract)
AI总结 本研究提出具身导航框架TAMP-Nav,通过像素转3D动作、选择性推理记忆与GRPO两级对齐,在R2R-CE数据集上实现66.2% SR,仅需90k训练轨迹,达成高效具身导航的最优性能。
MobileMem:从一年的移动体验中学习
机构 * OPPO ; OpenKG
专题命中 GUI与网页智能体 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 该研究推出MobileMem基准与框架,基于一年移动体验构建,用于设备端长期记忆研究,支持多类推理,推动智能体从信息检索向体验智能发展。
Comments Technical Report; Project Page: http://mobilemem.openkg.cn/
UI-MOPD:用于持续GUI智能体学习的多平台策略蒸馏
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Xiaomi(小米) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Zhejiang University(浙江大学) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 针对构建多平台GUI智能体的挑战,构建高质量数据集Uni-GUI,提出UI-MOPD方法,通过多教师策略蒸馏实现持续学习,动态选教师并转移行为先验,实验证明其能平衡跨平台能力保留与新平台适应。
Comments Technical report. 27 pages, 7 figures, 7 tables
具身智能体自主掌控:最小接口零样本智能体在视觉语言导航中可媲美工业级策略
机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) ; Adelaide University(阿德莱德大学) ; Responsible AI Research Centre(负责任人工智能研究中心) ; CSIRO Data61(联邦科学与工业研究组织数据61中心) ; The University of Queensland(昆士兰大学)
专题命中 GUI与网页智能体 :agent(abstract);agentic(abstract)
AI总结 本研究提出智能具身控制,以零样本导航为测试平台,评估三种智能体框架,发现最小接口下部分框架可媲美工业级策略,同时揭示模型、框架与接口对具身智能体的互补作用。
HyMobileAgent:用于高效GUI代理的数据-环境协同扩展
机构 * PhoneWorld Mock App Factory(手机世界模拟应用工厂)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract)
AI总结 研究移动GUI代理在数字环境中的运行,基于Hy3.0-VL-A3B构建HyMobileAgent,开发数据和环境协同扩展框架,集成多种机制和管道,提出渐进式训练方法,解决移动交互关键瓶颈。
(AI)看见你看不见的:利用第三方移动代理中的新攻击面
专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract)
AI总结 本文识别了第三方移动代理在屏幕感知和通道滥用方面的两种新攻击面,并设计了七种具体攻击,证明恶意应用可在无权限下劫持代理行为。
基于强化学习的目标导航方法中什么重要?实证研究与统一框架
机构 * Computer Vision and Geometry Group, ETH Zurich, Switzerland(苏黎世联邦理工学院计算机视觉与几何组) ; Robotics and Perception Group, University of Zurich, Switzerland(苏黎世大学机器人与感知组) ; Robotic Systems Lab, ETH Zurich, Switzerland(苏黎世联邦理工学院机器人系统实验室) ; Princeton Robotic Intelligence and SysteMs group, Princeton University, USA(普林斯顿大学机器人智能与系统组) ; Microsoft, Switzerland(微软公司)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract)
AI总结 研究目标导航中基于强化学习方法各组件影响,通过分解导航管道为感知、策略和测试时增强三组件进行实证研究,引入统一框架,构建增强系统达领先性能,提供见解与建议,凸显当前智能体与人类导航差距。
GUI代理真正需要什么样的记忆?从被动记录到主动任务驱动状态
机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) ; University of Technology Sydney(悉尼科技大学) ; Adelaide University(阿德莱德大学)
专题命中 GUI与网页智能体 :agent(abstract);workflow(abstract)
AI总结 提出主动任务驱动记忆(ATMem),将GUI代理的记忆从被动存储转变为主动维护的执行状态,并引入STR-GRPO强化学习方法,通过对比记忆开启和关闭的轨迹来选择性使用记忆,以提升长周期任务执行的准确性和效率。
计算机使用代理的不确定性量化:跨视觉语言模型和GUI基础数据集的基准测试
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Intel Labs(英特尔实验室) ; Capital One AI Labs(Capital One AI实验室)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出跨机制基准Argus,评估27种后验不确定性量化方法在4个VLM代理和4个数据集上的表现,发现UQ排名在固定模型内跨数据集稳定,但跨模型类别和接口时下降,隐藏状态和密度方法最稳定。
OpenWebRL: 揭秘视觉网络代理的在线多轮强化学习
机构 * UIUC(伊利诺伊大学香槟分校) ; Microsoft(微软)
专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出OpenWebRL框架,通过在线多轮强化学习在真实网站上训练视觉网络代理,以4B参数模型在基准测试中达到开源最优,并与闭源系统竞争。
Comments 36 pages, 11 figures
网络化移动机器人故障容错控制
专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract)
AI总结 本文提出了一种两阶段技术,用于网络化移动机器人中偏置测量代理的识别与补偿,通过单个观测者代理部署的故障识别滤波器估计网络中的单个故障,并在检测到故障后启动最优领导者基于的补偿策略。
Comments 7 pages, 7 figures, conference
多移动机械臂的鲁棒去中心化抽象
专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)
AI总结 本文提出去中心化控制器,使移动机械臂在预定区域导航,同时保证多代理间碰撞避免和连接性维护。通过将耦合多代理系统抽象为多个有限状态转移系统,应用于基于时序逻辑的高层计划。
Comments Accepted for publication in the IEEE Conference on Decision and Control, Melbourne, Australia, 2017
使用仅距离测量的3D移动定位
专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)
AI总结 本文研究了在3D空间中,仅利用噪声距离测量实现无人机群体定位的问题,提出基于半正定规划的算法并结合梯度下降进行最大似然估计,通过实验验证了算法的有效性。
Comments Submitted to IEEE Transactions on Aerospace and Electronic Systems
分布式刚体编队的旋转和翻译 maneuvering 及其应用
专题命中 GUI与网页智能体 :agent(abstract,abstract_cn)
AI总结 本文提出一种分布式控制器,通过引入距离约束参数实现编队与运动控制,允许恒定集体翻译、旋转或组合,同时保证编队形状无畸变,应用于编队对齐和目标追踪。
Comments 14 pages
Journal ref Robotics, IEEE Transactions on, Volume 32, Issue 3, Pages 684 - 696, Year 2016
去中心化、自组织、基于势场的控制方法用于在复杂环境中具有个体动机的移动智能体:一种向量谐波势场方法
专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)
AI总结 本文提出了一种去中心化、自组织的势场控制方法,用于复杂环境中多个智能体的协同运动控制,通过向量谐波势场方法实现低计算成本和自适应性。
Journal ref IEEE Transactions on Systems, Man, and Cybernetics - Part A: Systems and Humans, May 2007, Volume:37, Issue: 3, pp. 372-390
基于距离的K4形形成控制与近全局收敛
专题命中 GUI与网页智能体 :agent(abstract,abstract_cn)
AI总结 本文提出基于距离的K4形控制策略,通过改进梯度控制律实现近全局收敛,利用四面体形成性质确保二维空间中四代理达到期望形成形状。
Comments 6 pages, submitted to CDC 2016
通过异质移动守卫守护网络
专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)
AI总结 本文研究如何利用异质移动守卫应对多代理系统中的连续入侵攻击,提出将网络分解为集群并分配合适范围的守卫以实现永恒安全。
Comments American Control Conference, Chicago, IL, 2015
Demo2Tutorial:从人类经验到多模态软件教程
机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract)
AI总结 提出Demo2Tutorial框架,通过屏幕录制和交互日志将人类经验解析为结构化多模态教程,用于人类学习和GUI智能体训练,实验证明其生成质量超越人工教程并提升任务效率。
Comments Accepted by CVPR 2026
MMG2Skill: 智能体能否从野外指南中提炼出自我进化的技能?
机构 * Nanjing University(南京大学) ; Kuaishou Technology(快手科技)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出MMG2Skill框架,将多模态异构的野外指南编译为可编辑技能,通过轨迹级根因反馈持续改进,在GUI控制、开放游戏和策略卡牌任务中显著提升VLM智能体性能。
Comments 35 pages, 12 figures, 13 tables. Code: https://github.com/NJU-LINK/MMG2Skill
TRANS:面向社交互动下四足机器人敏捷导航的地形感知强化学习
机构 * Department of Robotics, Graduate School of Engineering, Tohoku University(东邦大学机器人学系) ; Laboratory for Intelligent Decision and Autonomous Robots, Woodruff School of Mechanical Engineering, Georgia Institute of Technology(佐治亚理工学院智能决策与自主机器人实验室)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract)
AI总结 提出一个名为TRANS的两阶段深度强化学习框架,通过三个DRL流水线(TRANS-Loco、TRANS-Nav和统一TRANS)实现四足机器人在非结构化地形上的社交导航,克服了传统方法中运动规划与运动控制分离、缺乏地形感知以及假设静态环境等局限。
抗漂移导航世界模型与锚定对极引导
机构 * EPFL(瑞士联邦理工学院)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract)
AI总结 提出一种抗漂移导航世界模型,通过锚定引导滚动和双向对极几何约束,同时减轻感知漂移和几何漂移,提升长期视觉质量、几何一致性和多视图连贯性。
自然灾害疏散期间移动充电车的动态部署:一种离线到在线框架
专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)
AI总结 本文提出了一种离线到在线框架,用于在自然灾害疏散期间动态部署移动充电车,以缓解固定充电站过载问题,通过风险感知的分配和动态路由策略减少风险暴露。