LifelongCrossNav: Persistent 3D Semantic Memory for Cross-Floor Multi-Object Navigation
LifelongCrossNav:用于跨楼层多目标导航的持久3D语义记忆
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出LifelongCrossNav框架,结合持久3D语义记忆与跨楼层可通行性建模,在自研HM3D-MFMON基准上实现更优的多层顺序多目标导航性能。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
LifelongCrossNav:用于跨楼层多目标导航的持久3D语义记忆
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出LifelongCrossNav框架,结合持久3D语义记忆与跨楼层可通行性建模,在自研HM3D-MFMON基准上实现更优的多层顺序多目标导航性能。
SocietyBench:反事实社会世界演化预测
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL
AI总结 本文推出SocietyBench基准,通过构建反事实社会世界,测试LLMs预测社会事件的概率校准与时间准确性,发现前沿LLMs表现远逊于基准,智能体框架未提升性能,强调多事件评估的必要性。
Comments Project page: https://co-minder.github.io/Societybench
AsyncWebRL: 面向视觉网页智能体的高效多步强化学习
机构 * UIUC(伊利诺伊大学香槟分校) ; Microsoft(微软) ; CMU(卡内基梅隆大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG
AI总结 提出异步系统设计和算法改进,解决多步强化学习中GPU空闲和轨迹过长问题,实现训练吞吐量提升2.9倍,并在WebGym测试集上取得新最优结果。
Comments Updated logo and code link
UniNav:用于视觉导航的统一世界-动作扩散模型
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 UniNav是统一世界-动作扩散模型,通过单扩散过程生成未来视觉观测与航路点轨迹,其变体UniNav-Fast延迟0.1秒且精度无明显下降,在导航基准上ATE优于最强基线。
CoNav-UAV:基于Stackelberg学习的协同双高度无人机导航
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 针对双高度无人机协同导航的合作问题,本文提出CoNav-UAV,通过迭代Stackelberg学习优化高空领导者与低空跟随者,在AerialVLN基准上显著提升导航成功率且适配数据需求更少。
MAGA:基于结构化动作蒸馏的GUI智能体多平台自融合
机构 * Ant Group(蚂蚁集团)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 该研究针对GUI智能体跨平台部署受限问题,提出MAGA方法优化训练信号分配,在8B参数规模下性能优于基准模型,与教师模型表现接近。
Comments 13 pages, 4 figures
为什么GUI智能体正确但延迟?基于决策时间关键路径的解码,用预编译策略树测试
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.LG
AI总结 针对GUI智能体因决策时间关键路径的自回归解码延迟导致瞬态事件失败的问题,提出AAPT策略树方法,提升了决策窗口内的动作成功率,验证了分支路由为关键瓶颈。
桌面增量基准测试:计算机使用模型是否理解桌面GUI转换?
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 研究计算机使用模型对桌面GUI转换的理解,引入桌面增量基准测试(DDB)及其实例、任务,评估多个模型家族,发现排序不饱和,任务上下文对匹配有影响,单动作推断家族更难,DDB填补诊断层,助力改进桌面CUA。
具有竞争性边际的合谋:价格水平审计天生具有盲目性
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 该研究指出价格水平审计天生对特定算法合谋盲目,通过理论分析、语言模型智能体实验及以太坊拍卖数据验证,提出监管应转向竞价身份计数而非检测。
Comments 11 pages, 4 figures, includes technical appendix
PUDA:面向自动驾驶实验室的AI原生硬件控制框架
专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI
AI总结 该研究提出面向自动驾驶实验室的AI原生硬件控制框架PUDA,通过命令行环境实现智能体与硬件的确定性交互,分离科学编排与物理操作,为智能体自动驾驶实验室提供实用执行与数据环境。
通过视觉状态转换扩展 GUI 智能体
机构 * NUS(新加坡国立大学) ; Sea AI Lab(Sea人工智能实验室) ; UTS(悉尼科技大学) ; University of Liverpool(利物浦大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 研究通过状态转换预训练扩展 GUI 智能体,联合优化逆动力学和正向动力学预训练统一多模态模型,在桌面和移动 GUI 场景基准测试中优于基线,联合动力学优化有稳定改进,下游性能随转换数据量提升。
肢体形态
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 研究人工生命系统中Gifbreeder的肢体形态,通过用户审美选择进化时空场产生类似生物的形态,用输入空间扰动评估其行为,探讨其反应是否反映目标导向行为及类似智能体动力学如何在无明确规则系统中出现。
Comments 3 pages, 3 figures. Extended abstract accepted as a Late Breaking Abstract at the Artificial Life Conference (ALIFE 2026)
超越顺序交互:GUI 智能体并行执行与协调的基准测试
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; State Key Laboratory for General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司人工智能研究院) ; China University of Geosciences (Beijing)(中国地质大学(北京)) ; Beijing Institute of Technology(北京理工大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 研究 GUI 智能体长周期任务扩展性差的问题,引入 ParaGUIBench 基准测试及 ParaGUI 智能体,通过实验证明并行执行能提升可分解长周期 GUI 任务的成功率与效率。
Comments 15 pages, 5 figures. Project page: https://github.com/pkgunboat/ParaGUIBench
谁买单?面向真实世界网络代理的以利益相关者为中心的提示注入基准测试
机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ; ST Engineering, Singapore(ST工程,新加坡) ; IBM Research, USA(IBM研究院,美国) ; University of Illinois Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校,美国)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 提出以利益相关者为中心的基准测试框架,系统分类和归因真实世界网络代理系统中的提示注入危害,揭示当前代理无法可靠抵抗任何攻击目标,且失败模式多样。
Comments 25 pages
用于移动网络资源分配的自解释强化学习
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG
AI总结 研究移动网络资源分配问题,核心方法是用自解释神经网络参数化PPO智能体策略并聚合局部解释为全局解释,主要贡献是性能接近最优深度学习方法且显著优于启发式方法,全局解释相关性强,在高风险强化学习中有潜力。
AdvNav:视觉语言导航中基于行为引导的黑盒对抗攻击
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 研究视觉语言导航系统对抗攻击,提出AdvNav框架,利用双粒度行为反馈构建替代目标,采用混合优化策略。在R2R数据集上评估,对两种模型取得较高攻击成功率,证明其有效性与通用性,揭示感知漏洞并为VLN模型设计提供见解。
Comments ACM International Conference on Multimedia 2026
FormGym:用智能体完成文书工作
机构 * Columbia University(哥伦比亚大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 GUI与网页智能体 :tool-use(abstract);分类 cs.AI
AI总结 FormGym提出一个表格填写基准测试,通过FieldFinder工具提升智能体在表格定位和填写任务中的性能
学习、推理、优化:GUI 智能体中卡尼曼双系统智能的框架
机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ; Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑启发式智能科学技术研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Amazon(亚马逊) ; Shanghai Innovation Institute(上海创新研究院) ; ByteDance Douyin Content Group(字节跳动抖音内容部)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 针对 GUI 智能体存在依赖试错决策、评估指标简单等问题,提出 CogniGUI 框架,结合全解析器引擎和 GRPO 基础智能体,实现自适应学习,经实验验证其在新基准测试中优于现有方法。
Comments Withdrawn due to ongoing technical improvements. The work requires further refinement and additional experiments to meet our quality standards. A revised version will be submitted in the future
PGN:基于盘古多模态基础模型的视觉语言导航系统的设计与实现
机构 * University of Electronic Science and Technology of China(电子科技大学) ; School of Information and Communication Engineering(信息与通信工程学院)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 研究基于盘古多模态基础模型设计实现视觉语言导航系统PGN,训练分两阶段,先对齐视觉与语言编码器,再使模型适应专家轨迹,结合多种计算方式,在特定评估下取得一定指标,量化了离线专家动作对齐情况。
Comments 6 pages, 5 figures
SmartRAG:用于移动设备的基于原生图的RAG
机构 * Nanjing University(南京大学) ; HUST(华中科技大学) ; Southeast University(东南大学)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 研究针对移动设备部署大语言模型的问题,提出SmartRAG框架,围绕四个模块组织智能助手,核心是可持续学习的EvoNER,知识存于MRGraph,通过混合管道检索,实验表明其在多跳推理性能上有竞争力且能在普通智能手机上运行。
Comments 14 pages, 4 figures
图形用户界面代理相信它们的眼睛吗?诊断状态信念对像素与结构的依赖
机构 * Shenzhen University(深圳大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 研究多模态GUI代理状态信念来源,通过对310个真实探针进行单通道干预形式化视觉状态依赖并测量,核心指标是感知融合差距,发现文本状态信念依赖结构,图像精度高,错误会导致行动失败。
Comments 17 pages, 3 figures
不应学习的地方:基于子集归因约束的先验对齐训练以实现可靠的决策制定
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) ; Communication University of China(中国传媒大学) ; Imperial College London(伦敦帝国学院) ; School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG
AI总结 本文提出了一种基于归因的先验对齐方法,通过子集选择归因技术约束模型依赖于人类先验区域,从而提升决策的可靠性。
SeerGuard:一种通过世界模型预测实现的移动 GUI 代理安全框架
机构 * JIUTIAN Research(九天研究)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 研究针对移动 GUI 代理安全风险问题,提出 SeerGuard 框架,通过执行前指令级筛选和行动级风险评估减轻风险。构建安全增强世界模型,经实验验证其在不同代理上有效泛化,提升了安全效用分数并降低风险成本分数。
Comments 19 pages, 8 figures
触觉:赋予使用计算机的智能体双手和双脚
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 研究针对计算机使用智能体操作层脆弱的问题,提出开源工具Tactile,将异构UI证据转换为基于动作的接口状态,通过特定循环操作。在相关任务中能提升Codex Success@100,证明可靠计算机使用需更强模型及可重用执行基础。
基于宏观动作和拓扑地图的深度强化学习导航
机构 * Institute for Neural Computation, Faculty of Computer Science, Ruhr University Bochum, Germany(神经计算研究所,计算机科学学院,博德姆鲁尔大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG
AI总结 本文提出了一种基于拓扑地图和宏观动作的深度强化学习导航方法,通过简化问题复杂度实现高效的样本学习。
Comments 14 pages, 6 figures
Journal ref Machine Learning, Optimization, and Data Science. LOD 2025. Lecture Notes in Computer Science, vol 16467
KnowAct-GUIClaw:深度理解、完美执行,具有自我进化记忆和技能的个人GUI助手
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL
AI总结 针对OpenClaw的不足,提出深度理解、完美执行范式,介绍KnowAct-GUIClaw框架,通过多系统实验验证其在效率、准确性和跨平台适应性方面的优势,且知识记忆和执行技能可跨基础模型迁移。
Comments 29 pages, 9 figures
PixelLoop:具有像素级环路的捷径拓扑导航
机构 * Robotics Research Center, IIIT-Hyderabad(国际信息技术学院海得拉巴分校机器人研究中心)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 研究拓扑映射和导航中环路闭合作用,提出PixelLoop方法在像素空间引入环路闭合,充当密集拓扑捷径,经模拟实验和真实机器人部署验证,相比基线在成功率和SPL上有显著提升,为拓扑视觉导航提供基础。
Comments 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS); 8 pages, 5 figures
Prismata:限制Web代理中的跨站提示注入
机构 * UC Berkeley(加州大学伯克利分校)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 研究针对Web代理跨站提示注入问题,提出Prismata防御机制,通过动态信任推导生成权限标签,结合机械限制执行标签,无需开发者注释,能有效降低攻击成功率并保留良性任务效用。
HumAIN:人类感知的隐式社交机器人导航
机构 * Ewha Womans University(梨花女子大学) ; George Mason University(乔治梅森大学) ; University of Virginia(弗吉尼亚大学) ; Tufts University(塔夫茨大学) ; Semio(Semio公司) ; Hokkaido University(北海道大学)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 研究提出HumAIN框架,通过知识蒸馏将隐式社交线索融入机器人导航规划。利用基于Transformer的教师模型学习强大表示,蒸馏到轻量级学生模型。实验表明该方法能有效提升轨迹预测指标,在资源受限平台实现类人导航意识。
Comments 8 pages, 4 figures. Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
GUI代理是否足够专注?通过语义层面的UI元素注入实现自动化干扰
机构 * SAIS, UCAS(中国科学院大学人工智能学院) ; SIST, ShanghaiTech University(上海科技大学信息科学与技术学院)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL
AI总结 本文提出语义层面UI元素注入方法,通过在截图上叠加安全对齐且无害的UI元素来误导代理的视觉基础。实验显示,该方法在五个受害者模型上提升了攻击成功率,并证明注入元素可作为持久吸引器。
Comments Accepted by ECCV 2026, public code at https://github.com/HashTAG00002/UI-Injection