arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2971 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 2971 篇

2608.07079 2026-08-10 cs.RO cs.AI 新提交 57%

LifelongCrossNav: Persistent 3D Semantic Memory for Cross-Floor Multi-Object Navigation

LifelongCrossNav:用于跨楼层多目标导航的持久3D语义记忆

Zehui Li, Zihao Sun, Jiawei Xu, Zheqi He, Xiaoqiang Zhang, Jing-Shu Zheng, Lu Liu, Dahui Gao, Xiuwan Chen

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出LifelongCrossNav框架,结合持久3D语义记忆与跨楼层可通行性建模,在自研HM3D-MFMON基准上实现更优的多层顺序多目标导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04009 2026-08-10 cs.CL 版本更新 57%

SocietyBench: Forecasting Counterfactual Social-World Evolution

SocietyBench:反事实社会世界演化预测

Zhenran Wang, Zhonghan Bian, Jinsong Li, Zhangyang Qi

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL

AI总结 本文推出SocietyBench基准,通过构建反事实社会世界,测试LLMs预测社会事件的概率校准与时间准确性,发现前沿LLMs表现远逊于基准,智能体框架未提升性能,强调多事件评估的必要性。

Comments Project page: https://co-minder.github.io/Societybench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05597 2026-08-10 cs.LG 版本更新 57%

AsyncWebRL: Efficient Asynchronous Reinforcement Learning for Multi-Step Visual Web Agents

AsyncWebRL: 面向视觉网页智能体的高效多步强化学习

Hao Bai, Rui Yang, Chenlu Ye, Spencer Whitehead, Aviral Kumar, Tong Zhang

机构 * UIUC(伊利诺伊大学香槟分校) Microsoft(微软) CMU(卡内基梅隆大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 提出异步系统设计和算法改进,解决多步强化学习中GPU空闲和轨迹过长问题,实现训练吞吐量提升2.9倍,并在WebGym测试集上取得新最优结果。

Comments Updated logo and code link

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03244 2026-08-05 cs.AI 新提交 57%

UniNav: A Unified World-Action Diffusion Model for Visual Navigation

UniNav:用于视觉导航的统一世界-动作扩散模型

Changqing Zhou, Yueru Luo, Zeyu Jiang, Changhao Chen

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 UniNav是统一世界-动作扩散模型,通过单扩散过程生成未来视觉观测与航路点轨迹,其变体UniNav-Fast延迟0.1秒且精度无明显下降,在导航基准上ATE优于最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01802 2026-08-04 cs.AI cs.RO 新提交 57%

CoNav-UAV: Cooperative Dual-Altitude Aerial Navigation via Stackelberg Learning

CoNav-UAV:基于Stackelberg学习的协同双高度无人机导航

Junru Song, Wenhao Zhang, Yang Yang, Xuekai Qiu, Feifei Wang, Weien Zhou, Tingsong Jiang, Ying Wen, Yang Li, Wen Yao

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 针对双高度无人机协同导航的合作问题,本文提出CoNav-UAV,通过迭代Stackelberg学习优化高空领导者与低空跟随者,在AerialVLN基准上显著提升导航成功率且适配数据需求更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29320 2026-08-03 cs.AI 新提交 57%

MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation

MAGA:基于结构化动作蒸馏的GUI智能体多平台自融合

Hang Yan, Zhangxuan GU, Beitong Zhou, Jiaxuan Chen, Runze Li, Yusong Hu, Shuheng Shen, Changhua Meng

机构 * Ant Group(蚂蚁集团)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 该研究针对GUI智能体跨平台部署受限问题,提出MAGA方法优化训练信号分配,在8B参数规模下性能优于基准模型,与教师模型表现接近。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28399 2026-07-31 cs.LG 新提交 57%

Why Are GUI Agents Correct but Late? Decode on the Decision-Time Critical Path, Tested with Pre-Compiled Policy Trees

为什么GUI智能体正确但延迟?基于决策时间关键路径的解码,用预编译策略树测试

Zihan Dong, Rui Qian, Qishi Zhan, Dongshen Peng, Kaixin Li, Yu Li

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.LG

AI总结 针对GUI智能体因决策时间关键路径的自回归解码延迟导致瞬态事件失败的问题,提出AAPT策略树方法,提升了决策窗口内的动作成功率,验证了分支路由为关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26041 2026-07-31 cs.AI cs.CV 版本更新 57%

Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions?

桌面增量基准测试:计算机使用模型是否理解桌面GUI转换?

Abhishek Pillai, Samir Kumar Nayak, Yuan Chen

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 研究计算机使用模型对桌面GUI转换的理解,引入桌面增量基准测试(DDB)及其实例、任务,评估多个模型家族,发现排序不饱和,任务上下文对匹配有影响,单动作推断家族更难,DDB填补诊断层,助力改进桌面CUA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26385 2026-07-30 cs.GT cs.AI cs.CR 新提交 57%

Collusion with Competitive Marginals: Price-Level Audits Are Blind by Construction

具有竞争性边际的合谋:价格水平审计天生具有盲目性

Xin Xu, Chengrui Wu, Jiayu Lu, Kaizhen Tan, Siru Tao, Hanzhe Hong

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 该研究指出价格水平审计天生对特定算法合谋盲目,通过理论分析、语言模型智能体实验及以太坊拍卖数据验证,提出监管应转向竞价身份计数而非检测。

Comments 11 pages, 4 figures, includes technical appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26464 2026-07-30 cond-mat.mtrl-sci cs.AI 新提交 57%

PUDA: An AI-Native Hardware Harness for Self-Driving Laboratories

PUDA:面向自动驾驶实验室的AI原生硬件控制框架

Zekun Ren, Hongzhao Tan, Jiaen Yee, Kedar Hippalgaonkar

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI

AI总结 该研究提出面向自动驾驶实验室的AI原生硬件控制框架PUDA,通过命令行环境实现智能体与硬件的确定性交互,分离科学编排与物理操作,为智能体自动驾驶实验室提供实用执行与数据环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24112 2026-07-28 cs.AI 新提交 57%

Scaling GUI Agents with Visual State Transitions

通过视觉状态转换扩展 GUI 智能体

Xiangyan Liu, Kaixin Li, Haonan Wang, Biao Wu, Meng Fang, Longxu Dou, Chao Du, Michael Qizhe Shieh, Tianyu Pang

机构 * NUS(新加坡国立大学) Sea AI Lab(Sea人工智能实验室) UTS(悉尼科技大学) University of Liverpool(利物浦大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究通过状态转换预训练扩展 GUI 智能体,联合优化逆动力学和正向动力学预训练统一多模态模型,在桌面和移动 GUI 场景基准测试中优于基线,联合动力学优化有稳定改进,下游性能随转换数据量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23842 2026-07-28 cs.NE cs.AI 新提交 57%

Limbomorphs

肢体形态

Alex Alvarez, Michael Levin

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究人工生命系统中Gifbreeder的肢体形态,通过用户审美选择进化时空场产生类似生物的形态,用输入空间扰动评估其行为,探讨其反应是否反映目标导向行为及类似智能体动力学如何在无明确规则系统中出现。

Comments 3 pages, 3 figures. Extended abstract accepted as a Late Breaking Abstract at the Artificial Life Conference (ALIFE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22689 2026-07-28 cs.AI 新提交 57%

Beyond Sequential Interaction: Benchmarking Parallel Execution and Coordination for GUI Agents

超越顺序交互:GUI 智能体并行执行与协调的基准测试

Zedong Yu, Qianxing Li, Zhi Gao, Liuyu Xiang, Chenrui Shi, Yang Liu, Huiming Wu, Yujie Wei, Yuhao Fei, Yubo Fu, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory for General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司人工智能研究院) China University of Geosciences (Beijing)(中国地质大学(北京)) Beijing Institute of Technology(北京理工大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究 GUI 智能体长周期任务扩展性差的问题,引入 ParaGUIBench 基准测试及 ParaGUI 智能体,通过实验证明并行执行能提升可分解长周期 GUI 任务的成功率与效率。

Comments 15 pages, 5 figures. Project page: https://github.com/pkgunboat/ParaGUIBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13385 2026-07-28 cs.CR cs.AI cs.CY cs.HC cs.MM 版本更新 57%

Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents

谁买单?面向真实世界网络代理的以利益相关者为中心的提示注入基准测试

Zihao Wang, Yiming Li, Yutong Wu, Kangjie Chen, Zheyu Liu, Fok Kar Wai, Pin-Yu Chen, Vrizlynn L. L. Thing, Bo Li, Dacheng Tao, Tianwei Zhang

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ST Engineering, Singapore(ST工程,新加坡) IBM Research, USA(IBM研究院,美国) University of Illinois Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校,美国)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出以利益相关者为中心的基准测试框架,系统分类和归因真实世界网络代理系统中的提示注入危害,揭示当前代理无法可靠抵抗任何攻击目标,且失败模式多样。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14925 2026-07-23 cs.LG cs.NI 版本更新 57%

Self-Explaining Reinforcement Learning for Mobile Network Resource Allocation

用于移动网络资源分配的自解释强化学习

Konrad Nowosadko, Franco Ruggeri, Ahmad Terra

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 研究移动网络资源分配问题,核心方法是用自解释神经网络参数化PPO智能体策略并聚合局部解释为全局解释,主要贡献是性能接近最优深度学习方法且显著优于启发式方法,全局解释相关性强,在高风险强化学习中有潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11063 2026-07-22 cs.AI 版本更新 57%

AdvNav: Behavior-Guided Black-Box Adversarial Attacks on Vision-Language Navigation

AdvNav:视觉语言导航中基于行为引导的黑盒对抗攻击

Chenyang Li, Kaige Li, Zeyu Jiang, Changhao Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究视觉语言导航系统对抗攻击,提出AdvNav框架,利用双粒度行为反馈构建替代目标,采用混合优化策略。在R2R数据集上评估,对两种模型取得较高攻击成功率,证明其有效性与通用性,揭示感知漏洞并为VLN模型设计提供见解。

Comments ACM International Conference on Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14079 2026-07-22 cs.AI 版本更新 57%

FormGym: Doing Paperwork with Agents

FormGym:用智能体完成文书工作

Matthew Toles, Rattandeep Singh, Isaac Song, Zhou Yu

机构 * Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 GUI与网页智能体 :tool-use(abstract);分类 cs.AI

AI总结 FormGym提出一个表格填写基准测试,通过FieldFinder工具提升智能体在表格定位和填写任务中的性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17913 2026-07-22 cs.AI 版本更新 57%

Learning, Reasoning, Refinement: A Framework for Kahneman's Dual-System Intelligence in GUI Agents

学习、推理、优化:GUI 智能体中卡尼曼双系统智能的框架

Jinjie Wei, Jiyao Liu, Lihao Liu, Ming Hu, Junzhi Ning, Mingcheng Li, Weijie Yin, Junjun He, Xiao Liang, Chao Feng, Dingkang Yang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑启发式智能科学技术研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Amazon(亚马逊) Shanghai Innovation Institute(上海创新研究院) ByteDance Douyin Content Group(字节跳动抖音内容部)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 针对 GUI 智能体存在依赖试错决策、评估指标简单等问题,提出 CogniGUI 框架,结合全解析器引擎和 GRPO 基础智能体,实现自适应学习,经实验验证其在新基准测试中优于现有方法。

Comments Withdrawn due to ongoing technical improvements. The work requires further refinement and additional experiments to meet our quality standards. A revised version will be submitted in the future

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17806 2026-07-21 cs.AI 新提交 57%

PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model

PGN:基于盘古多模态基础模型的视觉语言导航系统的设计与实现

Li Xian, Mingxi Li, Yizheng Wang, Yiming Shen, Qi Chen, Zhuoling Xiao

机构 * University of Electronic Science and Technology of China(电子科技大学) School of Information and Communication Engineering(信息与通信工程学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究基于盘古多模态基础模型设计实现视觉语言导航系统PGN,训练分两阶段,先对齐视觉与语言编码器,再使模型适应专家轨迹,结合多种计算方式,在特定评估下取得一定指标,量化了离线专家动作对齐情况。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14661 2026-07-21 cs.AI 版本更新 57%

SmartRAG: Native Graph-Based RAG for Mobile Device

SmartRAG:用于移动设备的基于原生图的RAG

Zhihan Jiang, Meng Li, Shenghao Liu, Keran Li, Ruiben Zhou, Wei Wang, Xianjun Deng, Shuai Wang, Haipeng Dai

机构 * Nanjing University(南京大学) HUST(华中科技大学) Southeast University(东南大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 研究针对移动设备部署大语言模型的问题,提出SmartRAG框架,围绕四个模块组织智能助手,核心是可持续学习的EvoNER,知识存于MRGraph,通过混合管道检索,实验表明其在多跳推理性能上有竞争力且能在普通智能手机上运行。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04334 2026-07-21 cs.AI 版本更新 57%

Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure

图形用户界面代理相信它们的眼睛吗?诊断状态信念对像素与结构的依赖

Guijia Zhang, Yuxun Chen, Yuheng Qi, Harry Yang

机构 * Shenzhen University(深圳大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究多模态GUI代理状态信念来源,通过对310个真实探针进行单通道干预形式化视觉状态依赖并测量,核心指标是感知融合差距,发现文本状态信念依赖结构,图像精度高,错误会导致行动失败。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07008 2026-07-21 cs.CV cs.LG 版本更新 57%

Where Not to Learn: Prior-Aligned Training with Subset-based Attribution Constraints for Reliable Decision-Making

不应学习的地方:基于子集归因约束的先验对齐训练以实现可靠的决策制定

Ruoyu Chen, Shangquan Sun, Xiaoqing Guo, Sanyi Zhang, Kangwei Liu, Shiming Liu, Zhangcheng Wang, Qunli Zhang, Wei Wang, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) Communication University of China(中国传媒大学) Imperial College London(伦敦帝国学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于归因的先验对齐方法,通过子集选择归因技术约束模型依赖于人类先验区域,从而提升决策的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15550 2026-07-20 cs.AI 新提交 57%

SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction

SeerGuard:一种通过世界模型预测实现的移动 GUI 代理安全框架

Xue Yu, Bo Yuan, Pengshuai Yang, Kailin Zhao, Hong Hu, Junlan Feng

机构 * JIUTIAN Research(九天研究)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究针对移动 GUI 代理安全风险问题,提出 SeerGuard 框架,通过执行前指令级筛选和行动级风险评估减轻风险。构建安全增强世界模型,经实验验证其在不同代理上有效泛化,提升了安全效用分数并降低风险成本分数。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14443 2026-07-17 cs.AI 新提交 57%

Tactile: Giving Computer-Using Agents Hands and Feet

触觉:赋予使用计算机的智能体双手和双脚

Yong Liu, Zhenyi Zhong, Zhanpeng Shi

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究针对计算机使用智能体操作层脆弱的问题,提出开源工具Tactile,将异构UI证据转换为基于动作的接口状态,通过特定循环操作。在相关任务中能提升Codex Success@100,证明可靠计算机使用需更强模型及可重用执行基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18300 2026-07-17 cs.LG 57%

Deep Reinforcement Learning Based Navigation with Macro Actions and Topological Maps

基于宏观动作和拓扑地图的深度强化学习导航

Simon Hakenes, Tobias Glasmachers

机构 * Institute for Neural Computation, Faculty of Computer Science, Ruhr University Bochum, Germany(神经计算研究所,计算机科学学院,博德姆鲁尔大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于拓扑地图和宏观动作的深度强化学习导航方法,通过简化问题复杂度实现高效的样本学习。

Comments 14 pages, 6 figures

Journal ref Machine Learning, Optimization, and Data Science. LOD 2025. Lecture Notes in Computer Science, vol 16467

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12625 2026-07-16 cs.CL cs.CV 版本更新 57%

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

KnowAct-GUIClaw:深度理解、完美执行,具有自我进化记忆和技能的个人GUI助手

Yunxin Li, Jinchao Li, Shibo Su, Zhenran Xu, Chenrui Zhao, Tongshu Bian, Xiaoman Liang, Meishan Zhang, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL

AI总结 针对OpenClaw的不足,提出深度理解、完美执行范式,介绍KnowAct-GUIClaw框架,通过多系统实验验证其在效率、准确性和跨平台适应性方面的优势,且知识记忆和执行技能可跨基础模型迁移。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12811 2026-07-15 cs.RO cs.AI 新提交 57%

PixelLoop: Shortcut Topological Navigation with Pixel-Level Loops

PixelLoop:具有像素级环路的捷径拓扑导航

Sarthak Chittawar, Vansh Garg, Aditya Vadali, Krish Pandya, Rohit Jayanti, Sourav Garg, Madhava Krishna

机构 * Robotics Research Center, IIIT-Hyderabad(国际信息技术学院海得拉巴分校机器人研究中心)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 研究拓扑映射和导航中环路闭合作用,提出PixelLoop方法在像素空间引入环路闭合,充当密集拓扑捷径,经模拟实验和真实机器人部署验证,相比基线在成功率和SPL上有显著提升,为拓扑视觉导航提供基础。

Comments 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS); 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08147 2026-07-10 cs.CR cs.AI 新提交 57%

Prismata: Confining Cross-Site Prompt Injection in Web Agents

Prismata:限制Web代理中的跨站提示注入

Corban Villa, Alp Eren Ozdarendeli, Sijun Tan, Raluca Ada Popa

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究针对Web代理跨站提示注入问题,提出Prismata防御机制,通过动态信任推导生成权限标签,结合机械限制执行标签,无需开发者注释,能有效降低攻击成功率并保留良性任务效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07357 2026-07-09 cs.RO cs.AI 新提交 57%

HumAIN: Human-Aware Implicit Social Robot Navigation

HumAIN:人类感知的隐式社交机器人导航

Daeun Song, Nhat Le, Jeffrey Chen, Mohammad Nazeri, Amirreza Payandeh, Rohan Chandra, Reuth Mirsky, Ross Mead, Ling Xiao, Xuesu Xiao

机构 * Ewha Womans University(梨花女子大学) George Mason University(乔治梅森大学) University of Virginia(弗吉尼亚大学) Tufts University(塔夫茨大学) Semio(Semio公司) Hokkaido University(北海道大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 研究提出HumAIN框架,通过知识蒸馏将隐式社交线索融入机器人导航规划。利用基于Transformer的教师模型学习强大表示,蒸馏到轻量级学生模型。实验表明该方法能有效提升轨迹预测指标,在资源受限平台实现类人导航意识。

Comments 8 pages, 4 figures. Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07831 2026-07-09 cs.CR cs.CL cs.CV 版本更新 57%

Are GUI Agents Focused Enough? Automated Distraction via Semantic-level UI Element Injection

GUI代理是否足够专注?通过语义层面的UI元素注入实现自动化干扰

Wenkui Yang, Chao Jin, Haisu Zhu, Weilin Luo, Derek Yuen, Kun Shao, Junxian Duan, Huaibo Huang, Jie Cao, Ran He

机构 * SAIS, UCAS(中国科学院大学人工智能学院) SIST, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL

AI总结 本文提出语义层面UI元素注入方法,通过在截图上叠加安全对齐且无害的UI元素来误导代理的视觉基础。实验显示,该方法在五个受害者模型上提升了攻击成功率,并证明注入元素可作为持久吸引器。

Comments Accepted by ECCV 2026, public code at https://github.com/HashTAG00002/UI-Injection

详情

展开后加载摘要…

URL PDF HTML 收藏