arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2982 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 2982 篇

2607.03792 2026-07-07 cs.RO cs.CV 新提交 50%

From Region Arrival to Instance-Level Grounding in Vision-and-Language Navigation

从视觉语言导航中的区域到达到实例级定位

Xiangyu Shi, Ruoxi Yang, Wei Tao, Jiwen Zhang, Yanyuan Qiao, Qi Wu

机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) Ruyi Dynamics(如意动力) Fudan University(复旦大学) Swiss Federal Institute of Technology Lausanne (EPFL)(瑞士洛桑联邦理工学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 研究视觉语言导航中当前评估协议局限,提出‘最后3米定位差距’及指标,构建REALM模块和REVERIE - AIM数据集,可减少过早终止,提升定位精度和视觉定位成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08828 2026-07-07 cs.NI eess.SP 版本更新 50%

Mobile Base Station Optimal Tour in Wide Area IoT Sensor Networks

广域物联网传感器网络中的移动基站最优巡回

Sachin Kadam

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对广域物联网传感器网络,提出移动基站最优巡回(MOT)问题,通过形式化建模为组合优化问题,因计算难设计多项式时间贪婪启发式算法,模拟结果显示算法能低成本、全覆盖且快速执行。

Comments Accepted for publication at the Proceedings of SPCOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01460 2026-07-03 cs.CY cs.SI 新提交 50%

Social-Annotate: Self-Healing Browser Extension to Annotate and Collect Social Media Data

Social-Annotate: 用于标注和收集社交媒体数据的自愈浏览器扩展

Ali Najafi, Ismail Uluturk, Onur Varol

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出Social-Annotate浏览器扩展,通过注入可定制表单实现在线平台直接数据收集,并集成大语言模型驱动的自愈代理以应对界面变化,支持12个平台,降低数据收集和维护成本。

Comments 13 pages, 3 figures, 1 SI-table, 2 SI-figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01454 2026-07-03 cs.RO 新提交 50%

SE(2) Navigation Mesh

SE(2)导航网格

Shuyang Shi, Kaixian Qu, Changan Chen, Ines Kast, Yuntao Ma, Marco Hutter

机构 * Robotic Systems Lab, ETH Zurich(苏黎世联邦理工学院机器人系统实验室)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出SE(2)导航网格,通过编码偏航依赖的可通行性,支持非圆形机器人在复杂多层环境中的高效路径规划,并开发了A*-拉绳-A*分层路径搜索策略。

Comments Project page: https://se2-navmesh.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18803 2026-07-03 cs.RO 版本更新 50%

Learning to Localize Reference Trajectories in Image-Space for Visual Navigation

学习在图像空间中定位参考轨迹用于视觉导航

Finn Lukas Busch, Matti Vahs, Quantao Yang, Jesús Gerardo Ortega Peimbert, Yixi Cai, Jana Tumova, Olov Andersson

机构 * Division of Robotics, Perception, and Learning(机器人、感知与学习 division) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出LoTIS模型,通过定位参考轨迹在机器人当前视图中的图像坐标,实现无需相机标定、位姿或机器人特定训练的跨实体视觉导航,在正向导航中成功率提升20-50个百分点,达到94-98%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00709 2026-07-02 cs.NI 新提交 50%

Mobile Base Station Positioning in Smart Ports Based on Kriged Sparse Measurements and Obstacle Inference

基于克里金稀疏测量与障碍推断的智慧港口移动基站定位

Paulo Furtado Correia, André Coelho, Manuel Ricardo

专题命中 GUI与网页智能体 :workflow(abstract)

AI总结 提出DOCKING框架,利用普通克里金法重建无线环境图并推断障碍物模型,实现移动集成接入与回传部署优化,在稀疏测量下达到高精度与容量增益。

Comments 15 pages, 14 figures. Submitted to IEEE Open Journal of the Communications Society

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29991 2026-06-30 cs.IR 50%

Behind the Content: Wikipedia Mobile Views and Tourism Activity

内容背后:维基百科移动端浏览量与旅游活动

Lucas Eustache, Paul Favier

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 研究利用维基百科移动端浏览量作为高频、可解释的旅游活动指标,发现其与当日酒店需求和景点访客量正相关,优于桌面端浏览量。

Journal ref 31e Conf{é}rence de l'Association Information et Management, Association Information et Management, May 2026, Neuch{â}tel, Switzerland

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29566 2026-06-30 cs.RO 50%

Analyzing Uncertainty in the Spatial Representation of the Kinematic Bicycle Model

分析运动学自行车模型空间表示中的不确定性

Shafayat Abrar, M. Zaeem Baig, Shahir Ul Islam Anzal, Abdul Basit Memon

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对车辆运动学模型中的不确定性,采用泰勒级数线性化三角函数,推导了协方差矩阵的闭式表达式,与蒙特卡洛模拟吻合,首次完整给出了协方差矩阵的闭式解。

Journal ref In 2025 International Conference on Emerging Technologies in Electronics, Computing, and Communication (ICETECC) (pp. 1-6). IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05377 2026-06-30 cs.RO cs.CV 50%

OpenFrontier: General Navigation with Visual-Language Grounded Frontiers

OpenFrontier: 基于视觉-语言基础的通用导航

Esteban Padilla-Cerdio, Boyang Sun, Marc Pollefeys, Hermann Blum

机构 * ETH Zurich(苏黎世联邦理工学院) Microsoft Spatial AI Lab(微软空间人工智能实验室) University of Bonn(波恩大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出OpenFrontier框架,通过稀疏子目标识别与到达问题实现高效导航,无需任务特定训练或微调,适用于多种视觉-语言先验模型,展示零样本性能和真实机器人部署效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10310 2026-06-30 cs.CV 50%

Efficient-VLN: A Simple yet Strong Baseline for Efficient Vision-Language Navigation

Efficient-VLN: 一种高效且强大的视觉语言导航基线

Duo Zheng, Shijia Huang, Yanyang Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Weitu AI

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 Efficient-VLN通过三个简单有效机制解决视觉语言导航中的系统瓶颈,提升推理效率和训练稳定性,在R2R-CE和RxR-CE基准上取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13561 2026-06-30 cs.CR 50%

GuardianPWA: Enhancing Security Throughout the Progressive Web App Installation Lifecycle

GuardianPWA: 提升渐进式Web应用安装生命周期的安全性

Mengxiao Wang, Guofei Gu

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出GUARDIANPWA框架,基于CIA原则分析PWA安装机制,发现203处安全违规,揭示浏览器厂商在PWA安装生命周期中的隐私风险,并帮助开发者提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27871 2026-06-29 cs.RO 新提交 50%

LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation

LocalNav: 蒸馏前沿视觉语言模型与具身强化学习用于设备端物体目标导航

Nicolas Baumann, Liam Boyle, Pu Deng, Edoardo Ghignone, Boyang Sun, Marc Pollefeys, Luca Benini, Michele Magno

机构 * Center for Project-Based Learning(项目学习中心) Integrated Systems Laboratory(集成系统实验室)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出蒸馏策略将大型VLM的空间语义推理迁移至轻量级本地VLM,结合E-RLVR与令牌生成正则化,在嵌入式设备上实现低延迟物体目标导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09241 2026-06-29 cs.CV cs.RO 版本更新 50%

RAE-NWM: Navigation World Model in Dense Visual Representation Space

RAE-NWM:密集视觉表示空间中的导航世界模型

Mingkun Zhang, Wangtian Shen, Fan Zhang, Haijian Qin, Zihao Pei, Ziyang Meng

机构 * Department of Precision Instrument, Tsinghua University(清华大学精密仪器系) University of Rochester(罗切斯特大学) Beijing Information Science and Technology University(北京信息科技大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出RAE-NWM,在密集视觉表示空间中使用条件扩散Transformer建模导航动态,提升结构稳定性和动作精度,从而改善下游规划与导航。

Comments Code is available at: https://github.com/20robo/raenwm

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12501 2026-06-26 cs.NI 版本更新 50%

Collaborative Charging Optimization for Wireless Rechargeable Sensor Networks via Heterogeneous Mobile Chargers

异构移动充电器协同优化无线可充电传感器网络充电

Jianhang Yao, Hui Kang, Geng Sun, Jiahui Li, Hongjuan Li, Jiacheng Wang, Yinqiu Liu

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 针对无线可充电传感器网络能量受限问题,提出异构移动充电架构,结合无人机与地面智能车协同充电,并设计IHATRPO算法优化充电效率,显著降低节点死亡率。

Comments 16 pages, 52 figures, submitted to IEEE Internet of Things Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25119 2026-06-25 cs.RO 新提交 50%

SurveilNav: Collaborative Object Goal Navigation with Robot and Surveillance System

SurveilNav: 机器人与监控系统协同的目标导航

Ming-Ming Yu, Qunbo Wang, Rongtao Xu, Yanghong Mei, Yirong Yang, Longteng Guo, Wenjun Wu, Jing Liu

机构 * Beihang University(北京航空航天大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Jiaotong University(北京交通大学) ATeam University of Chinese Academy of Sciences(中国科学院大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出SurveilNav框架,通过主动摄像头调度、联合2D/3D建图、基于VLM的价值估计和协同目标验证,融合机器人动态局部感知与监控全局视图,在HM3D数据集上实现领先的探索效率和导航成功率。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24525 2026-06-24 cs.CV 新提交 50%

VisCritic: Visual State Comparison as Process Reward for GUI Agents

VisCritic: 视觉状态比较作为GUI智能体的过程奖励

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出VisCritic框架,通过比较操作前后截图在视觉特征空间中的变化来验证GUI智能体动作,结合孪生视觉Transformer和动作感知评判头,无需额外人工标注即可提升多基准测试性能。

Comments 17 pages, 4 figures; ECCV 2026 submission; supplementary material uploaded as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08766 2026-06-24 physics.flu-dyn 版本更新 50%

Optimal navigation in two-dimensional flows: Control theory and reinforcement learning

二维流动中的最优导航:控制理论与强化学习

Vladimir Parfenyev

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 研究在二维流动中,受平流和自推进的智能体(如漂浮无人机)的最小时间路径问题,利用最优控制理论求解,并应用强化学习(Q学习和演员-评论家算法)设计鲁棒导航策略,在规则流中接近最优解,在湍流中偏差增大,且粗粒化训练可泛化至全流场。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21216 2026-06-23 cs.RO 新提交 50%

A scalar per patch from pre-trained ViTs enables fast moving navigation in the real world

来自预训练ViT的每补丁标量实现现实世界快速移动导航

Steeven Janny, Leonid Antsfeld, Christian Wolf

机构 * NaverLabs Europe(NaverLabs欧洲)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 通过大规模真实世界导航实验,研究预训练视觉编码器在机器人导航中的关键组件,提出异构多教师蒸馏和瓶颈策略,发现可解释特征与可供性关联,并证明仅用RGB训练非最优。

Comments European Conference on Computer Vision -- ECCV 2026

Journal ref European Conference on Computer Vision -- ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20755 2026-06-23 cs.RO 新提交 50%

UNSEEN: Uncertainty-aware Navigation via Sparse Estimation in Unknown Environments

UNSEEN: 未知环境中基于稀疏估计的不确定性感知导航

Tommaso Faraci, Marco Camurri, Daniele Fontanelli, Luigi Palopoli

机构 * University of Trento(特伦托大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出UNSEEN框架,仅用前视相机通过稀疏地图与位姿不确定性估计,联合优化任务进度与估计精度,在未知环境中实现鲁棒导航,相比现有方法定位误差降低9.8%,估计精度提升45%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22219 2026-06-23 physics.soc-ph 新提交 50%

Lost in Aggregation: A Multi-Scale Diagnostic Benchmark for LLM Spatial Navigation

迷失在聚合中:LLM空间导航的多尺度诊断基准

Yuhan jiang, Peng Luo, Liqiu Meng

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出多尺度诊断基准,将迷宫导航分解为局部、节点和全局三个认知层次,评估LLM在空间推理中的失败位置,发现跨尺度聚合是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17525 2026-06-23 cs.RO 版本更新 50%

HumanHalo -- Safe and Efficient 3D Navigation Among Humans via Minimally Conservative MPC

HumanHalo -- 通过最小保守MPC实现安全高效的三维人群导航

Simon Schaefer, Helen Oleynikova, Sandra Hirche, Stefan Leutenegger

机构 * Technical University of Munich(慕尼黑技术大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出HumanHalo框架,结合可达性安全保证与数据驱动人体运动预测,通过仅约束初始控制输入实现安全高效的3D MAV人群导航,在仿真和真实实验中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18313 2026-06-23 cs.CV 版本更新 50%

OmniNWM: Omniscient Driving Navigation World Models

OmniNWM:全知驾驶导航世界模型

Bohan Li, Zhuang Ma, Dalong Du, Baorui Peng, Zhujin Liang, Zhenqiang Liu, Xianda Guo, Zheng Zhu, Chao Ma, Yueming Jin, Xin Jin, Hao Zhao, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东部技术研究所) PhiGent National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Wuhan University(武汉大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出OmniNWM全知全景导航世界模型,在统一概率框架下处理状态、动作和奖励三个维度,实现多模态全景视频生成、零样本轨迹控制及内在奖励机制,在生成保真度和控制精度上达到SOTA。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16000 2026-06-23 cs.CV 版本更新 50%

SenseExpo: Spatial Exploration and Navigation via Scene Estimation from Expeditious Predictive Operators

SenseExpo: 通过快速预测算子的场景估计进行空间探索与导航

Haojia Gao, Haohua Que, Mingkai Liu, Jiayue Xie, Hoiian Au, Yusen Qin, Qian Zhang, Jiajun Sun, Weihao Shan, Tianle Zhu, Handong Yao, Fei Qiao

机构 * Tsinghua University(清华大学) University of Georgia(佐治亚大学) Peking University(北京大学) D-Robotics(D-机器人) Infinity Robotics(Infinity机器人)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出轻量级单机器人探索框架SenseExpo,结合紧凑地图预测网络与前沿策略,以709K参数实现优于U-Net和LaMa的预测性能,并在探索实验中显著加速目标覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16232 2026-06-16 cs.RO 新提交 50%

PolyMerge: Compressing 3D Gaussian Splats with Polytope Coverings for Provably Safe Resource-Constrained Navigation

PolyMerge: 用多面体覆盖压缩3D高斯泼溅以实现可证明安全的资源受限导航

Jihoon Hong, Chih-Yuan Chiu, Sara Fridovich-Keil, Glen Chou

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出PolyMerge,将大规模3D高斯泼溅模型转换为凸多面体覆盖,保证覆盖原模型所有障碍物,结合控制障碍函数实现实时安全路径规划,在Crazyflie无人机上验证。

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 7, pp. 8512-8519, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15902 2026-06-16 cs.HC 新提交 50%

The Missing Layer: Why EdTech Needs Design-Time Generative UI, Not Just Runtime Personalization

缺失的层次:为什么教育科技需要设计时的生成式用户界面,而非仅运行时个性化

Seyed Parsa Neshaei, Abhinand Shibu, Fatma Betül Güres

专题命中 GUI与网页智能体 :workflow(abstract)

AI总结 针对教育科技中运行时生成式UI导致可访问性不足的问题,提出在创作层采用基于卡片的语义单元编码,由生成式AI在教学设计时生成多种界面表示,经教师验证后交付,实现公平可扩展的适应性教育。

Comments Accepted at the NextGen Learning Interfaces Workshop in AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15869 2026-06-16 cs.CV 新提交 50%

Metis: A Generalizable and Efficient World-Action Model for Autonomous Driving and Urban Navigation

Metis: 一种用于自动驾驶和城市导航的通用高效世界-动作模型

Jingyu Li, Zhe Liu, Dongnan Hu, Junjie Wu, Zipei Ma, Wenxiao Wu, Chao Han, Zhihui Hao, Zhikang Liu, Kun Zhan, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The University of Hong Kong(香港大学) Tongji University(同济大学) Li Auto Inc.(理想汽车) Huazhong University of Science and Technology(华中科技大学) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出Metis框架,通过解耦视频生成与动作预测,采用混合专家架构和不对称注意力掩码,实现高效推理与泛化,在多个导航基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15860 2026-06-16 math.GM 新提交 50%

New lower bounds for the degree/diameter problem via interaction with a browser-accessible LLM

通过浏览器可访问的LLM交互得到度/直径问题的新下界

Ryosuke Mizuno

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 通过与ChatGPT交互发现图构造,改进了度/直径问题的下界:N(12,5)≥34,992和N(16,5)≥147,456。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15154 2026-06-16 cs.RO 新提交 50%

Task-Aware Environment Augmentation for Reliable Navigation via Shielded Conditional Diffusion

任务感知的环境增强:通过屏蔽条件扩散实现可靠导航

Bharawee Phoompho, Gokul Puthumanaillam, Yan Miao, Ruben Hernandez, Tim Bretl, Sayan Mitra, Melkior Ornik

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对部分可观测环境下的轨迹规划可靠性问题,提出任务感知的环境增强方法SCoDA,利用条件扩散模型学习最优视觉标记布局,通过屏蔽采样引导标记放置,提升轨迹执行可靠性和完成时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10449 2026-06-16 cs.RO 新提交 50%

GuideWalk: Learning Unified Autonomous Navigation and Locomotion for Humanoid Robots across Versatile Terrains

GuideWalk: 面向人形机器人的统一自主导航与运动学习,适用于多种地形

Haoxuan Han, Chen Chen, Linao Gong, Xin Yang, Hao Hu, Junhong Guo, Zhicheng He, Yao Su, Fenghua He

机构 * Harbin Institute of Technology(哈尔滨工业大学) Leju Robotics(乐聚机器人)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出GuideWalk框架,通过可通行性感知导航引导与地形自适应运动教师蒸馏,实现人形机器人在复杂地形上的稳定导航与运动协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02773 2026-06-16 cs.RO 版本更新 50%

Bimanual High-Density EMG Control for In-Home Mobile Manipulation by Users with Quadriplegia

用于四肢瘫痪用户居家移动操作的双侧高密度肌电控制

Jehan Yang, Eleanor Hodgson, Cindy Sun, Zackory Erickson, Doug Weber

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对颈椎脊髓损伤用户,提出双侧高密度肌电(HDEMG)前臂袖套,结合共享自主框架实现实时手势控制移动操作器,经12天居家研究验证日常任务有效性。

Comments 17 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏