arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2982 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 2982 篇

2608.09196 2026-08-11 cs.RO 新提交 50%

SAIN: Structure-Aware Interactive Navigation with Active Dialogue Grounding for Mobile Robot

SAIN:面向移动机器人的、结合主动对话 grounding 的结构感知交互式导航

Yuhao Cao, Xiao Liu, Yang Xie, Lu Liu, Haoyao Chen

机构 * School of Mechanical Engineering and Automation, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)机械工程与自动化学院) Department of Mechanical Engineering, City University of Hong Kong(香港城市大学机械工程系)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出SAIN零样本框架,将主动对话转化为持久导航状态,在VL-LN IIGN基准上提升了导航成功率与加权成功率,无需特定任务策略训练,验证了对话转状态机制的有效性。

Comments 8 pages, 4 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08981 2026-08-11 cs.DC 新提交 50%

Universal Rendezvous of Anonymous Agents with Footprints

带足迹的匿名智能体的通用会合算法

Bibhuti Das

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文针对带足迹模型中所有连通(有限或可数无限)底层图的会合实例,提出通用会合算法,解决了Das和Pelc提出的开放问题,给出该模型所有实例存在通用算法的肯定答案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08596 2026-08-11 cs.CV 新提交 50%

Goal-oriented Navigation Instruction Generation with Tour Video Priors

基于旅游视频先验的面向目标的导航指令生成

Fangdi Li, Juncheng Liao, Changxu Cheng, Jiazhi Wang, Senda Chen, Tao Wang, Wuyue Zhao

机构 * Uni-Ubi AI(优必爱人工智能) Zhejiang University(浙江大学) Tongji University(同济大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本研究提出面向目标的视频 grounding 导航指令生成任务VideoNIG,设计两阶段课程学习框架解决该任务,实验表明其可提升指令质量,集成VLN智能体后可实现端到端导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07797 2026-08-11 cs.RO cs.CV 新提交 50%

Drone-Assisted UAV-UGV Collaboration for Autonomous Navigation in Snow-Covered Terrain

无人机辅助的无人机-无人车协同积雪覆盖地形自主导航

Shreyam Gupta, P. Agrawal, Priyam Gupta, R. Gautam

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对积雪覆盖地形传统导航方法失效的问题,提出无人机-无人车协同导航框架,采用定制U-Net、EKF、YOLOv5等技术实现高分割精度与低定位误差,可在遮挡环境中完成自主导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06833 2026-08-11 cs.RO 版本更新 50%

Unordered Landmark Visual Navigation

无序地标视觉导航

Hao Ren, Junzhe Zhu, Yihan Li, Zetong Bi, Le Zheng, Zhi Li, Yiqing Yuan, Zhaoliang Wan, Dizhe Zhang, Lu Qi, Hui Cheng

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对无序图像导航的挑战,本文提出无需时间与里程计先验的ULVN框架,通过整合建图、定位与规划,在仿真和真实场景中性能优于现有最优方法。

Comments ECCV2026 Oral & Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29029 2026-08-11 cond-mat.mtrl-sci 50%

Geometry-based Discovery of Calcium Battery Cathodes Accelerated by Foundational Machine-Learned Models

基于几何学的钙电池正极发现加速于基础机器学习模型

Dereje Bekele Tekliye, Achinthya Krishna Bheemaguli, Gopalakrishnan Sai Gautam

专题命中 GUI与网页智能体 :workflow(abstract)

AI总结 通过几何和化学设计原则,结合机器学习模型,从材料项目数据库中筛选出37种有前景的钙电池正极候选材料,其中两种具有极低的Ca²⁺迁移势垒,四种具有热力学稳定的充电态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06482 2026-08-10 cs.DC 新提交 50%

Rendezvous of Mobile Deterministic Automata in Graphs

图中移动确定自动机的会合问题

Bibhuti Das, Andrzej Pelc

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文研究图中移动确定自动机的会合问题,证明固定小卵石无法实现树的RV-通用DFA,而配备单个可移动小卵石的DFA可成为树的RV-通用DFA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07123 2026-08-10 cs.HC cs.PF physics.data-an 新提交 50%

Thermodynamic Human-Computer Interaction

热力学人机交互

Uzafir Ahmad Rafaq, Muaz Hassan, Ali Muzaffar

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 该研究提出一种基于热力学的人机交互统一框架,可跨交互模态扩展、无需训练数据且评估时间为O(1),在网页预取任务中取得1.37的预取点击比和98.1%的目标预测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19930 2026-08-10 cs.HC 版本更新 50%

MobileForge: Annotation-Free Adaptation for Mobile GUI Agents with Hierarchical Feedback-Guided Policy Optimization

MobileForge:基于分层反馈引导策略优化的移动GUI智能体免标注适配

Guangyi Liu, Pengxiang Zhao, Gao Wu, Yiwen Yin, Mading Li, Liang Liu, Congxiao Liu, Zhang Qi, Mengyan Wang, Liang Guo, Jiangning Zhang, Yong Liu

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出MobileForge系统,通过MobileGym环境实现任务生成与评估,结合分层反馈引导策略优化(HiFPO)将轨迹结果、步骤反馈和修正提示转化为步骤级GRPO更新,实现移动GUI智能体免标注适配,在AndroidWorld上达到67.2% Pass@3。

Comments Project page: https://mobile-forge.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19499 2026-08-10 cs.RO 版本更新 50%

Progress-Certified Reversible Simplex Supervision of Goal-Reaching Reinforcement Learning

强化学习目标到达控制与保证Lyapunov-like稳定器的移动机器人

Mehdi Heydari Shahna, Jouni Mattila

机构 * Faculty of Engineering(工程学院) Natural Sciences(自然科学) Tampere University(塔尔库大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出一种基于强化学习的控制框架,通过Lyapunov-like稳定器保证移动机器人在无结构环境中的目标到达,提升目标到达率至99%

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07554 2026-08-10 cs.RO 50%

Efficient Swept Volume-Based Trajectory Generation for Arbitrary-Shaped Ground Robot Navigation

高效扫掠体积基轨迹生成用于任意形状地面机器人导航

Yisheng Li, Longji Yin, Yixi Cai, Jianheng Liu, Fangcheng Zhu, Mingpu Ma, Siqi Liang, Haotian Li, Fu Zhang

机构 * Department of Mechanical Engineering, University of Hong Kong(香港大学机械工程系) Division of Robotics, Perception, and Learning, KTH Royal Institute of Technology(皇家理工学院机器人、感知与学习 division)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出了一种高效扫掠体积基轨迹生成方法,通过粗到细的框架提升任意形状地面机器人在复杂环境中的导航效率和碰撞避免能力。

Journal ref IEEE/RSJ International Conference on Intelligent Robots and Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06065 2026-08-07 cs.CV 新提交 50%

The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents

下一张截图知晓:面向移动GUI智能体的门控事后蒸馏(Gated Hindsight Distillation)

Weiwei Li, Junzhuo Liu, Tong Chu, Hengfu Yu, Wen Li

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文针对移动GUI智能体训练中丢失动作依据的问题,提出门控事后蒸馏方法,利用下一张截图作为特权信息,在AndroidWorld等基准上相比GRPO提升了任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05506 2026-08-07 cs.CV 版本更新 50%

Robust Scene Transfer for PointGoal Navigation via Privileged Sensor Guided Contrastive Learning

基于特权传感器引导对比学习的点目标导航鲁棒场景迁移

Amirhossein Zhalehmehrabi, Tiziano Tezze, Alberto Castelini, Alessandro Farinelli

机构 * University of Padua(帕多瓦大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出一种传感器引导的自适应对比学习框架,利用特权LiDAR传感器在训练时引导视觉编码器学习导航相关结构,并通过解耦表征学习与策略优化以及跨阶段域不匹配来提升策略级场景迁移能力。

Comments 8 pages, Accepted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08199 2026-08-07 cs.NI 版本更新 50%

Beyond Static Forecasting: Unleashing the Power of World Models for Mobile Traffic Extrapolation

超越静态预测:利用世界模型进行移动交通外推

Xiaoqian Qi, Haoye Chai, Yue Wang, Yong Li

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出MobiWM世界模型,用于移动网络中的移动交通外推,通过融合多模态环境上下文和编码动作,提升空间理解,实验表明其在所有评估场景中均取得最佳分布保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05078 2026-08-06 cs.RO 新提交 50%

SpikingNav: Robust Embodied Navigation with Spiking Neural Policies

SpikingNav:基于脉冲神经网络策略的鲁棒具身导航

Jiahong Zhang, Sijun Shen, Dehua Wu, Yifan Lin, Xuechen Xia, Xu Chu, Youhui Zhang, GuoqiLi

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出SpikingNav脉冲导航框架,含SSE与SPN,在PointNav、ObjectNav任务中,其参数更少、计算量更低,鲁棒性优于匹配的ANN基线,且可部署于Thruster-V2芯片。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04825 2026-08-06 cs.RO 新提交 50%

Deliberate Before You Fly: Vision-Guided Spatial Deliberation for UAV See-and-Reach Navigation

飞行前深思熟虑:面向无人机“看见并到达”导航的视觉引导空间深思熟虑

Fanfu Xue, En Yu, Bohang Liu, Hongjun Wang, Yang Yang, Xindi Wang, Jiande Sun

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 针对无人机“看见并到达”导航中语义-控制失配问题,提出视觉-语言航路点预测框架DBFly,通过空间机动决策链、隐式飞行走廊和感知终端收敛的停止策略,使成功率较SOTA基线平均提升25.07个百分点。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04755 2026-08-06 cs.CR 新提交 50%

"Allow" to Achieve, Over-Privileged Inadvertently: The Unintended Cost of Task-Completion-Driven Pop-up Decisions in Mobile GUI Agents

“允许”达成目标:移动GUI智能体中任务完成驱动的弹窗决策的意外代价

Dongsheng Chen, Yuxuan Li, Guanhua Chen, Jiaxin Zhang, Xiangyu Zhao, Lei Ma, Xin Yao, Xuetao Wei

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 研究移动GUI智能体的权限素养,发现其存在应用信任偏差、任务优先级覆盖等问题,提示干预效果不一,建议将任务执行与权限授权分离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04741 2026-08-06 cs.CR 新提交 50%

LoginTrap: Uncovering Task-Agnostic Phishing-Style Indirect Prompt Injection Attacks against LLM-based Web Agents

LoginTrap:针对基于大语言模型的Web智能体的任务无关型钓鱼式间接提示注入攻击的发现

Longtao Guo, Zelin Zhang, Kaifeng Huang, Yang Shi

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 该研究提出LoginTrap攻击,是针对基于LLM的Web智能体的任务无关型登录诱导攻击,在黑盒威胁模型下可达到86%的平均端到端攻击成功率,揭示了登录诱导的认证边界风险并推动相关防御研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04530 2026-08-06 cs.CV 新提交 50%

FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory

FocusMem:对潜在GUI记忆中的内容、读出和信任进行因子分解

Zhuoran Zhang, Bowen Li, Jingcheng Ju, Yang Shi, Qixun Wang, Haotian Wang, Wei Chen, Tengjiao Wang

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 FocusMem将潜在GUI记忆的内容、读出和信任因子分解,解决现有固定记忆方法的细节丢失、阶段适配差和误导问题,在五个GUI智能体基准测试中性能优于基线与现有方法。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03313 2026-08-05 cs.NI cs.MM eess.IV 新提交 50%

ProCAVE: A Self-Adaptive, Full-Lifecycle Edge Caching Framework for Video Streaming via Predictive Bandwidth Estimation and Preference-Aware Deep Reinforcement Learning

ProCAVE:基于预测带宽估计与偏好感知深度强化学习的自适应全生命周期视频流边缘缓存框架

Yeganeh Chatri, Behzad Akbari, Foad Ghaderi, Pejman Goudarzi

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 该研究针对现有边缘缓存方法在无线动态环境下响应与协调不足的问题,提出ProCAVE框架,结合轻量Transformer、PPO、DDPG实现预测带宽建模与偏好感知缓存控制,实验表明其在字节命中率、回传负载、QoE上优于FlyCache等基线。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03143 2026-08-05 cs.CV cs.RO 新提交 50%

From Routes to Steps: Separating Semantic Progress from Local Execution in Vision-and-Language Navigation

从路线到步骤:在视觉语言导航中分离语义进展与局部执行

Xiangyun Huang, Xiangchen Wang, Runfeng Lin, Yihao Xu, Kangyu Huang, Jiang Hengchen, Xiwang Dong, Lin Jiarong

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本研究针对视觉语言导航中进展与执行错误难区分的问题,提出Route2Step框架,通过步骤级接口分离语义进展跟踪与动作生成,在R2R-CE数据集上显著提升了导航性能,且在真实环境中具备实用性。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00721 2026-08-04 cs.RO 新提交 50%

OmniAI: A Surface-Adaptive Aerial Projection Interface for Human--Drone Interaction

OmniAI:一种面向人机交互的表面自适应空中投影界面

Nikita Kuzmin, Yuhua Jin, Georgii Demianchuk, Mariya Lezina, Fawad Mehboob, Ivan Valuev, Nikolai Lutsenko, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology(斯科尔科沃科学技术研究院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 OmniAI是一种具现化空中智能体,通过自适应投影实现人机交互,采用RGB-D与RANSAC检测投影表面,支持语音、手势控制,为情境感知人机交互提供移动空间AR界面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27577 2026-08-04 cs.CV cs.RO 版本更新 50%

Structured Observation Language for Efficient and Generalizable Vision-Language Navigation

结构化观察语言用于高效且通用的视觉-语言导航

Daojie Peng, Fulong Ma, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出SOL-Nav框架,通过将视觉观察转化为结构化语言描述,提升视觉-语言导航的效率和泛化能力,实验表明其在减少模型规模和训练数据依赖方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20429 2026-08-03 stat.AP 版本更新 50%

Design and Validation of a Grid-based Home Detection via Stay-Time (GHOST) Software for Mobile Location Data

基于停留时间的网格化家庭检测(GHOST)软件的设计与验证:用于移动定位数据

Alessandra Recalde, Mustafa Sameen, Xiaojian Zhang, Xilei Zhao

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本研究提出了一种基于网格和停留时间的家庭检测算法GHOST,通过定制的空间和时间过滤器识别最频繁访问的夜间或周末白天网格单元,以推断代理家庭位置,并在大规模数据集上验证其在噪声数据中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28474 2026-07-31 cs.RO 新提交 50%

TEA-AgriVLN: Traversability Estimation Alarm for Agricultural Vision-and-Language Navigation

TEA-AgriVLN:面向农业视觉语言导航的可通行性估计告警

Xiaobei Zhao, Xingqi Lyu, Xin Chen, Xiang Li

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 针对农业场景可通行性模糊问题,提出TEA模块并集成至AgriVLN构建TEA-AgriVLN,在A2A基准上将SR提至0.54、NE降至2.70米,实现农业VLN-CE领域最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27812 2026-07-31 cs.NI 新提交 50%

Localization and Pursuit of a Mobile Target using Distance-only Measurements

仅利用距离测量的移动目标定位与追踪

Nabarupa Das, Suvadip Batabyal

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出一种无需GPS、角度传感或多锚节点的方法,通过距离测量实现二维平面内移动目标的定位与追踪,最多13步即可完成定位,智能体可从搜索顺利过渡到追踪并保持有界误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26460 2026-07-30 cs.RO 新提交 50%

RLMM-Flow: A Flow-based Mobile Manipulation Framework with Latent-Space Reinforcement Learning

RLMM-Flow:一种基于流的隐空间强化学习移动操作框架

Shuhang Wang, Ziming Li, Hui Cheng

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 该研究提出RLMM-Flow框架,结合流策略预训练与隐空间强化学习,在移动操作基准上提升任务成功率等指标,同时保留流的快速推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26295 2026-07-30 physics.bio-ph cond-mat.stat-mech q-bio.NC 新提交 50%

A behavior-environment information loop drives sensory navigation

行为-环境信息回路驱动感官导航

Kevin S. Chen, Matthew P. Leighton, Damon A. Clark, Thierry Emonet

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 该研究提出基于传递熵的信息论框架,量化感官与行为的双向信息流,可预测生物与人工系统的导航效率,揭示了驱动导航的通用行为-环境反馈回路。

Comments 14 pages, 6 figures; supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18426 2026-07-30 cs.RO 版本更新 50%

VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision

VEGA: 从野外自我中心视频中通过几何轨迹监督学习导航VLA

Gershom Seneviratne, Yohan Abeysinghe, Jianyu An, Vaibhav Shende, Rahul Kumar, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出VEGA方法,利用未标注的自我中心视频通过重建场景几何生成障碍感知轨迹,训练流匹配VLA导航策略,在VEGA-Bench上碰撞减少33.0%,真实世界成功率提升至少150.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10348 2026-07-30 cs.RO 版本更新 50%

Semantic Evidence Regulation via Relational Bias for Zero-Shot Object Navigation

通过关系归纳偏差重新思考具身导航

Weitao An, Chenghao Xu, Xu Yang, Cheng Deng

机构 * School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) School of Information Science and Engineering, Hohai University(河海大学信息科学与工程学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出DB-Nav框架,利用激活偏置和抑制偏置双关系偏置重塑搜索空间,通过关系激活-抑制探索图调节前沿探索,显著提升目标导航成功率和路径效率。

详情

展开后加载摘要…

URL PDF HTML 收藏