arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 185 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 185 篇

2606.15154 2026-06-16 cs.RO 新提交 50%

Task-Aware Environment Augmentation for Reliable Navigation via Shielded Conditional Diffusion

任务感知的环境增强:通过屏蔽条件扩散实现可靠导航

Bharawee Phoompho, Gokul Puthumanaillam, Yan Miao, Ruben Hernandez, Tim Bretl, Sayan Mitra, Melkior Ornik

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对部分可观测环境下的轨迹规划可靠性问题,提出任务感知的环境增强方法SCoDA,利用条件扩散模型学习最优视觉标记布局,通过屏蔽采样引导标记放置,提升轨迹执行可靠性和完成时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10449 2026-06-16 cs.RO 新提交 50%

GuideWalk: Learning Unified Autonomous Navigation and Locomotion for Humanoid Robots across Versatile Terrains

GuideWalk: 面向人形机器人的统一自主导航与运动学习,适用于多种地形

Haoxuan Han, Chen Chen, Linao Gong, Xin Yang, Hao Hu, Junhong Guo, Zhicheng He, Yao Su, Fenghua He

机构 * Harbin Institute of Technology(哈尔滨工业大学) Leju Robotics(乐聚机器人)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出GuideWalk框架,通过可通行性感知导航引导与地形自适应运动教师蒸馏,实现人形机器人在复杂地形上的稳定导航与运动协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14106 2026-06-15 cs.MA cs.CV 新提交 50%

Naive Visual Memory is Not Enough: A Failure-Mode Study of GUI Agents

朴素视觉记忆不足:GUI代理的失败模式研究

Seoyoung Choi, Minseok Ko, Hyunseok Lee, Kunwoong Kim, Woomin Song, Chanseok Jeon, Jinwoo Shin

机构 * KAIST(韩国科学技术院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出动作锚定视觉记忆(AGMem),通过存储与成功动作相关的局部GUI区域图像而非全屏截图,减少GUI代理中的动作级错误,在OSWorld上将任务成功率提升33.3%。

Comments 9 pages, 5 figures, ICML 2026 WORKSHOP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13494 2026-06-12 cs.RO cs.CV 新提交 50%

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

NavWAM:用于目标条件视觉导航的导航世界动作模型

Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国立信息学研究所) AIRoA ATR

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出NavWAM,一种扩散变换器策略,通过联合学习未来观测、目标进度值和动作块,将导航世界模型预测直接转化为可执行动作,在离线基准和真实机器人部署中优于基于规划的世界模型基线。

Comments Project page: https://dachii-azm.github.io/navwam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09268 2026-06-09 cs.RO 新提交 50%

VGP-Nav: Metric-Aware Visual Geometric Perception for Robot Navigation

VGP-Nav:用于机器人导航的度量感知视觉几何感知

Hewei Pan, Weiye Zhu, Zekai Zhang, Zitong Huang, Rongtao Xu, Jinbao Wang, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Shenzhen University(深圳大学) SpatialTemporal AI(时空人工智能)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出VGP-Nav,一种仅依赖单目RGB输入的框架,通过地面平面几何约束解决尺度模糊,实现度量定位与障碍物感知的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏