arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-09-01 至 2026-09-01 共收录 14 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 14 篇

2608.30206 2026-09-01 eess.SP 新提交 87%

Agentic Quantum Deep Reinforcement Learning for RAN Slicing

面向RAN切片的智能量子深度强化学习

Tingnan Bao, Medhat Elsayed, Pedro Enrique Iturria-Rivera, Yigit Ozcan, Majid Bavand, Melike Erol-Kantarci

专题命中 GUI与网页智能体 :agentic(title,summary_cn)

AI总结 针对RAN切片的可靠性-吞吐量权衡问题,提出Agentic-QDRL两时间尺度框架,结合PMAR控制器与VQC调度器,经仿真验证可提升eMBB性能并维持URLLC可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29678 2026-09-01 cs.AI 版本更新 79%

View-oriented Conversation Compiler for Agent Trace Analysis

面向视角的对话编译器用于代理轨迹分析

Lvmin Zhang, Maneesh Agrawala

机构 * Stanford University(斯坦福大学)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI

AI总结 本文提出VCC编译器,将原始代理JSONL日志转换为结构化视角,提升轨迹分析质量,减少token消耗并提升模型性能。

Comments Code: this https URL (https://github.com/lllyasviel/VCC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04035 2026-09-01 cs.AI 版本更新 79%

MobileDreamer: Generative Sketch World Model for GUI Agent

MobileDreamer: 用于GUI代理的生成式草图世界模型

Yilin Cao, Yufeng Zhong, Zhixiong Zeng, Siran Dai, Liming Zheng, Jing Huang, Haibo Qiu, Peng Shi, Wenji Mao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Meituan(美团)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI

AI总结 MobileDreamer通过生成式草图世界模型和rollout想象策略,提升GUI代理在长周期任务中的决策能力,任务成功率提升5.25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23263 2026-09-01 cs.AI 版本更新 79%

GUI-PRA: Process Reward Agent for GUI Tasks

GUI-PRA:面向GUI任务的过程奖励智能体

Tao Xiong, Xavier Hu, Yurun Chen, Yuhang Liu, Changqiao Wu, Pengzhi Gao, Wei Liu, Jian Luan, Shengyu Zhang

机构 * Zhejiang University(浙江大学) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI

AI总结 针对长程GUI自动化的错误累积与视觉歧义问题,本文提出GUI-PRA,通过主动调查式评估实现性能提升,在AndroidWorld等数据集上较标准PRM取得显著进步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13318 2026-09-01 cs.AI cs.CL 版本更新 79%

WebXSkill: Skill Learning for Autonomous Web Agents

WebXSkill:自主网页代理的技能学习

Zhaoyang Wang, Qianhui Wu, Xuchao Zhang, Chaoyun Zhang, Wenlin Yao, Fazle Elahi Faisal, Baolin Peng, Si Qin, Suman Nath, Qingwei Lin, Chetan Bansal, Dongmei Zhang, Saravan Rajmohan, Jianfeng Gao, Huaxiu Yao

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft(微软)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 WebXSkill通过可执行技能框架解决自主网页代理在长周期任务中的执行与适应问题,提升任务成功率。

Comments Accepted to Findings of EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29483 2026-09-01 cs.CV cs.CL 新提交 70%

GeoAgent: Evaluating VLM Geolocalization Through Embodied Navigation

GeoAgent:通过具身导航评估视觉语言模型的地理定位能力

Arka Mukherjee, Soham Roy, Kartikeya Trivedi, Shreya Ghosh

机构 * KIIT Bhubaneswar(布巴内斯瓦尔KIIT大学) IIT Bhubaneswar(布巴内斯瓦尔印度理工学院)

专题命中 GUI与网页智能体 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 本研究提出基于街景导航的GeoAgent基准,发现VLMs在地理定位中难区分区域模式,智能体导航可提升准确率,但模型存在地区偏差且自我改进能力差,明确了具身地理定位的挑战

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29305 2026-09-01 cs.CL cs.AI cs.LG 新提交 67%

Learning Simple Test-Time Environments for LLM Web Agents

为大型语言模型网页智能体学习简单的测试时环境

Junxuan Li, Zijun Liu, Ziyi Huang, Peng Li, Yuzhou Liu, Ming Yan, Yang Liu

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Dept. of Comp. Sci. & Tech., Tsinghua University(清华大学计算机科学与技术系) School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子信息工程学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究针对LLM网页智能体在复杂真实环境中性能下降问题,提出测试时环境分解(TTED)方法,通过将复杂环境分解为子模块并利用子环境经验提升组合泛化能力,验证了其在合成与真实基准上的有效性。

Comments Code and data are released at this https URL (https://github.com/THUNLP-MT/TTED)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04412 2026-09-01 cs.AI cs.CL cs.HC 版本更新 62%

Beyond Pixels: Exploring DOM Downsampling for LLM-Based Web Agents

超越像素:探索面向基于大语言模型的智能体的DOM下采样

Thassilo M. Schiepanski, Nicholas Piël

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出D2Snap算法对DOM下采样,解决原始DOM令牌占用过大的问题,经评估其在GPT-4o智能体上的成功率达73%,接近基于GUI快照的基线性能。

Comments 21 pages, LaTeX, print version; updated figures (2, 4)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30207 2026-09-01 cs.CR cs.AI 新提交 57%

SIR: Self-improving Red-teaming for Compute Use Agents

SIR:面向计算使用智能体的自改进红队测试

Chen Xiong, Zhiyuan He, Pin-Yu Chen, Stjepan Picek, Tsung-Yi Ho

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出SIR,一种针对操作系统层面计算使用智能体的黑盒间接提示注入攻击,通过迭代反馈循环提炼策略,使攻击成功率显著提升且可跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15017 2026-09-01 cs.CL 版本更新 57%

Are Online Skill and Memory Modules Always Worth Their Tokens? A Budget-Constrained Study of Web Agents

在线技能与记忆模块是否总是值得其令牌消耗?Web代理的预算约束研究

Sina Hajimiri, Masih Aminbeidokhti, Jose Dolz, Ismail Ben Ayed, Issam H. Laradji, Spandana Gella, Nicolas Gontier

机构 * ServiceNow AI Research(ServiceNow AI 研究院) ÉTS Montreal(蒙特利尔高等技术学院) University of British Columbia(不列颠哥伦比亚大学) McGill University(麦吉尔大学)

专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.CL

AI总结 在固定推理预算下,对比三种在线增强模块与令牌匹配的基线,发现基线在总成功率上匹配或超越所有增强方法,且常使用更少令牌。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31021 2026-09-01 eess.SY 新提交 50%

Semi-Autonomous Prosthesis Control Empowered by 5G and Mobile Edge Computing

由5G与移动边缘计算赋能的半自主假肢控制

Ozan Karaali, Hossam Farag, Strahinja Dosen, Cedomir Stefanovic

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 该研究开发了基于5G和MEC的半自主假手原型,通过边缘服务器处理视觉任务,其性能优于手动控制和设备端处理,为假肢控制提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30242 2026-09-01 cs.RO 新提交 50%

CanonNav: Disentangling Navigation Behavior from Camera Geometry in Cross-Platform Visual Navigation

CanonNav:跨平台视觉导航中解耦导航行为与相机几何

Dong-Wook Kim, Ji-Hoon Hwang, E-In Son, Mintaek Oh, Seung-Woo Seo

机构 * Seoul National University(首尔大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 CanonNav框架解耦导航行为与相机几何,引入相机几何规范化并结合规划监督,仅用RGB推理便在多场景视觉导航中优于相关基线与RGB-D方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30038 2026-09-01 cs.CR 新提交 50%

ActReal: System-Level Mobile Agents Challenge Mobile Automation Detection

ActReal:系统级移动智能体对移动自动化检测提出挑战

Mingshuo Wang, Hanqing Guo, Huining Li, Yuliang Fu, Jing Xu, Chenhan Xu

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 该研究提出ActReal框架,可生成时间对齐的触摸与六轴IMU信号,规避现有移动自动化检测,事件级平均攻击成功率达77.5%,联合检测时仍达71.1%,对移动自动化检测构成挑战。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29772 2026-09-01 cs.RO 新提交 50%

Self-Aware Active Learning Enables Continual Improvement in Autonomous Driving

自我感知主动学习实现自动驾驶的持续改进

Dong Hu, Chao Huang, Carman K.M. Lee, Dimitrios Kanoulas

机构 * The Hong Kong Polytechnic University(香港理工大学) Adelaide University(阿德莱德大学) University College London(伦敦大学学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 该研究提出自我感知主动学习框架SAGE,通过生成恐惧与好奇心信号调节风险,在多场景中提升自动驾驶系统鲁棒性、减少安全违规并维持任务性能,实现训练后持续改进。

详情

展开后加载摘要…

URL PDF HTML 收藏