arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2971 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 2971 篇

2604.27253 2026-05-01 cs.AI 57%

AutoSurfer -- Teaching Web Agents through Comprehensive Surfing, Learning, and Modeling

AutoSurfer -- 通过全面浏览、学习和建模教学网络代理

Fazle Elahi Faisal, Qianhui Wu, Baolin Peng, Jianfeng Gao

机构 * Microsoft Research(微软研究院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 AutoSurfer通过系统性广度优先探索策略、任务合成引导和轨迹优化,实现全面覆盖网站操作空间,提升网络代理轨迹生成的准确性和多样性。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25161 2026-04-29 cs.MA cs.AI 57%

Where Did It Go Wrong? Capability-Oriented Failure Attribution for Vision-and-Language Navigation Agents

哪里出错了?面向视觉-语言导航代理的能力导向故障归因

Jianming Chen, Yawen Wang, Junjie Wang, Xiaofei Xie, Shoubin Li, Qing Wang, Fanjiang Xu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Science & Technology on Integrated Information System Laboratory(信息集成信息系统实验室) State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Singapore Management University(新加坡管理大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 本文提出一种能力导向的测试方法,通过自适应测试用例生成、能力 oracle 和反馈机制,准确归因视觉-语言导航代理的故障原因,提升系统可解释性和改进效果。

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00756 2026-04-29 cs.AI 57%

MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents

MPR-GUI:多语言感知与推理GUI代理的基准测试与增强

Ruihan Chen, Qiming Li, Xiaocheng Feng, Weihong Zhong, Xiaoliang Yang, Yuxuan Gu, Zekun Zhou, Yunfei Lu, Haoyu Ren, Kun Chen, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出MPR-GUI-Bench,通过六种语言和八个细粒度任务评估多语言GUI代理的感知与推理能力,并提出GUI-XLI方法以缩小跨语言差距。

Comments 35pages, 15figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10139 2026-04-28 cs.CR cs.AI 57%

Anonymization-Enhanced Privacy Protection for Mobile GUI Agents: Available but Invisible

增强隐私保护的移动GUI代理:可用但不可见

Lepeng Zhao, Zhenhua Zou, Shuo Li, Zhuotao Liu

机构 * Tsinghua University(清华大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出一种基于匿名化的隐私保护框架,通过检测敏感UI内容并替换为非识别性占位符,实现敏感信息在任务执行中可用但不可见,减少隐私泄露同时保持代理的无缝使用。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21816 2026-04-22 cs.SE 57%

From Task to Tutorial: An Automated GUI Framework for Excel Tutorial Document and Video Creation

从任务到教程:一种自动化生成Excel教程文档和视频的GUI框架

Yuhang Xie, Jian Mu, Xiaojun Ma, Chaoyun Zhang, Lu Wang, Mengyu Zhou, Mugeng Liu, Si Qin, Qingwei Lin, Saravan Rajmohan, Shi Han, Dongmei Zhang

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出首个自动化生成Excel教程的框架,通过自然语言任务描述生成结构化文档和视频,提升教程质量和效率,减少人工劳动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17849 2026-04-21 cs.AI 57%

On the Reliability of Computer Use Agents

关于计算机使用代理的可靠性

Gonzalo Gonzalez-Pumariega, Saaket Agashe, Jiachen Yang, Ang Li, Xin Eric Wang

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究计算机使用代理可靠性问题,分析执行中的随机性、任务描述模糊性和代理行为差异三大因素,发现任务指定和代理行为变化影响可靠性,需通过重复执行评估并提升稳定性。

Comments 33 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01330 2026-04-21 cs.AI 57%

NaturalGAIA: A Verifiable Benchmark and Hierarchical Framework for Long-Horizon GUI Tasks

NaturalGAIA:一个可验证的基准和分层框架用于长周期GUI任务

Zihan Zheng, Tianle Cui, Taoran Wang, Fengtao Wang, Jiahui Pan, Lewei He, Qianglong Chen

机构 * South China Normal University(华南师范大学) Zhejiang University(浙江大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 本文提出NaturalGAIA,通过真实人类GUI交互意图构建可验证评估数据集,结合LightManus-Jarvis框架,实现复杂自然任务的宏规划与微执行,实验显示其在路径成功率、token消耗和执行时间上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16967 2026-04-21 cs.RO cs.AI 57%

NaviFormer: A Deep Reinforcement Learning Transformer-like Model to Holistically Solve the Navigation Problem

NaviFormer:一种深度强化学习变换器模型,以整体解决导航问题

Daniel Fuertes, Andrea Cavallaro, Carlos R. del-Blanco, Fernando Jaureguizar, Narciso García

机构 * Grupo de Tratamiento de Imágenes, Information Processing and Telecommunications Center, ETSI Telecomunicación, Universidad Politécnica de Madrid(图像处理与电信中心,信息处理与电信中心,电信工程学院,马德里理工大学) Idiap Research Institute(Idiap研究机构)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 NaviFormer通过预测高层路线和底层轨迹,整体解决导航问题,实验表明其在准确性和计算速度上表现优异,适用于实时任务。

Comments Published in IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13315 2026-04-17 cs.CV cs.LG 57%

The Spectrascapes Dataset: Street-view imagery beyond the visible captured using a mobile platform

Spectrascapes数据集:使用移动平台捕捉超出可见光范围的街道视图影像

Akshit Gupta, Joris Timmermans, Filip Biljecki, Remko Uijlenhoet

机构 * TU Delft(代尔夫特理工大学) National University of Singapore(新加坡国立大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.LG

AI总结 本文提出首个公开的多光谱地面视图数据集,通过自行车搭载RGB、近红外和热成像传感器,在荷兰不同城市形态中采集17718张高分辨率多光谱图像,克服传统方法的局限,应用于城市规划和遥感领域。

Comments Submitted, under-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13822 2026-04-16 cs.LG 57%

UI-Copilot: Advancing Long-Horizon GUI Automation via Tool-Integrated Policy Optimization

UI-Copilot: 通过工具集成策略优化推进长周期GUI自动化

Zhengxi Lu, Fei Tang, Guangyi Liu, Kaitao Song, Xu Tan, Jin Ma, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Apple(苹果公司) Tencent(腾讯)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出UI-Copilot框架,通过分离持久观察与临时执行上下文实现内存解耦,结合工具集成策略优化提升长周期GUI任务性能,实验显示其在MemGUI-Bench和AndroidWorld上均优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09581 2026-04-16 cs.AI cs.CY cs.HC 57%

Avenir-UX: Automated UX Evaluation via Simulated Human Web Interaction with GUI Grounding

Avenir-UX:通过模拟人类网络交互进行自动用户体验评估

Wee Joe Tan, Zi Rui Lucas Lim, Shashank Durgad, Karim Obegi, Aiden Yiliu Li

机构 * University College London(伦敦大学学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 Avenir-UX通过模拟人类交互行为,提供标准化的可用性评估,结合GUI接地技术,提升用户体验评估的效率和准确性,支持持续、可扩展的数据驱动测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06477 2026-04-16 cs.AI 57%

MAS-Bench: A Unified Benchmark for Shortcut-Augmented Hybrid Mobile GUI Agents

MAS-Bench:一种统一的快捷键增强混合移动GUI代理基准测试

Pengxiang Zhao, Guangyi Liu, YaoZhen Liang, Weiqing He, Zhengxi Lu, WenHao Wang, Yuehao Huang, Yuxiang Chai, Zhaolu Kang, Yaxuan Guo, Hao Wang, Kexin Zhang, Liang Liu, Yong Liu

机构 * Zhejiang University(浙江大学) vivo AI Lab(vivo AI实验室) Peking University(北京大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出MAS-Bench,用于评估结合GUI和快捷键的混合移动自动化代理,包含139个任务和9个评估指标,实验显示混合代理在效率上优于纯GUI代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22364 2026-04-15 cs.RO cs.AI 57%

BINDER: Instantly Adaptive Mobile Manipulation with Open-Vocabulary Commands

BINDER: 基于开放词汇命令的即时自适应移动操作

Seongwon Cho, Daechul Ahn, Donghyun Shin, Hyeonbeom Choi, San Kim, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) ECE, ASRI and IPAI in SNU(SNU的电子工程系、先进机器人研究所和智能感知与人工智能实验室)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 BINDER通过分离战略规划与连续环境监控,结合多模态大语言模型和视频大语言模型,实现动态环境下的高效移动操作,提升鲁棒性和适应性。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12208 2026-04-15 cs.RO cs.AI 57%

Unveiling the Surprising Efficacy of Navigation Understanding in End-to-End Autonomous Driving

揭示端到端自动驾驶中导航理解的惊人效能

Zhihua Hua, Junli Wang, Pengfei LI, Qihao Jin, Bo Zhang, Kehua Sheng, Yilun Chen, Zhongxue Gan, Wenchao Ding

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Didi Chuxing(滴滴出行) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 本文提出SNG框架,通过真实导航模式高效表示全局导航信息,结合导航路径与分步信息,提升自动驾驶的全局与局部规划能力,实现无需辅助损失函数的高精度导航建模。

Comments 8 pages, 6 figures. ICRA 2026. Code available at https://fudan-magic-lab.github.io/SNG-VLA-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05295 2026-04-15 cs.AI cs.CV 57%

WebChain: A Large-Scale Human-Annotated Dataset of Real-World Web Interaction Traces

WebChain:一个大规模的人工标注的真实世界网页交互轨迹数据集

Sicheng Fan, Rui Wan, Yifei Leng, Gaoning Liang, Li Ling, Yanyi Shang, Dehan Kong

机构 * Fudan University(复旦大学) IMean AI WebAgentLab

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 本文提出WebChain数据集,包含31,725条轨迹和318k步,通过视觉、结构和动作数据的三元对齐提供多模态监督,提出双中层训练方法,实现了WebChainBench等公开GUI基准的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07153 2026-04-14 cs.AI 57%

ANCHOR: Branch-Point Data Generation for GUI Agents

ANCHOR:用于GUI代理的分支点数据生成

Jinbiao Wei, Yilun Zhao, Kangqi Ni, Arman Cohan

机构 * Yale University(耶鲁大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 ANCHOR通过分支点生成高质量交互数据,提升桌面环境GUI代理的训练效果和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09815 2026-04-14 cs.AI 57%

EE-MCP: Self-Evolving MCP-GUI Agents via Automated Environment Generation and Experience Learning

EE-MCP:通过自动环境生成和经验学习的自进化MCP-GUI代理

Tiantian He, Yihang Chen, Keyue Jiang, Ka Yiu Lee, Kaiwen Zhou, Kun Shao, Shuai Wang

机构 * University College London(伦敦大学学院) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出EE-MCP框架,通过自动环境生成和经验学习实现MCP-GUI代理的自进化,通过跨应用分析证明其在MCP主导任务和GUI密集任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08883 2026-04-13 cs.RO cs.AI 57%

HTNav: A Hybrid Navigation Framework with Tiered Structure for Urban Aerial Vision-and-Language Navigation

HTNav:一种具有分层结构的混合导航框架用于城市空域视觉-语言导航

Chengjie Fan, Cong Pan, Zijian Liu, Ningzhong Liu, Jie Qin

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education(教育部脑机智能技术重点实验室)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 本文提出HTNav框架,结合模仿学习与强化学习,通过分层决策机制提升复杂城市环境中的导航精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19396 2026-04-13 cs.AI 57%

EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration

EchoTrail-GUI: 通过批评者引导的自我探索构建可操作的记忆以改进GUI代理

Runze Li, Yuwen Zhai, Bo Xu, LiWu Xu, Nian Shi, Wei Zhang, Ran Lin, Liang Wang

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团) East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出EchoTrail-GUI框架,通过动态记忆系统提升GUI代理任务成功率和效率,验证了结构化记忆在GUI自动化中的有效性。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07973 2026-04-10 cs.AI 57%

How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace

大型多模态模型距离人类水平的空间行动还有多远?一个面向城市空域目标导向的具身导航基准测试

Baining Zhao, Ziyou Wang, Jianjie Fang, Zile Zhou, Yanggang Xu, Yatai Ji, Jiacheng Xu, Qian Zhang, Weichen Zhang, Chen Gao, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Northeastern University(东北大学) National University of Defense Technology(国防科技大学) Shandong University(山东大学) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文通过构建包含5037个高质量目标导向导航样本的数据集,评估17种代表性模型在城市3D空间中具身空间行动的能力,发现尽管LMMs展现出新兴行动能力,但仍远未达到人类水平,并揭示导航误差在关键决策分歧后迅速发散的现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07957 2026-04-10 cs.AI cs.CV cs.RO 57%

WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models

WorldMAP: 通过生成世界模型提升视觉-语言导航轨迹预测

Hongjin Chen, Shangyun Jiang, Tonghua Su, Chen Gao, Xinlei Chen, Yong Li, Zhibo Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shandong University(山东大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 WorldMAP通过生成世界模型与教师-学生框架,将生成的未来场景转化为语义空间结构和规划监督,提升导航轨迹预测的稳定性与准确性,取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06240 2026-04-09 cs.CR cs.AI cs.MA 57%

The Art of Building Verifiers for Computer Use Agents

构建计算机使用代理验证器的艺术

Corby Rosset, Pratyusha Sharma, Andrew Zhao, Miguel Gonzalez-Fernandez, Ahmed Awadallah

机构 * Microsoft Research(微软研究院) Browserbase

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出通用验证器,通过四个原则减少噪声、分离奖励信号、区分可控不可控失败、并采用分治上下文管理,提升验证可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06182 2026-04-09 cs.HC cs.AI 57%

VenusBench-Mobile: A Challenging and User-Centric Benchmark for Mobile GUI Agents with Capability Diagnostics

VenusBench-Mobile: 一个具有能力诊断的挑战性且以用户为中心的移动GUI代理基准测试

Yichen Gong, Zhuohan Cai, Sunhao Dai, Yuqi Zhou, Zhangxuan Gu, Changhua Meng, Shuheng Shen

机构 * Venus Team, Ant Group(蚂蚁集团金星团队)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出VenusBench-Mobile,通过用户意图驱动的任务设计和能力导向的标注方案,评估移动GUI代理在真实用户场景下的性能,揭示现有代理在感知和记忆方面的缺陷,为实际部署提供重要参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05529 2026-04-09 cs.AI cs.RO 57%

Before We Trust Them: Decision-Making Failures in Navigation of Foundation Models

在我们信任之前:基础模型导航决策中的失败

Jua Han, Jaeyoon Seo, Jungbin Min, Sieun Choi, Huichan Seo, Jihie Kim, Jean Oh

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 研究发现基础模型在导航任务中存在显著决策失败,需更细致评估以理解其局限性。

Comments Corrected author order in metadata; manuscript changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02623 2026-04-08 cs.CR cs.AI 57%

Poison Once, Exploit Forever: Environment-Injected Memory Poisoning Attacks on Web Agents

一次投毒,永久利用:针对网络代理的环境注入内存投毒攻击

Wei Zou, Mingwen Dong, Miguel Romero Calvo, Shuaichen Chang, Jiang Guo, Dongkyu Lee, Xing Niu, Xiaofei Ma, Yanjun Qi, Jiarong Jiang

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Amazon Web Services(亚马逊云服务)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究提出eTAMP攻击,通过环境观察污染代理内存,实现跨会话和跨网站的持久化攻击,实验显示攻击成功率高达32.5%,且环境压力下代理易受攻击,高能力模型同样存在漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02391 2026-04-06 cs.SD cs.AI eess.AS 57%

Reliability-Aware Geometric Fusion for Robust Audio-Visual Navigation

可靠性感知的几何融合用于鲁棒的音频视觉导航

Teng Liu, Yinfeng Yu

机构 * Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学联合具身智能研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语种认知计算联合国际研究实验室) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出RAVN框架,通过音频衍生的可靠性线索条件跨模态融合,动态校准音频和视觉输入的整合,引入Acoustic Geometry Reasoner和Reliability-Aware Geometric Modulation,提升复杂环境下的导航性能。

Comments Main paper (6 pages). Accepted for publication by the International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01535 2026-04-03 cs.CL 57%

Read More, Think More: Revisiting Observation Reduction for Web Agents

多读多想:重新审视网络代理中的观察缩减

Masafumi Enomoto, Ryoma Obara, Haochen Zhang, Masafumi Oyamada

机构 * NEC Corporation(日本电气股份有限公司)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.CL

AI总结 本文研究网络代理中观察缩减的优化问题,发现模型能力和思考token预算影响观察表示选择,高能力模型适合详细HTML观察,低能力模型适合紧凑的访问树观察,同时引入diff-based表示提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11992 2026-04-03 cs.AI 57%

Understanding visual attention beehind bee-inspired UAV navigation

理解基于蜜蜂启发的无人机导航中的视觉注意力

Pranav Rajbhandari, Abhi Veda, Matthew Garratt, Mandyam Srinivasan, Sridhar Ravi

机构 * School of Engineering and Technology, University of New South Wales, Canberra, Australia(新南威尔士大学工程与技术学院,堪培拉,澳大利亚) Queensland Brain Institute, University of Queensland, Brisbane, Australia(昆士兰大学昆士兰脑研究所,布里斯班,澳大利亚)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文通过强化学习训练无人机在仅有optic flow输入的情况下导航隧道,发现训练后的代理主要关注optic flow中的不连续区域和大流量区域,以避开障碍物并保持环境中心位置,模拟飞虫行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01049 2026-04-02 cs.NI cs.AI 57%

Adversarial Attacks in AI-Driven RAN Slicing: SLA Violations and Recovery

AI驱动的RAN切片中的对抗攻击:SLA违规与恢复

Deemah H. Tashman, Soumaya Cherkaoui

机构 * Polytechnique Montreal(蒙特利尔理工学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究AI驱动RAN切片中对抗攻击的影响,分析预算受限攻击对深度强化学习资源分配的影响,揭示SLA违规及恢复行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29161 2026-04-01 cs.AI 57%

Webscraper: Leverage Multimodal Large Language Models for Index-Content Web Scraping

Webscraper:利用多模态大语言模型进行索引-内容网页抓取

Guan-Lun Huang, Yuh-Jzer Joung

机构 * Dept. of Information Management, National Taiwan University, Taipei, Taiwan(国立台湾大学资讯管理学系,台北,台湾)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出Webscraper框架,利用多模态大语言模型自动导航交互界面并提取结构化数据,通过五阶段提示和定制工具提升动态网站抓取准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏