arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-25 至 2026-08-25 共收录 15 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 15 篇

2608.23035 2026-08-25 cs.AI 新提交 81%

MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks

MobilePA-Bench:面向复杂真实世界任务的移动规划智能体基准测试

Yi Zhu, Xiongwei Wu, Qiyi Wang, Tingyu Qu, Jiajun Liu, Sihan Cao, Long Chen, Weigao Sun, Feida Zhu, Yiran Zhong, Steven Hoi

机构 * Alibaba(阿里巴巴)

专题命中 GUI与网页智能体 :agent(abstract);tool use(abstract);planning(abstract);agentic(abstract)

AI总结 该研究提出 MobilePA-Bench 基准,针对现有移动智能体评估基准的盲区,从多维度测试移动规划智能体,发现前沿 LLM 在移动场景中存在可靠性问题,该基准可用于诊断与加速可靠移动智能体开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21898 2026-08-25 cs.AI 新提交 79%

Training Needs Trustworthy Worlds: Verified Synthetic Web Environments for Agent Learning

训练需要可信的世界:用于智能体学习的经过验证的合成Web环境

Chenghao Zhang, Canran Xiao, SaiSai Hu, Dan Roth

机构 * University of Pennsylvania(宾夕法尼亚大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Pace University(佩斯大学)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI

AI总结 该研究构建可执行、可审计的合成Web环境,修复缺陷后用于训练Web智能体,提升了可行任务率与PPO策略性能,增强了向多个基准的迁移能力,为智能体学习提供了可靠训练基底。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21841 2026-08-25 cs.AI cs.HC 新提交 79%

AI Watchdog: Agent Interfaces for Detecting and Defending Against Manipulative Dark Patterns in AI Conversations

AI 看门狗:用于检测和防御 AI 对话中操纵性黑暗模式的智能体接口

Rachel Poonsiriwong, Chayapatr (Pub) Archiwaranguprok, Constanze Albrecht, Monchai Lertsutthiwong, Pattie Maes, Pat Pataranutaporn

机构 * MIT Media Lab(麻省理工学院媒体实验室) KASIKORN Labs(Kasikorn实验室)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI

AI总结 本研究提出 AI Watchdog 浏览器智能体接口,可检测对话式 AI 的五类黑暗模式,实验发现无认知强制的即时警告能显著降低用户对含黑暗模式的 AI 引导建议的依从性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21460 2026-08-25 cs.CV cs.AI 新提交 70%

FigmaTrace: Capturing Creative Nuances in Human Figma Design Workflows

FigmaTrace:捕捉人类Figma设计工作流程中的创意细节

Darshan Deshpande, Yoshinari Fujinuma, Martyna Markiewicz, Devanshu Bansal, Shivani Jain, Nicholas Saban, Chirag Maheshwari, Anand Kannappan

机构 * Patronus AI

专题命中 GUI与网页智能体 :workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究构建了FigmaTrace数据集,训练模型后其在四个分布外智能体GUI环境中性能可与前沿闭源模型媲美,且通过定性分析关联了性能提升与数据集的趋势,同时开源了数据集和最佳模型。

Comments Dataset: this https URL (https://huggingface.co/datasets/PatronusAI/figmatrace) Model: this https URL (https://huggingface.co/PatronusAI/Qwen3.8-27B-Figmatrace-SFT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23055 2026-08-25 cs.LG cs.RO 新提交 57%

Macro-Action Topological Navigation under Noisy Localization using Reinforcement Learning

基于强化学习的含噪定位下的宏动作拓扑导航

Simon Hakenes, Tobias Glasmachers

机构 * Institute of Neural Computation, Ruhr University Bochum(鲁尔大学波鸿分校神经计算研究所)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 本研究提出一种基于强化学习的含噪定位下的宏动作拓扑导航方法,通过以物体为中心的位姿估计替代真实位姿,在Habitat模拟器中实现智能体仅用视觉完成3D公寓内的导航任务。

Comments 15 pages, Accepted at the Artificial Intelligence Symposium (AIS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22847 2026-08-25 cs.AI 新提交 57%

GSAR: Goal-State-Anchor Rewards for Mobile GUI Agents with Self-Evolving Data Synthesis

GSAR:面向移动GUI智能体的目标-状态-锚点奖励,结合自进化数据合成技术

Long Zhang, Yuhan Chen, Chaoran Zhang, Wanxia Cao, Kun Huang, Pengzhi Gao, Wei Liu, Jian Luan, Chenliang Li, Lixin Zou

机构 * Wuhan University(武汉大学) Xiaomi Inc.(小米公司)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本研究提出GSAR奖励框架,结合自进化数据合成与状态-锚点机制,解决VLM-GUI智能体训练中数据合成及奖励信号的问题,在多基准测试中表现优异,为GUI智能体训练提供可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22678 2026-08-25 cs.RO cs.AI cs.CV 新提交 57%

RACO: Reliability-Aware Coarse-Goal Optimization for Inspection-Oriented UAV Vision-Language Navigation

RACO:面向巡检的无人机视觉语言导航的可靠性感知粗目标优化

Sen Wang, Yiming Sun, Jiaxuan He, Pengfei Zhu

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 针对面向巡检的无人机视觉语言导航,提出RACO框架,通过可靠性感知优化粗目标,在未见场景下较HETT基线显著提升成功率,改善巡检区域到达率并降低错误验证风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21830 2026-08-25 cs.AI 新提交 57%

Beyond Success and Failure: Length-Aware Contrastive Learning for GUI Agents

超越成功与失败:面向GUI智能体的长度感知对比学习

Chengyang Gu, Le Zhang, Jingbo Zhou, Yize Chen, Yu Shi, Siqi Bao, Zheng-Fan Wu, Hua Wu, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Baidu Inc.(百度公司) University of Alberta(阿尔伯塔大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 针对GUI智能体现有对比RLVR方法无法捕获轨迹细粒度质量差异的问题,提出LACL-GUI框架,引入轨迹级质量信号,在基准测试中实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07008 2026-08-25 cs.CV cs.LG 版本更新 57%

Where Not to Learn: Prior-Aligned Training with Subset-based Attribution Constraints

不应学习的地方:基于子集归因约束的先验对齐训练以实现可靠的决策制定

Ruoyu Chen, Shangquan Sun, Xiaoqing Guo, Kangwei Liu, Sanyi Zhang, Zhangcheng Wang, Shiming Liu, Qunli Zhang, Wei Wang, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) Communication University of China(中国传媒大学) Imperial College London(伦敦帝国学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于归因的先验对齐方法,通过子集选择归因技术约束模型依赖于人类先验区域,从而提升决策的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22828 2026-08-25 cs.CV 新提交 50%

VeCAS: Vessel-Focused Contrast-Free Angiogram Synthesis for Vascular Interventions

VeCAS:面向血管介入的聚焦血管的无造影剂血管造影合成

De-Xing Huang, Chen-Yu Wang, Hao Liang, Xiao-Hu Zhou, Mei-Jiang Gui, Tian-Yu Xiang, Qin-Yi Zhang, Chen Wang, Xiao-Liang Xie, Shi-Qi Liu, Ming-Yuan Liu, Zhen-Chang Wang, Zeng-Guang Hou

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出VeCAS框架,通过两阶段合成实现无造影剂血管造影,在下肢数据集实验中优于对比方法,还可缩短机器人导丝导航的时间与步骤,具临床应用潜力。

Comments 10 pages, 8 figures, 5 tabels, supplementary material: this https URL (https://dxhuang-casia.github.io/data/vecas_supplementary_material.pdf)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21387 2026-08-25 cs.RO eess.SY 新提交 50%

Multimodal-Language-Model-Driven Interaction and Companionship for Service Robots in Elderly-Care Facilities

面向养老机构服务机器人的多模态语言模型驱动的交互与陪伴

Ching-Chieh Liu, Cong-Thanh Vu, Yen-Chen Liu

机构 * National Cheng Kung University (NCKU)(成功大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 该研究针对养老机构服务机器人缺乏综合陪伴与安全能力的问题,提出整合主动视觉跟人、LLM语音交互及VLM安全监测的智能陪伴机器人系统,实验验证其跟随交互与跌倒检测的有效性。

Comments Accepted to the 2026 IEEE/ASME International Conference on Advanced Intelligent Mechatronics (AIM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04276 2026-08-25 econ.TH 版本更新 50%

The Fallback as Signal: Preserved Human Skill, Liability, and Competence Signaling in Credence-Good Markets under Improving AI

作为信号的弃权:AI不断改进下的信任品市场中保留的人类技能、责任与能力信号

Andreas Bauer

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 该研究针对AI改进但仍不完善时企业的人类员工参与决策问题,构建基于主体的市场模型再现相关分析阈值,揭示信任品市场中人类技能等信号的保留机制。

Comments 51 pages, 7 figures. v3: corrections to the proofs in Appendices A and B (no reported number changes); Proposition 8 strengthened to an unconditional result with a closed-form threshold; declarations block added. Replication package: this https URL (https://doi.org/10.6084/m9.figshare.33317559)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16537 2026-08-25 cs.RO 版本更新 50%

Nori A3: A Bimanual Mobile Manipulator at the Appliance Price Point

Nori Bot:一款不到1000美元的 floor-to-counter 移动机械臂

Antonio Li

机构 * LeRobot

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 Nori Bot 通过600mm Z轴提升、Raspberry Pi 4与OpenClaw协同控制以及软件安全栈解决移动机械臂的三大限制,成本仅为同类商业平台的3%。

Comments 5 pages, 4 figures, 2 tables. Supersedes arXiv:2605.16537 (https://arxiv.org/abs/2605.16537), which described an earlier prototype on a different mechanical base

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23772 2026-08-25 cs.HC 版本更新 50%

PageGuide: Browser extension to assist users in navigating a webpage and locating information

PageGuide: 一款辅助用户在网页上导航和查找信息的浏览器扩展

Tin Nguyen, Thang T. Truong, Runtao Zhou, Trung Bui, Chirag Agarwal, Anh Totti Nguyen

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 PageGuide通过视觉叠加将LLM回答与HTML DOM结合,帮助用户快速定位信息、逐步指导操作并隐藏干扰内容,提升浏览效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11250 2026-08-25 cs.CR cs.CV 版本更新 50%

Environmental Injection Attacks against GUI Agents in Realistic Dynamic Environments

针对现实动态环境中的GUI代理的环境注入攻击

Yitong Zhang, Ximo Li, Liyi Cai, Jia Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Computer Science, Peking University(北京大学计算机学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出Chameleon框架,通过LLM驱动的环境模拟和注意力黑洞机制,有效暴露GUI代理在动态环境中的隐藏漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏