arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-28 至 2026-01-28 共收录 5 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 5 篇

2410.17520 2026-01-28 cs.LG cs.CL 81%

MobileSafetyBench: Evaluating Safety of Autonomous Agents in Mobile Device Control

MobileSafetyBench: 评估移动设备控制自主代理的安全性

Juyong Lee, Dongyoon Hahm, June Suk Choi, W. Bradley Knox, Kimin Lee

专题命中 GUI与网页智能体 :autonomous agent(title,abstract);分类 cs.CL、cs.LG

AI总结 MobileSafetyBench通过Android模拟器评估移动设备控制自主代理的安全性,揭示基于LLMs的代理在安全任务中存在缺陷,提出提示方法提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10809 2026-01-28 cs.CR cs.LG 79%

MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents

针对代理的恶意图像补丁:多模态操作系统代理劫持

Lukas Aichberger, Alasdair Paren, Guohao Li, Philip Torr, Yarin Gal, Adel Bibi

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨) University of Oxford(牛津大学)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.LG

AI总结 本文提出恶意图像补丁(MIPs)攻击,通过篡改屏幕区域使多模态OS代理执行有害操作,揭示了OS代理的安全漏洞。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18799 2026-01-28 cs.CY cs.AI cs.ET 79%

Agentic Digital Twins: A Taxonomy of Capabilities for Understanding Possible Futures

代理数字孪生:理解可能未来的能力分类

Christopher Burr, Mark Enzer, Jason Shepherd, David Wagg

机构 * The Alan Turing Institute(艾伦·图灵研究所) Mott MacDonald(莫特麦克劳林公司) Fujitsu Services Limited(富士通服务有限公司) University of Sheffield(谢菲尔德大学)

专题命中 GUI与网页智能体 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出代理数字孪生的能力分类,探讨其在不同配置下的表现力与本体重构潜力。

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19306 2026-01-28 cs.AI 70%

Curiosity Driven Knowledge Retrieval for Mobile Agents

基于好奇心的知识检索用于移动代理

Sijia Li, Xiaoyu Tan, Shahir Ali, Niels Schmidt, Gengchen Ma, Xihe Qiu

机构 * Shanghai University of Engineering Science(上海工程技术大学) National University of Singapore(新加坡国立大学)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出一种基于好奇心的知识检索框架,通过结构化AppCards提升移动代理在复杂任务中的规划可靠性与执行稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21850 2026-01-28 cs.CV cs.CL 57%

SCoPE VLM: Selective Context Processing for Efficient Document Navigation in Vision-Language Models

SCoPE VLM:面向视觉语言模型高效文档导航的 selective context processing

Gyubeum Lim, Yemo Koo, Vijay Krishna Madisetti

机构 * Georgia Institute of Technology(佐治亚理工学院) Konkuk University(韩国康克伦大学)

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.CL

AI总结 SCoPE VLM通过引入滚动链机制和定制强化学习方法,实现高效文档导航,提升视觉语言模型在多页文档问答中的代理阅读能力。

详情

展开后加载摘要…

URL PDF HTML 收藏