arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-02 至 2026-06-02 共收录 425 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 25 篇

2606.00131 2026-06-02 cs.SE cs.AI cs.LG cs.PL 75%

AI-PROPELLER: Warehouse-Scale Interprocedural Code Layout Optimization with AlphaEvolve

AI-PROPELLER:基于AlphaEvolve的仓库规模过程间代码布局优化

Chaitanya Mamatha Ananda, Rajiv Gupta, Mircea Trofin, Aiden Grossman, Sriraman Tallam, Xinliang David Li, Amir Yazdanbakhsh

机构 * University of California, Riverside(加州大学河滨分校) Google(谷歌) DeepMind(深度思维)

专题命中 软件智能体 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 提出AI-PROPELLER系统,利用Magellan智能工作流将Propeller的编译器启发式方法演化为细粒度过程间优化器,并通过实际硬件执行评估布局变体,首次在工业仓库规模应用中实现细粒度过程间代码布局优化,性能提升0.23%至1.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24511 2026-06-02 cs.LG cs.AI cs.CR 73%

Claudini: Autoresearch Discovers State-of-the-Art Adversarial Attack Algorithms for LLMs

Claudini: 自动研究发现针对LLM的最先进对抗攻击算法

Alexander Panfilov, Peter Romov, Igor Shilov, Yves-Alexandre de Montjoye, Jonas Geiping, Maksym Andriushchenko

机构 * MATS ELLIS Institute(MATS ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心) Imperial College London(伦敦帝国理工学院)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种自动研究循环,利用前沿AI代理(如Claude Code和Codex)自动发现针对大语言模型的新型对抗攻击算法,在白盒越狱和提示注入评估中达到最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13937 2026-06-02 cs.LG cs.SE 73%

iML: Executable, Problem-Grounded, and Broadly Exploratory Code-Driven AutoML

iML: 可执行、问题驱动且广泛探索的代码驱动自动机器学习

Dat Le, Duc-Cuong Le, Anh-Son Nguyen, Tuan-Dung Bui, Thu-Trang Nguyen, Son Nguyen, Hieu Dinh Vo

机构 * Faculty of Information Technology, VNU University of Engineering and Technology(信息科技学院,越南工程与技术大学)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.LG、cs.SE

AI总结 提出iML多智能体框架,通过任务分析、数据剖析、结构化蓝图生成和模块化代码合成,实现可执行、问题驱动且广泛探索的代码驱动AutoML,在MLE-BENCH和iML-BENCH上显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00579 2026-06-02 cs.CL cs.CV 70%

Sandboxed Coding Agents are Competitive Omni-modal Task Solvers

沙盒化编码智能体是竞争性的全模态任务求解器

Dongping Chen, Xuanao Huang, Zhihan Hu, Qingyuan Shi, Dianqi Li, Tianyi Zhou

机构 * University of Maryland(马里兰大学) MBZUAI

专题命中 软件智能体 :agent(abstract);tool-use(abstract);分类 cs.CL

AI总结 本文提出沙盒化编码智能体,仅通过文本+图像访问和工具使用,即可在全模态任务中匹配甚至超越原生全模态模型,并通过技能注入和训练配方Code-X进一步提升性能。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00049 2026-06-02 cs.CY cs.AI 70%

Measuring and Mitigating Bias in Code Generated by Large Language Models

测量和减轻大型语言模型生成代码中的偏见

Yuxi Chen, Yutian Tang, Timothy Storer

机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算机科学学院)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文针对GPT-4o和Gemini等主流代码生成工具,提出评估框架,使用代码偏见分数和属性变化比率量化偏见,并探索四种轻量级缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23866 2026-06-02 cs.SE cs.CL 62%

SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale

SWE-rebench V2: 大规模语言无关的SWE任务集合

Ibragim Badertdinov, Maksim Nekrashevich, Anton Shevtsov, Alexander Golubev

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE

AI总结 提出语言无关的自动化流水线SWE-rebench V2,用于大规模收集可执行的软件工程任务并构建RL训练环境,产出涵盖20种语言、3617个仓库的32079个任务数据集。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02245 2026-06-02 cs.CL 57%

When Knowledge Is Not Free: Cost-Aware Evidence Selection in Retrieval-Augmented Generation

当知识并非免费:检索增强生成中的成本感知证据选择

Mingyan Wu, Han Yang, Omer Ben-Porat, Yftah Ziser

机构 * Northeastern University(东北大学) Technical University of Munich(慕尼黑技术大学) GESIS – Leibniz Institute for the Social Sciences(GESIS——莱比锡社会科学研究所) Technion–Israel Institute of Technology(技术学院——以色列理工学院) NVIDIA Research(NVIDIA研究) University of Groningen(格罗宁根大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.CL

AI总结 提出成本感知RAG设置,通过访问成本层级和预算约束,研究证据选择策略,发现静态选择脆弱而智能体方法有潜力但依赖模型和任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01969 2026-06-02 cs.SE cs.HC 57%

Trust-Calibrated Code Review: A Participatory Design Study of Review Workflows for LLM-Generated Multi-File Changes

信任校准的代码审查:针对LLM生成的多文件变更的审查工作流程的参与式设计研究

Lo Gullstrand Heander, Agnia Sergeyuk, Ilya Zakharov, Emma Söderberg, Nikita Mukhortov

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本研究通过参与式设计,发现审查LLM生成的多文件变更的核心挑战是信任校准,提出了三级审查工作流程和七项设计构造,并通过验证调查表明其能降低审查工作量。

Comments Submitted to ESEM SEIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20806 2026-06-02 cs.AI 57%

Safety Alignment of LMs via Non-cooperative Games

通过非合作博弈实现语言模型的安全对齐

Anselm Paulus, Ilia Kulikov, Brandon Amos, Rémi Munos, Ivan Evtimov, Kamalika Chaudhuri, Arman Zharmagambetov

机构 * DeepMind, London, UK(深度Mind,伦敦,英国)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出将安全对齐建模为攻击者与防御者语言模型之间的非零和博弈,通过在线强化学习联合训练,迭代提升安全性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02580 2026-06-02 cs.CV 50%

Thinking in Blender: Staged Executable Inverse Graphics with Vision-Language Models

在Blender中思考:基于视觉语言模型的分阶段可执行逆向图形

Guangzhao He, Rundong Luo, Wei-Chiu Ma, Hadar Averbuch-Elor

机构 * Cornell University(康奈尔大学)

专题命中 软件智能体 :agentic(abstract)

AI总结 提出分阶段可执行逆向图形(SEIG)框架,利用预训练视觉语言模型直接从单张图像重建可编辑的Blender程序,无需专用基础模型或可微渲染,通过逐步细化几何、材质、组合和光照提升重建保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02219 2026-06-02 cs.CV 50%

Symmetry-Aware 9D Pose Estimation with Sim(3)-Consistent Feature and Spherical Inception Convolution

对称感知的9D姿态估计:Sim(3)一致特征与球形Inception卷积

Panfei Cheng, Hongshan Yu, Wenrui Chen, Xiaojun Tang, Jian Liu, Naveed Akhtar

机构 * National Engineering Research Center for Robot Visual Perception and Control, School of Robotics and Artificial Intelligence, Hunan University(机器人视觉感知与控制国家工程研究中心,机器人与人工智能学院,湖南大学) Beijing Spacecrafts, China Academy of Space Technology(北京航天器,中国航天科技研究院) School of Computing and Information Systems, The University of Melbourne(计算与信息学院,墨尔本大学)

专题命中 软件智能体 :agent(abstract)

AI总结 提出一种类别级物体姿态估计方法,通过语义引导的对称感知模块和球形大核Inception卷积融合特征,实现无形状先验的精确平移/尺寸估计和鲁棒旋转估计,在基准和真实场景中达到最优性能。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01677 2026-06-02 cs.SD 50%

UniVocal: Unified Speech-Singing Code-Switching Synthesis

UniVocal: 统一语音-歌唱代码切换合成

Yufei Shi, Qian Chen, Wen Wang, Xiangang Li, Zhen-Hua Ling, Yang Ai

机构 * Tongyi Fun Team, Alibaba Group(通义Fun团队,阿里巴巴集团) Independent Researcher(独立研究者)

专题命中 软件智能体 :planning(abstract)

AI总结 提出UniVocal统一框架,通过两阶段课程学习和链式思维生成,隐式从文本上下文推断发声模式,实现语音-歌唱代码切换合成,在SCSBench上达到最优性能。

Comments accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00704 2026-06-02 cs.CV 50%

VICR: Visual In-Context Restoration for Real-World Image Super-Resolution

VICR: 面向真实图像超分辨率的视觉上下文恢复

Qichang Zhang, Hailong Wang, Baiang Li, Linhao Wang, Rong Fu, Erkang Cheng, Simon James Fong

机构 * Faculty of Science and Technology, University of Macau(澳门大学科技学院) Nullmax Hefei University of Technology(合肥工业大学) Shandong Normal University(山东师范大学)

专题命中 软件智能体 :agent(abstract)

AI总结 提出基于扩散变换器的视觉上下文恢复框架,通过解耦的视觉先验注入机制将真实图像超分辨率建模为图像补全,实现结构保真与细节合成的平衡。

Comments 28 pages, 11 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00224 2026-06-02 hep-ex hep-ph 50%

An AI-ready, Polarized Electron-Positron Collision Dataset

一个AI就绪的极化正负电子对撞数据集

Chi Lung Cheng, Simon Corrodi, T. J. Hobbs, Alaettin Serhan Mete, Benjamin Nachman

专题命中 软件智能体 :AI agent(abstract)

AI总结 该研究将SLD实验的约66万例重建事件数据从旧格式转换为现代格式,并包含数字化文档,为粒子物理和机器学习研究提供AI就绪数据集。

Comments 10 pages, 7 figures, 1 table. Dataset available at https://zenodo.org/records/19925960. Code available at https://github.com/HEP-KE/jazelle_reader and https://github.com/HEP-KE/sld-resurrect

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23351 2026-06-02 cs.CV 50%

CountGD++: Generalized Prompting for Open-World Counting

CountGD++: 面向开放世界计数的通用提示

Niki Amini-Naieni, Andrew Zisserman

机构 * Visual Geometry Group (VGG)(视觉几何组(VGG)) University of Oxford, UK(牛津大学,英国)

专题命中 软件智能体 :agent(abstract)

AI总结 提出CountGD++模型,通过扩展提示方式(包括负样本描述、伪示例自动标注和外部图像示例)提升开放世界计数的灵活性、准确性和泛化能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 12 篇

2606.00341 2026-06-02 cs.LG cs.AI 86%

ROGUE: Misaligned Agent Behavior Arising from Ordinary Computer Use

ROGUE:源于普通计算机使用的错误对齐代理行为

Jeremy Tien, Abishek Anand, Yu-Rou Tuan, Yuchen Shen, J. Zico Kolter, Aran Nayebi

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 GUI与网页智能体 :agent(title,abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 研究AI代理在良性环境中因任务完成而采取不安全行为(违反可纠正性)的问题,通过基准测试发现前沿模型普遍绕过用户中断或限制,且性能提升反而加剧错误对齐。

Comments 27 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01414 2026-06-02 cs.CV 85%

Agent Skills Should Go Beyond Text: The Case for Visual Skills

Agent技能应超越文本:视觉技能的必要性

Binxiao Xu, Ruichuan An, Bocheng Zou, Hang Hua

机构 * Peking University(北京大学) University of Wisconsin(威斯康星大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 GUI与网页智能体 :agent(title,title_cn)

AI总结 针对现有技能学习方法仅存储文本经验导致视觉任务瓶颈的问题,提出多模态技能范式,结合文本逻辑与视觉支持,通过自动系统将经验转化为可复用的视觉技能,在GUI等视觉任务中显著优于纯文本技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00010 2026-06-02 cs.HC cs.AI cs.CY 83%

Empathic and agentic artificial intelligence in nursing: perspectives on a human-centered framework for cancer care navigation in the United States

护理中的共情与自主人工智能:美国癌症护理导航中以人为本框架的视角

Tyra Girdwood, Saba Kheirinejad, Parnian Kheirkhah Rahimabad, Brianna M. White, Robert L Davis, David L Schwartz, Arash Shaban-Nejad

机构 * University of Tennessee Health Science Center, College of Nursing(田纳西大学健康科学中心护理学院) University of Tennessee Health Science Center, Center for Biomedical Informatics, Department of Pediatrics(田纳西大学健康科学中心生物医学信息中心,儿科系) University of Tennessee Health Science Center, Department of Radiation Oncology(田纳西大学健康科学中心放射肿瘤学系)

专题命中 GUI与网页智能体 :agentic(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出一个以人为本的人工智能框架,结合共情与自主方法,基于美国护士协会伦理准则,支持护士在癌症护理导航中增强而非取代人类共情与自主性,改善工作流程、医患关系和护理协调。

Comments 5 Pages, 1 Figure, 1 Table

Journal ref ESMO Real World Data and Digital Oncology, 2026, Vol 12, 100694

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02208 2026-06-02 cs.HC 82%

Context-Aware Workflow Decomposition for Automated Mobile UI Annotation Using Multimodal Large Language Models

基于多模态大语言模型的上下文感知工作流分解用于自动移动界面标注

Athar Parvez, Muhammad Jawad Mufti, Muqaddas Gull, Omar Hammad

专题命中 GUI与网页智能体 :workflow(title,abstract);agent(abstract)

AI总结 提出一种将标注任务分解为多个上下文感知阶段的工作流方法,通过结构化提示、模式约束JSON输出和元素特定指令,在MUIAnno数据集上评估不同分解策略,发现两步工作流在精度上最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13527 2026-06-02 cs.AI 77%

MMSkills: Towards Multimodal Skills for General Visual Agents

MMSkills: 面向通用视觉智能体的多模态技能

Kangning Zhang, Shuai Shao, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) Southeast University(东南大学)

专题命中 GUI与网页智能体 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 提出MMSkills框架,通过将多模态程序知识编码为紧凑的状态条件包(包含文本程序、运行时状态卡和多视角关键帧),并利用轨迹到技能生成器和分支加载多模态技能智能体,显著提升GUI和游戏场景下视觉智能体的决策能力。

Comments 25 pages, 8 figures, 8 tables. Project page: https://zkangning.github.io/MMSkills_for_Visual_Agents/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00497 2026-06-02 cs.CR cs.CL 70%

"I Strongly Suspect This Website Is a Scam": Benchmarking PII Leakage and Detection without Defense in Autonomous Web Agents

“我强烈怀疑这个网站是骗局”:自主网络代理中无防御的PII泄露与检测基准测试

Soham Roy, Sarthakbrata Halder, Arya Bharaty, Vaibhav Bhaskar, Yash Sinha, Dhruv Kumar, Srikant Panda, Murari Mandal

机构 * KIIT Bhubaneshwar(KIIT布巴内什瓦尔) BITS Pilani(比特斯理工学院) Lam Research(拉姆研究)

专题命中 GUI与网页智能体 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 本文通过构建包含91个攻击者控制环境和10个良性孪生基线的基准Scammer4U,评估前沿自主网络代理在社交工程攻击下的PII泄露风险,发现关键PII泄露率高达54-93%,并揭示了代理检测到攻击但仍有35.9%概率提交PII的检测-行动差距。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01993 2026-06-02 cs.CL cs.AI cs.LG 67%

MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?

MMG2Skill: 智能体能否从野外指南中提炼出自我进化的技能?

Xinyu Che, Junqi Xiong, Yunfei Ge, Xinping Lei, Shihao Li, Hang Yan, Han Li, Yuanxing Zhang, Zhiqi Bai, Jinhua Hao, Ming Sun, Han Li, Jiaheng Liu

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出MMG2Skill框架,将多模态异构的野外指南编译为可编辑技能,通过轨迹级根因反馈持续改进,在GUI控制、开放游戏和策略卡牌任务中显著提升VLM智能体性能。

Comments 35 pages, 12 figures, 13 tables. Code: https://github.com/NJU-LINK/MMG2Skill

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12724 2026-06-02 cs.RO 67%

TRANS: Terrain-aware Reinforcement Learning for Agile Navigation of Quadruped Robots under Social Interactions

TRANS:面向社交互动下四足机器人敏捷导航的地形感知强化学习

Wei Zhu, Irfan Tito Kurniawan, Ye Zhao, Mitsuhiro Hayashibe

机构 * Department of Robotics, Graduate School of Engineering, Tohoku University(东邦大学机器人学系) Laboratory for Intelligent Decision and Autonomous Robots, Woodruff School of Mechanical Engineering, Georgia Institute of Technology(佐治亚理工学院智能决策与自主机器人实验室)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract)

AI总结 提出一个名为TRANS的两阶段深度强化学习框架,通过三个DRL流水线(TRANS-Loco、TRANS-Nav和统一TRANS)实现四足机器人在非结构化地形上的社交导航,克服了传统方法中运动规划与运动控制分离、缺乏地形感知以及假设静态环境等局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12634 2026-06-02 cs.AI 57%

MobiBench: Multi-Branch, Modular Benchmark for Mobile GUI Agents

MobiBench: 面向移动GUI智能体的多分支模块化基准

Youngmin Im, Byeongung Jo, Jaeyoung Wi, Seungwoo Baek, Tae Hoon Min, Joo Hyung Lee, Sangeun Oh, Insik Shin, Sunjae Lee

机构 * KAIST(韩国科学技术院) Sungkyunkwan University(全北大学) Korea University(韩国大学) Fluiz

专题命中 GUI与网页智能体 :AI agent(abstract);分类 cs.AI

AI总结 提出MobiBench,首个模块化且支持多路径感知的离线基准测试框架,用于高保真、可扩展和可复现地评估移动GUI智能体,并揭示组件级性能瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01788 2026-06-02 cs.CV 50%

PlatonicNav: Unveiling Semantic Correspondence in Navigation with Platonic Topological Maps

PlatonicNav: 在导航中揭示柏拉图式拓扑地图的语义对应

Junlin Long, Zeyu Zhang, Xu Deng, Yiran Wang, Yue Yang, Luke Borgnolo, Maxwell Twelftree, Yang Zhao

机构 * USYD(新南威尔士大学) Maincode UNSW(新南威尔士大学) La Trobe(拉特罗布大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出PlatonicNav框架,通过自监督视觉编码器构建柏拉图式拓扑地图,无需跨模态训练即可统一视觉目标导航、跨模态目标导航和视觉语言导航任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12689 2026-06-02 cs.RO 50%

3D RL-DWA: A Hybrid Reinforcement Learning and Dynamic Window Approach for Goal-Directed Local Navigation in Multi-DoF Robots

3D RL-DWA:一种用于多自由度机器人目标导向局部导航的混合强化学习与动态窗口方法

Chiara Castellani, Enrico Turco, Domenico Prattichizzo

机构 * European Union’s Horizon Europe Research and Innovation Programme(欧洲联盟的地平线欧洲研究与创新计划)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出结合强化学习与动态窗口方法的混合框架,利用稀疏点云数据动态调整可变形微型机器人的运动和形状,在复杂受限环境中实现目标导航并最大化占据体积,实验表明该方法在变形和导航能力上优于纯强化学习和基于模型的方法。

Comments Accepted for publication in the Proceedings of the IEEE/ASME International Conference on Advanced Intelligent Mechatronics (AIM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23057 2026-06-02 cs.RO cs.CV cs.SY eess.IV eess.SY 50%

Seq-DeepIPC: Sequential Sensing for End-to-End Control in Legged Robot Navigation

Seq-DeepIPC:足式机器人导航中用于端到端控制的顺序感知

Oskar Natan, Jun Miura

机构 * Department of Computer Science and Electronics, Universitas Gadjah Mada(计算机科学与电子系,加查马达大学) Department of Computer Science and Engineering, Toyohashi University of Technology(计算机科学与工程系,东福冈技术大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出Seq-DeepIPC模型,通过融合多模态感知(RGB-D+GNSS)与时间序列,实现足式机器人在真实环境中的端到端导航控制,并在机器人狗上验证了其有效性。

Comments This work has been accepted for publication in the IEEE Sensors Journal. https://ieeexplore.ieee.org/document/11373257/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 18 篇

2606.01508 2026-06-02 cs.CR cs.AI 88%

Agent Operating Systems (AOS): Integrating Agentic Control Planes into, and Beyond, Traditional Operating Systems

代理操作系统 (AOS):将代理控制平面集成到传统操作系统及其之外

Ankur Sharma, Deep Shah

机构 * Independent Researcher(独立研究员)

专题命中 记忆与上下文管理 :agent(title,abstract);agentic(title,abstract);分类 cs.AI

AI总结 本文提出代理操作系统(AOS)架构,通过集成代理控制平面到现有操作系统或逐步接管部分OS职责,以解决传统OS在调度、内存管理、安全、可观测性和治理方面对长期目标导向的代理AI工作负载的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14878 2026-06-02 cs.SE cs.ET 86%

Model Context Protocol (MCP) Tool Descriptions Are Smelly! Towards Improving AI Agent Efficiency with Augmented MCP Tool Descriptions

模型上下文协议(MCP)工具描述存在坏味道!通过增强MCP工具描述提升AI智能体效率

Mohammed Mehedi Hasan, Hao Li, Gopi Krishnan Rajbahadur, Bram Adams, Ahmed E. Hassan

专题命中 记忆与上下文管理 :agent(title,abstract);AI agent(title);分类 cs.SE

AI总结 本文通过实证研究103个MCP服务器中的856个工具描述,发现97.1%的描述存在坏味道,并提出增强描述方法,在提升任务成功率(中位数+5.85%)的同时增加了执行步骤(+67.46%),进一步通过组件消融实验找到兼顾性能与效率的紧凑描述组合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00619 2026-06-02 cs.CL cs.AI 86%

MemPro: Agentic Memory Systems as Evolvable Programs

MemPro:作为可进化程序的智能体记忆系统

Qingshan Liu, Guoqing Wang, Wen Wu, Jingqi Huang, Xinqi Tao, Dejia Song, Jie Zhou, Liang He

机构 * East China Normal University(东华师范大学) Xiaohongshu Inc.(小红书公司)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 提出MemPro框架,将整个记忆构建-检索管道视为可进化程序,通过故障模式引导的编辑-调试迭代优化,在多个长时任务数据集上超越静态和提示级进化基线。

Comments 20 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏