arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-07 至 2026-04-07 共收录 232 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 4 篇

2511.17013 2026-04-07 cs.RO 50%

MfNeuPAN: Proactive End-to-End Navigation in Dynamic Environments via Direct Multi-Frame Point Constraints

MfNeuPAN: 通过直接多帧点约束实现动态环境中的前瞻性端到端导航

Yiwen Ying, Hanjing Ye, Senzi Luo, Luyao Liu, Yu Zhan, Li He, Hong Zhang

机构 * Department of Electronic and Electrical Engineering, Southern University of Science and Technology(南方科技大学电子与电气工程系) Shenzhen Key Laboratory of Robotics and Computer Vision(深圳市机器人视觉与感知重点实验室)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出MfNeuPAN框架,通过多帧点约束实现动态环境中的前瞻性端到端导航,提升机器人在未知动态环境中的导航鲁棒性和效率。

Comments 6 pages, 9 figures, accepted at IEEE ROBIO 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 记忆与上下文管理 11 篇

2604.04527 2026-04-07 cs.SE cs.AI cs.PL 84%

ENCRUST: Encapsulated Substitution and Agentic Refinement on a Live Scaffold for Safe C-to-Rust Translation

ENCRUST:在活体支架上进行封装替换和代理细化以实现安全的C到Rust翻译

Hohyun Sim, Hyeonjoong Cho, Ali Shokri, Zhoulai Fu, Binoy Ravindran

机构 * Korea University(高丽大学) University of Houston(休斯顿大学) State University of New York Korea(纽约州立大学韩国分校)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 ENCRUST通过封装替换和代理细化方法,解决C到Rust翻译中的类型不匹配和不安全构造问题,通过ABI保持封装模式和整体代码库验证,实现安全且可编译的转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04901 2026-04-07 cs.CV cs.AI 83%

FileGram: Grounding Agent Personalization in File-System Behavioral Traces

FileGram:基于文件系统行为轨迹的智能体个性化研究

Shuai Liu, Shulin Tian, Kairui Hu, Yuhao Dong, Zhe Yang, Bo Li, Jingkang Yang, Chen Change Loy, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 记忆与上下文管理 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出FileGram框架,通过文件系统行为轨迹实现智能体记忆与个性化,包含数据引擎、基准测试和内存架构,解决数据限制和多模态轨迹收集难题。

Comments Project Page: https://filegram.choiszt.com, Code: https://github.com/synvo-ai/FileGram

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04514 2026-04-07 cs.AI cs.CL cs.IR 81%

SuperLocalMemory V3.3: The Living Brain -- Biologically-Inspired Forgetting, Cognitive Quantization, and Multi-Channel Retrieval for Zero-LLM Agent Memory Systems

SuperLocalMemory V3.3:活脑——生物启发的遗忘、认知量化与多通道检索用于零LLM代理记忆系统

Varun Pratap Bhardwaj

机构 * Independent Researcher(独立研究员)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出SuperLocalMemory V3.3,通过生物启发的遗忘机制、认知量化和多通道检索,实现零LLM代理的记忆系统,提升了多跳和对抗场景下的性能。

Comments 19 pages, 4 figures, 11 tables. Third paper in the SuperLocalMemory trilogy. Code: https://github.com/qualixar/superlocalmemory (v3.3.26). npm: superlocalmemory. PyPI: superlocalmemory

URL PDF HTML 收藏
2604.04853 2026-04-07 cs.AI 79%

MemMachine: A Ground-Truth-Preserving Memory System for Personalized AI Agents

MemMachine:一种保持事实真实性的记忆系统用于个性化AI代理

Shu Wang, Edwin Yu, Oscar Love, Tom Zhang, Tom Wong, Steve Scargall, Charles Fan

机构 * MemVerge, Inc.(MemVerge公司)

专题命中 记忆与上下文管理 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 MemMachine是一种开源记忆系统,通过整合短期、长期事件和用户档案记忆,实现事实真实性保护,提升多会话交互的准确性和效率。

Comments 18 pages, 16 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04660 2026-04-07 cs.AI 70%

Springdrift: An Auditable Persistent Runtime for LLM Agents with Case-Based Memory, Normative Safety, and Ambient Self-Perception

Springdrift:一种可审计的持久运行时用于LLM代理,具备基于案例的记忆、规范安全性和环境自我感知

Seamus Brady

专题命中 记忆与上下文管理 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 Springdrift通过可审计的执行子系统、基于案例的记忆层和规范安全机制,实现了LLM代理在跨会话任务连续性和环境自我感知方面的突破,展示了无显式指令下的自主诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03955 2026-04-07 cs.MA cs.AI 70%

Symbolic-Vector Attention Fusion for Collective Intelligence

符号-向量注意力融合用于集体智能

Hongwei Xu

专题命中 记忆与上下文管理 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出SVAF机制,通过分解多智能体信号并评估语义字段,实现知识融合与选择性过滤,提升集体智能性能。

Comments 26 pages, 14 tables, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23064 2026-04-07 cs.CR cs.AI cs.SI 70%

Mind Your HEARTBEAT! Claw Background Execution Inherently Enables Silent Memory Pollution

注意你的HEARTBEAT!Claw背景执行本质上使内存污染静默

Yechao Zhang, Shiqian Zhao, Jie Zhang, Gelei Deng, Jiawen Zhang, Xiaogeng Liu, Chaowei Xiao, Tianwei Zhang

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局(A*STAR)) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究揭示Claw个人AI代理中因心跳驱动背景执行导致的内存污染漏洞,通过MissClaw实验发现社会可信度驱动行为影响,内存污染可进入长期记忆并影响用户行为。

Comments 26 pages, 6 figures, 7 tables; identifies a vulnerability in the heartbeat mechanism of Claw systems with version-scoped evaluation (pre-fix OpenClaw, February 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03997 2026-04-07 cs.DC cs.MA 67%

Ledger-State Stigmergy: A Formal Framework for Indirect Coordination Grounded in Distributed Ledger State

账本-状态斯蒂格玛:一种基于分布式账本状态的间接协调形式化框架

Fernando Paredes García

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract)

AI总结 本文提出基于账本状态的间接协调框架,通过状态转换形式化方法,识别三种常见链上协调模式及Commit-Reveal序列叠加,提供可重用的词汇和设计指导。

Comments 15 pages, 1 figure. Also archived at Zenodo DOI: 10.5281/zenodo.19425884. Companion foundations preprint DOI: 10.5281/zenodo.19199497

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23459 2026-04-07 cs.CR cs.LG 57%

CSTS: A Canonical Security Telemetry Substrate for AI-Native Cyber Detection

CSTS:面向AI原生网络安全检测的通用安全遥测基础结构

Abdul Rahman

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.LG

AI总结 本文提出CSTS,一种通用安全遥测基础结构,旨在通过统一异构网络安全数据表示,提升AI原生网络安全检测的可重用性和可扩展性。

Comments This revision substantially strengthens the papers conceptual framing, formal substrate definition, portability decomposition, deployment model, and empirical interpretation as a telemetry substrate rather than a field normalization layer and sharpens the distinction between schema stability

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03463 2026-04-07 cs.LG cs.RO 57%

Super Agents and Confounders: Influence of surrounding agents on vehicle trajectory prediction

超级智能体与混杂因素:周围智能体对车辆轨迹预测的影响

Daniel Jost, Luca Paparusso, Martin Stoll, Jörg Wagner, Raghu Rajan, Joschka Bödecker

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本文分析了现有轨迹预测方法,发现周围智能体可能降低预测准确性。提出条件信息瓶颈机制,有效压缩特征并忽略无益信息,提升预测性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04462 2026-04-07 quant-ph 50%

A Demon that remembers: An agential approach towards quantum thermodynamics of temporal correlations

一个记忆恶魔:面向量子热力学中时间相关性的代理方法

Ruo Cheng Huang

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出一个决策理论框架,用于从量子系统中的时间相关性中提取热力学功,通过引入ρ*理想协议,展示了利用记忆效应可使适应性策略超越非适应性界限,并引入了时间有序自由能(TOFE)作为新型上界,揭示了与适应有序discord相关的热力学间隙。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Agent评测 37 篇

2604.03870 2026-04-07 cs.CL 89%

Your Agent is More Brittle Than You Think: Uncovering Indirect Injection Vulnerabilities in Agentic LLMs

你的代理比你想象的更脆弱:揭示代理LLM中的间接注入漏洞

Wenhui Zhu, Xuanzhao Dong, Xiwen Chen, Rui Cai, Peijie Qiu, Zhipeng Wang, Oana Frunza, Shao Tang, Jindong Gu, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Morgan Stanley(摩根士丹利) UC Davis(加州大学戴维斯分校) Washington University in St. Louis(圣路易斯华盛顿大学) Rice University(莱斯大学) Florida State University(佛罗里达州立大学) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(title,abstract);agentic(title);autonomous agent(abstract);multi-agent(abstract)

AI总结 研究揭示了代理LLM在动态环境中存在严重的间接注入漏洞,通过评估六种防御策略发现现有防护不足,提出基于表示工程的检测方法以提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26718 2026-04-07 cs.CY cs.AI cs.MA quant-ph 88%

Toward Evaluation Frameworks for Multi-Agent Scientific AI Systems

迈向多智能体科学AI系统的评估框架

Marcin Abram

专题命中 Agent评测 :agent(title);multi-agent(title);tool use(abstract);agentic(abstract)

AI总结 本文探讨了多智能体科学系统评估的挑战,提出构建抗污染问题、生成可扩展任务家族及多轮交互评估方法,通过访谈量子科学家探讨AI系统交互期望对评估方法的影响。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01487 2026-04-07 cs.AI cs.SI 87%

AgentSocialBench: Evaluating Privacy Risks in Human-Centered Agentic Social Networks

AgentSocialBench: 评估人类中心代理社交网络中的隐私风险

Prince Zizhuang Wang, Shuli Jiang

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);multi-agent(abstract)

AI总结 研究探讨了人类中心代理社交网络中的隐私挑战,提出AgentSocialBench基准,揭示代理协作中隐私保护的复杂性及现有LLM在隐私保护上的不足。

Comments 43 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23883 2026-04-07 cs.AI 87%

Agentic AI Security: Threats, Defenses, Evaluation, and Open Challenges

代理AI安全:威胁、防御、评估与开放挑战

Anshuman Chhabra, Shrestha Datta, Shahriar Kabir Nahin, Prasant Mohapatra

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)

AI总结 本文探讨代理AI系统的安全威胁与防御策略,分析其在自动化中的独特风险,并提出安全设计的开放挑战。

Comments Published in IEEE Access. DOI: https://doi.org/10.1109/access.2026.3675554

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04265 2026-04-07 cs.CR cs.AI cs.MA 85%

Governance-Constrained Agentic AI: Blockchain-Enforced Human Oversight for Safety-Critical Wildfire Monitoring

受治理约束的代理AI:区块链强制的人类监督用于安全关键的野火监测

Ali Akarma, Toqeer Ali Syed, Salman Jan, Hammad Muneer, Abdul Khadar Jilani

机构 * AI Center, Faculty of Computer and Information Systems, Islamic University of Madinah(伊斯兰大学麦地那分校计算机与信息系统学院人工智能中心) Faculty of Computer Studies, Arab Open University-Bahrain(阿拉伯开放大学巴林分校计算机研究学院) Department of Computer Science, The Islamia University of Bahawalpur(巴哈瓦尔布尔伊斯兰大学计算机科学系) College of Computer Studies, University of Technology Bahrain(巴林科技大学计算机研究学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出基于区块链的治理意识代理AI架构,用于安全关键的野火预警,通过约束部分可观测马尔可夫决策过程模型,实现动态风险适应的无人机资源分配,并通过智能合约强制人类授权,确保警报完整性、人类控制和非否认性。

Comments This paper was presented at ICETAS 2026 Bahrain

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03976 2026-04-07 cs.AI cs.CE 85%

Quantifying Trust: Financial Risk Management for Trustworthy AI Agents

量化信任:为可信AI代理的金融风险管理

Wenyue Hua, Tianyi Peng, Chi Wang, Ian Kaufman, Bryan Lim, Chandler Fang

机构 * Microsoft Research(微软研究院) Columbia University(哥伦比亚大学) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学) t54.ai Virtuals ACP University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 Agent评测 :AI agent(title);agent(abstract);autonomous agent(abstract);agentic(abstract)

AI总结 本文提出基于金融风险管理的Agentic Risk Standard框架,通过整合风险评估与补偿机制,将信任从隐含期望转为可衡量的产品保证,提升AI代理在开放环境中的可靠性。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03733 2026-04-07 q-fin.GN 85%

SoK: Blockchain Agent-to-Agent Payments

SoK: 区块链代理间支付

Yuanzhe Zhang, Yuexin Xiang, Yuchen Lei, Qin Wang, Tian Qiu, Yujing Sun, Spiridon Zarkov, Tsz Hon Yuen, Andreas Deppeler, Jiangshan Yu, Kwok-Yan Lam

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);agentic(abstract)

AI总结 本文系统化研究区块链支持的代理间支付,提出四阶段生命周期,识别关键挑战并提出未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04759 2026-04-07 cs.CR cs.AI cs.CL 84%

Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw

你的代理,他们的资产:OpenClaw的现实世界安全性分析

Zijun Wang, Haoqin Tu, Letian Zhang, Hardy Chen, Juncheng Wu, Xiangyan Liu, Zhenlong Yuan, Tianyu Pang, Michael Qizhe Shieh, Fengze Liu, Zeyu Zheng, Huaxiu Yao, Yuyin Zhou, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) NUS(新加坡国立大学) Tencent(腾讯) ByteDance(字节跳动) UC Berkeley(加州大学伯克利分校) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文首次对OpenClaw进行现实世界安全性评估,引入CIK分类法分析代理的持久状态,发现攻击单个CIK维度可显著提高攻击成功率,强调需系统性保障个人AI代理的安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06448 2026-04-07 cs.MA cs.AI cs.CL cs.SI 84%

When AI Agents Collude Online: Financial Fraud Risks by Collaborative LLM Agents on Social Platforms

当AI代理在线合谋:社交平台上基于协作LLM代理的金融欺诈风险

Qibing Ren, Zhijie Zheng, Jiaxuan Guo, Junchi Yan, Lizhuang Ma, Jing Shao

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 研究大型多代理系统中集体金融欺诈的风险,通过MultiAgentFraudBench基准测试分析欺诈行为协作机制及影响因素,提出内容警告、LLM监控和群体韧性提升等缓解策略。

Comments ICLR 2026, Code is available at https://github.com/zheng977/MutiAgent4Fraud

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03933 2026-04-07 cs.DC 82%

Deploy, Calibrate, Monitor, Heal -- No Human Required: An Autonomous AI SRE Agent for Elasticsearch

部署、校准、监控、修复——无需人工:一个用于Elasticsearch的自主AI SRE代理

Muhamed Ramees Cheriya Mukkolakkal

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract)

AI总结 本文提出ES Guardian Agent,通过十一阶段自主管理Elasticsearch全生命周期,利用多源预测失败引擎实现故障预测与修复,展示LLM在高可用性目标中的应用。

Comments 8 pages, 1 figure, 15 tables. Submitted to IEEE CNSM 2026. Cluster: Elasticsearch 8.17.0, 3 master + 12 data nodes, Kubernetes

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04426 2026-04-07 cs.AI 79%

ShieldNet: Network-Level Guardrails against Emerging Supply-Chain Injections in Agentic Systems

ShieldNet: 针对代理系统中新兴供应链注入的网络级防护

Zhuowen Yuan, Zhaorun Chen, Zhen Xiang, Nathaniel D. Bastian, Seyyed Hadi Hashemi, Chaowei Xiao, Wenbo Guo, Bo Li

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) University of Chicago(芝加哥大学) University of Georgia(佐治亚大学) United States Military Academy(美国军事学院) eBay Johns Hopkins University(约翰霍普金斯大学) UCSB(加州大学圣塔芭芭拉分校) Virtue AI

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出ShieldNet,通过观察真实网络交互检测供应链注入,优于现有工具,检测性能达0.995 F-1,误报率低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03898 2026-04-07 cs.AI stat.CO 79%

LLM-Agent-based Social Simulation for Attitude Diffusion

基于大语言模型的社交模拟用于态度扩散

Deepak John Reji

机构 * University of Limerick(利默里克大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出discourse_sim框架,结合LLM与基于代理的建模,模拟公众对移民态度随时间变化的动态,通过生成社交媒体帖子和解读观点来研究态度扩散和信念演变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04872 2026-04-07 cs.CL cs.LG 79%

Synthetic Sandbox for Training Machine Learning Engineering Agents

合成沙盒用于训练机器学习工程代理

Yuhang Zhou, Lizhu Zhang, Yifan Wu, Jiayi Liu, Xiangjun Fan, Zhuokai Zhao, Hong Yan

机构 * Meta AI

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SandMLE框架,通过生成多样化的合成机器学习工程环境,显著提升机器学习工程代理的训练效率,实现大规模在线策略学习,并在多个基准测试中取得显著性能提升。

Comments 28 pages, 9 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04619 2026-04-07 cs.DC 78%

Tight Bounds on Window Size and Time for Single-Agent Graph Exploration under T-Interval Connectivity

单Agent图探索下T-区间连通性中窗口大小和时间的紧界

Yuichi Sudo, Naoki Kitamura, Masahiro Shibata, Junya Nakamura, Sébastien Tixeuil, Toshimitsu Masuzawa, Koichi Wada

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究单Agent在T-区间连通图中的确定性探索,分析窗口大小和探索时间的紧界,提出算法并证明其最优性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04247 2026-04-07 cs.AI cs.CL cs.LG 75%

Combee: Scaling Prompt Learning for Self-Improving Language Model Agents

Combee:用于自我改进语言模型代理的提示学习扩展

Hanchen Li, Runyuan He, Qizheng Zhang, Changxiu Ji, Qiuyang Mang, Xiaokun Chen, Lakshya A Agrawal, Wei-Liang Liao, Eric Yang, Alvin Cheung, James Zou, Kunle Olukotun, Ion Stoica, Joseph E. Gonzalez

机构 * UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Tensormesh Gradient Network

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Combee通过并行扫描和增强洗牌机制,提升提示学习效率,实现多代理并行训练,同时保持学习质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27905 2026-04-07 cs.LG 74%

ATLAS-RTC: Closing the Loop on LLM Agent Output with Token-Level Runtime Control

ATLAS-RTC:通过令牌级运行时控制闭合LLM代理输出的循环

Christopher Cruz

机构 * Purdue University(普渡大学)

专题命中 Agent评测 :agent(title);分类 cs.LG

AI总结 ATLAS-RTC通过实时监控和干预减少解码错误,提升任务成功率和效率,实现LLM系统中的运行时控制新层次。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04347 2026-04-07 cs.AI 70%

RoboPhD: Evolving Diverse Complex Agents Under Tight Evaluation Budgets

RoboPhD:在有限评估预算下演化多样化复杂智能体

Andrew Borthwick, Stephen Ash, Anthony Galczak

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文通过对比三种优化方法,在四个基准测试中展示了RoboPhD在演化多样化复杂智能体方面的优越性,特别是在抽象推理、云调度、SQL生成和金融问答任务中表现突出。

Comments 20 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04341 2026-04-07 cs.AI 70%

Implementing surrogate goals for safer bargaining in LLM-based agents

在基于语言模型的智能体中实现安全谈判的替代目标

Caspar Oesterheld, Maxime Riché, Filip Sondej, Jesse Clifton, Vincent Conitzer

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文探讨了在基于语言模型的智能体中实现替代目标以提高谈判安全性的方法,通过四种不同技术验证了细调和支架法在应对替代目标威胁方面的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏