arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-28 至 2026-08-28 共收录 223 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 19 篇

2608.26133 2026-08-28 cs.CL 新提交 91%

Agent Seer: Synthesizing Scenarios from Specification Understanding

Agent Seer:基于规范理解的场景合成

Harish Karumuri, Mahesh Vemula, David Lopes Pegna

机构 * Apple(苹果公司)

专题命中 工具调用 :agent(title,title_cn);AI agent(abstract);分类 cs.CL

AI总结 Agent Seer仅用单个MCP规范,无需示例、实时工具访问或领域调优,即可合成高质量测试场景,在7个不同领域的MCP规范上实现完整工具覆盖,为AI智能体评估提供了可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26199 2026-08-28 cs.AI cs.SE 新提交 88%

Benchmarking AI Agents for Hardware Design Automation via MCP Tool Calling

通过MCP工具调用对硬件设计自动化的AI智能体进行基准测试

Leonardo Liparulo, Francesco Pierri

机构 * Politecnico di Milano(米兰理工大学)

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);tool use(abstract);multi-agent(abstract)

AI总结 本研究构建含MCP服务器的硬件设计自动化基准,评估7种开源AI智能体,发现其可靠性依赖任务结构与配置,为本地LLM智能体部署提供实用指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26747 2026-08-28 cs.AI 新提交 87%

AgentFold: Closed-Loop Agentic Search for Protein Folding Model Design

AgentFold:用于蛋白质折叠模型设计的闭环智能体搜索

Mingquan Liu, Jiangyu Chen, Hanqun Cao, Xujun Zhang, Pengsen Ma, Xiangru Tang, Shuting Jin, Zhuo Yang, Tianfan Fu, Fang Wu, Xiangxiang Zeng

机构 * Hunan University(湖南大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Yale University(耶鲁大学) Wuhan University of Science and Technology(武汉科技大学) Southeast University(东南大学) Stanford University(斯坦福大学)

专题命中 工具调用 :agentic(title);agent(abstract);tool use(abstract);planning(abstract)

AI总结 AgentFold是将蛋白质折叠模型开发转化为闭环搜索的多智能体框架,以ESMFold为起点,通过MCTS策略分配计算资源,在匹配预算下较Codex提案提升lDDT 7.5%,优于随机搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27439 2026-08-28 cs.CR cs.AI 新提交 85%

RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution

RedEvoAgent:具备经验驱动技能演化的自动红队代理

Junjie Zhang, Hui Liu, Kecheng Chen, Xianbo Mo, Changsheng Chen, Haoliang Li

专题命中 工具调用 :agent(title,abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 针对LLM代理的越狱攻击风险,提出RedEvoAgent黑盒红队代理,通过提炼攻击轨迹实现技能演化,在多基准实验中性能优于基线,工具效率更高且可迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26696 2026-08-28 cs.AI cs.CR cs.SE 新提交 84%

Five Primitives for Governing Autonomous AI Agents at Runtime

运行时管控自主AI智能体的五大原语

Jiten Oswal, John Cadeddu

机构 * Aurite AI(奥莱特人工智能公司)

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 针对企业自主AI智能体管控的适配问题,提出发现、身份等五大运行时管控原语,描述其实现方案、成本及部分原语的开发状态。

Comments 14 pages, 2 figures, 1 table. Describes an implemented system in private pilot deployment; four of five primitives implemented

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24368 2026-08-28 cs.AI cs.SE 版本更新 84%

From State to Action: OODA-Tool for Reliable Multi-Turn Tool Use

从状态到动作:用于可靠多轮工具使用的OODA-Tool

Rongfeng Guo, Yinxuan Huang, Yusen Wu, Maoqing Zhong, Yunlu Chen, Meng Tang, Teng Long, Vincent Tao Hu

专题命中 工具调用 :tool use(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出OODA-Tool策略,通过分离状态维护与动作实现缓解状态-动作竞争,经Qwen3模型在多轮多工具任务上验证,可提升多轮工具使用的任务成功率,尤其对小模型及依赖多轮信息的任务效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26623 2026-08-28 cs.AI 新提交 83%

AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling

AgentJudgeBench:用于评估智能体工具调用的多难度基准

Abhigya Verma, Amit Kumar Saha, Seganrasan Subramanian, Sai Harshitha Aluru

机构 * ServiceNow AI(ServiceNow人工智能部门)

专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.AI

AI总结 该研究提出AgentJudgeBench基准,评估LLM评判在智能体工具调用工作流上的可靠性,发现其对齐度随难度下降,真实值并非总有益,还给出了实用评估指南。

Comments 31 Pages, 9 Figures, 31 Tables, Accepted as a main conference paper at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26563 2026-08-28 cs.CL 新提交 83%

SPT: Skills as Pre-Training Data for Agentic Language Models

SPT:将技能作为智能体语言模型的预训练数据

Yufei Sun, Yudong Li, Yiming Cheng

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 本研究提出技能预训练(SPT)方法,将公开技能包作为训练数据,结合参考感知组装策略,可提升智能体语言模型的工具使用性能,同时保留通用性能,验证了技能包作为预训练数据源的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02357 2026-08-28 cs.CV cs.AI 版本更新 83%

Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains

多模态智能体真的从工具使用中受益吗?能力增益的系统性研究

Jiawei Guo, Donglei Yu, Yu Chen, Xiang Wang, Shuai Li, Xinpei Zhao, Huaxing Liu, Qinghao Wang, Minpeng Liao

专题命中 工具调用 :tool use(title);agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 通过对比工具增强与无工具的多模态智能体在多项任务上的表现,发现工具使用并未带来一致的性能提升,智能体更多是学会了工具调用模式而非真正利用工具扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18383 2026-08-28 cs.CL cs.AI 版本更新 81%

MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation

MENTOR: 通过灵活的教师优化奖励进行工具使用蒸馏的强化学习

ChangSu Choi, Hoyun Song, Dongyeon Kim, Minkyung Cho, WooHyeon Jung, Sunjin Park, NohHyeob Bae, Seona Yu, KyungTae Lim

机构 * Seoul National University of Science and Technology(首尔科学技术大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) LG CNS

专题命中 工具调用 :tool-use(title,abstract);分类 cs.AI、cs.CL

AI总结 提出MENTOR方法,通过灵活的教师优化奖励结构,平衡行为对齐与下游性能,提升小模型在工具使用任务中的域外泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03605 2026-08-28 cs.CL 版本更新 79%

AEScorer: An Agentic Evidence-Grounded Framework for Graded Factuality Verification

DiVA: 基于代理-判别验证器的细粒度事实性验证

Hui Huang, Muyun Yang, Yuki Arase

机构 * Harbin Institute of Technology(哈尔滨工业大学) Institute of Science Tokyo(东京科学研究所)

专题命中 工具调用 :agentic(title,abstract);分类 cs.CL

AI总结 DiVA通过结合生成模型和判别模型的能力,提出了一种细粒度事实性验证方法,并构建了FGVeriBench基准,有效提升了事实性验证的精度和适用性。

Comments Accepted by Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07867 2026-08-28 cs.CL 版本更新 77%

The Cold-Start Safety Gap in LLM Agents

LLM智能体中的冷启动安全差距

Chung-En Sun, Linbo Liu, Tsui-Wei Weng

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 工具调用 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.CL

AI总结 研究发现工具调用型LLM智能体在会话开始时最脆弱,随着常规任务执行安全性提升,提出SODA基准并验证预热策略可缩小冷启动安全差距。

Comments Accepted to EMNLP2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27266 2026-08-28 cs.AI cs.CL 新提交 73%

Naive Prompt Optimization: Rethinking the Need for Complex Prompt Search

朴素提示优化:重新思考复杂提示搜索的必要性

Yuan Chang, Xiaoqi Chen

机构 * Purdue University(普渡大学)

专题命中 工具调用 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出轻量级朴素提示优化(NPO),发现其性能优于复杂优化器GEPA,且优化后的提示可迁移至同系列其他模型,表明简单线性提示优化可媲美复杂搜索方法。

Comments 22 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26432 2026-08-28 cs.SD cs.AI cs.CL 新提交 73%

SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning

SpeechGym:一种用于通过强化学习训练语音智能体的原生音频 Gym

Jiajun Fan, Jingyuan Li, Prashanth Gurunath Shivakumar, Jia-Hong Huang, Qi Luo, M. Maruf, Ivan Bulyko, Ge Liu, Roger Ren

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon AGI Foundations(亚马逊AGI基础研究部)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究针对语音智能体训练中梯度无法流动、难以强化学习的问题,提出原生音频环境 SpeechGym,用每轮过程奖励解决稀疏性问题,使开放权重模型在语音基准上任务成功率翻倍且排名提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21891 2026-08-28 cs.AI cs.CL 版本更新 73%

Learning the ARTS of Search for Automated Discovery

学习搜索的艺术以实现自动发现

Gurusha Juneja, Arnav Kumar Jain, Deepak Nathani, William Yang Wang, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Université de Montréal and Mila- Quebec AI Institute(蒙特利尔大学和Mila-魁北克人工智能研究所)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出ARTS方法,利用推理语言模型在假设与实验空间中迭代搜索,通过测试时训练解决上下文长度问题,在22个任务上优于现有算法,相对提升超15.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26226 2026-08-28 cs.AI 新提交 70%

LLM Agents for Time-Series: A Survey

面向时间序列的大语言模型(LLM)智能体:一项综述

Yilong Chen, Xiao Qin, Chenghao Liu, Liang Wu, Noelle I. Samia, Kaize Ding

机构 * Northwestern University(西北大学) Datadog AI Research(Datadog人工智能研究院) Nokia(诺基亚)

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本综述针对LLM智能体在时间序列问题上设计差异大的问题,采用问题驱动分类法梳理现有系统,分析任务对架构等的影响,对比模型性能,为相关设计提供指南并指出未来缺口。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07050 2026-08-28 cs.CL cs.LG 版本更新 62%

When Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy Distillation

多教师在线策略蒸馏中的行为杠杆不平衡

Jiabin Shen, Guang Chen, Chengjun Mao

机构 * AntGroup(蚂蚁集团)

专题命中 工具调用 :tool-use(abstract);分类 cs.CL、cs.LG

AI总结 研究多教师在线策略蒸馏中行为杠杆不平衡问题,提出Soft Clamp方法,通过校准令牌级散度,减少模型过度调用工具情况,在保持决策准确率的同时,降低工具调用循环和重复调用,提升多教师OPD效果。

Comments 33 pages, 5 figures. Code and aggregate artifacts: this https URL (https://github.com/shen-jiabin/decision-support-opd)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18037 2026-08-28 cs.AI cs.CL cs.MA 版本更新 62%

ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents

ProvenanceGuard: 基于MCP的LLM智能体的源感知事实性验证

Ander Alvarez, Santhiya Rajan, Alessandro Genuardi, Oliver Wirjadi, Samuel Mugel, Román Orús

机构 * Multiverse Computing Parque Cientifico y Tecnológico de Gipuzkoa(吉普斯夸科技园) Centre for Social Innovation(社会创新中心) Donostia International Physics Center(多诺斯蒂亚国际物理中心) Ikerbasque Foundation for Science(伊克尔巴斯克科学基金会)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出ProvenanceGuard,一种源感知验证器,通过追踪MCP工具调用、分解声明并路由到特定源,检测跨源混淆错误,在医疗领域数据集上优于源无关基线。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26314 2026-08-28 cs.RO math.OC 新提交 50%

Dispersive Forward Tree Search for Optimal Control: Coverage, Complexity, and Computation

用于最优控制的分散式前向树搜索:覆盖性、复杂度与计算

Shashank A. Deshpande, Jonathan P. How

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 工具调用 :planning(abstract)

AI总结 本文针对非线性平台的规划问题,提出具有有限样本近最优性保证的DFT*算法,通过分散指令集与代价剪枝,在嵌入式处理器上实现高效实时规划,性能优于现有运动学动力学规划器。

Comments 28 pages. Code: this https URL (https://github.com/croshank/DFTSearch)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 65 篇

2608.26807 2026-08-28 cs.CL cs.AI 新提交 89%

Behavior2Trip: Towards Personalized Travel Planning via User Behavior Trajectory

Behavior2Trip:基于用户行为轨迹的个性化旅行规划

Zihao Cheng, Yingyu Shan, Hongru Wang, Zeming Liu, Xinyi Wang, Xiangrong Zhu, Yuhang Guo, Wei Lin, Yunhong Wang

机构 * Meituan Inc.(美团公司) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Beijing Institute of Technology(北京理工大学) University of Edinburgh(爱丁堡大学)

专题命中 规划决策 :agent(summary_cn,abstract);planning(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究提出行为感知旅行规划新任务,构建Behavior2Trip基准,提出B2T-Agent智能体,实验显示其在旅行规划任务上表现优于基线,凸显任务挑战性与模型泛化性。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26809 2026-08-28 cs.CV cs.MM 新提交 88%

Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning

思考镜头:基于智能体推理的一致多镜头视频编辑

Chenyang Wu, Fuchen Long, Binyuan Huang, Xinlong Sun, Xi Chen, Chun-Le Guo, Chongyi Li

机构 * Nankai University(南开大学) Tencent(腾讯)

专题命中 规划决策 :agent(summary_cn,abstract);agentic(title,abstract)

AI总结 本文针对多指令编辑长视频的挑战,提出MMLVE任务与智能体编辑框架,构建MMLVE-Bench数据集及评估指标,所提MMLVE-Agent优于Seedance 2.0等闭源SOTA方法,可实现一致且无幻觉的长视频编辑。

Comments Project Page: this https URL (https://wucy0519.github.io/MMLVE/) and see source codes at this https URL (https://github.com/Wucy0519/MMLVE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26442 2026-08-28 cs.AI cs.CL 新提交 88%

Don't Overthink, Don't Underthink: Toward Adaptive Reasoning in Agentic AI

不要过度思考,不要思考不足:面向智能体人工智能的自适应推理

Md Jueal Mia, M. Hadi Amini

专题命中 规划决策 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)

AI总结 该研究针对智能体AI中推理分配不当导致的过度/思考不足问题,在MATH-500和GAIA基准上验证相关失败模式,为自适应推理机制研究提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27443 2026-08-28 cs.HC cs.CR 新提交 86%

Do User-Authored Permission Policies Improve Protection Against AI Agent Overreach?

用户自主编写的权限策略能否提升对智能体越权行为的防护?

Ting Yan

专题命中 规划决策 :AI agent(title,abstract);agent(title)

AI总结 研究对比HITL、AUTO、POLICY三种场景发现,用户自主编写的POLICY策略未显著提升对AI智能体越权行为的防护,因多数规则选“询问”,总干预时间未降低,且偏好与承诺存在差距。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26788 2026-08-28 cs.AI cs.CL cs.MA cs.RO 新提交 84%

Decoupling Planning and Control for Instructable Agents

可指令智能体的规划与控制解耦

Zineng Tang, Kelsey R. Allen, Sjoerd van Steenkiste, Ishita Dasgupta, Alane Suhr

机构 * UC Berkeley(加州大学伯克利分校) UBC(不列颠哥伦比亚大学) Google DeepMind(谷歌DeepMind)

专题命中 规划决策 :planning(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出Instruct-to-Act系统,将VLM规划器与世界模型控制器解耦,在七个具身环境中验证其性能优于仅控制器、直接VLM动作生成等基线,可替换VLM规划器且保持快速控制。

Comments Published as a conference paper at COLM 2026. Project page: this https URL (https://zinengtang.github.io/instruct-to-act/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27348 2026-08-28 cs.CL 新提交 83%

INTENT-AS-A-TOOL Makes it Easy to Track Agentic Misalignment

意图作为工具:轻松追踪智能体失配问题

Yutong Zhang, Jianshuo Dong, Peng Xu, Long Wang, Jie Zhang, Tianwei Zhang, Xiaoping Zhang, Han Qiu

机构 * Tsinghua University(清华大学) MatrixOrigin(矩阵起源) SiliconProspect AI(硅景人工智能) Nanyang Technological University(南洋理工大学)

专题命中 规划决策 :agentic(title,abstract);autonomous agent(abstract);分类 cs.CL

AI总结 本研究针对智能体失配问题,提出INTENT-AS-A-TOOL方法,通过添加意图专用工具追踪智能体推理过程中的意图变化,补充CoT监控,为智能体安全追踪提供细粒度信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27158 2026-08-28 cs.LG 新提交 83%

Diffusion Policies for Short-Horizon Planning in Robot Crowd Navigation

用于机器人人群导航短程规划的扩散策略

Wendong Li, Jochen Garcke

机构 * Institute for Numerical Simulation(数值模拟研究所) University of Bonn(波恩大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 针对机器人人群导航中现有方法难以表征多样化短期避障策略的问题,提出PDPO框架,生成短程动作块并引入边界约束,在基准测试中取得更好导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26197 2026-08-28 cs.SE 新提交 83%

Harness Engineering for Predictable Agentic Systems: An Empirical Study of Deterministic Execution Constraints

利用工程实现可预测的智能体系统:确定性执行约束的实证研究

Saransh Dhage

专题命中 规划决策 :agentic(title);agent(abstract);planning(abstract);分类 cs.SE

AI总结 本研究通过实证探究harness工程中确定性执行约束对LLM智能体的影响,发现添加结构化规划可提升可复现性与任务成功率,但延迟存在模型依赖的成本差异。

Comments 9 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27371 2026-08-28 cs.RO 新提交 82%

Embodied Scene Rearrangement Planning

具身场景重排规划

Canzhi Chen, Zan Wang, Siqi Zhu, Qi Wu, Yixuan Li, Wei Liang

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出具身场景重排规划(ESRP)新任务,构建含5400+场景对的ESRP-Bench基准,评估四类方法发现现有方法难高效完成,为智能体现实部署奠定基础。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L), 2026. Project page: this https URL (https://bit-pie.github.io/ESRP/) Code: this https URL (https://github.com/BIT-PIE/ESRP) Dataset: this https URL (https://huggingface.co/datasets/serendipity800/ESRP-PD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26819 2026-08-28 cs.RO cs.CG cs.DS 新提交 82%

CLIPPER: Replayable Shortlisted Optimization for Repeated Spatial Coverage Planning

CLIPPER:用于重复空间覆盖规划的可重放短名单优化

Julian Teusch, Jörg Philipp Müller, Monika Sester

机构 * Clausthal University of Technology(克劳斯塔尔工业大学) Leibniz University Hannover(莱布尼茨汉诺威大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 CLIPPER是用于重复空间覆盖规划的可重放优化方法,通过构建候选池等技术实现,在多地城市规模测试中,大幅降低了规划推出时间,覆盖度与全量贪心算法接近。

Comments Accepted at ACM SIGSPATIAL 2026. 6 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24275 2026-08-28 cs.AI cs.CL 版本更新 81%

RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards

RePolicy:用于智能体安全保障中安全策略调用的强化学习方法

Houcheng Jiang, Boxuan Zhang, Qiyong Zhong, Junfeng Fang, Xiang Wang, Xiangnan He

机构 * Zhejiang University(浙江大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 针对现有智能体安全保障方法难以适应未见轨迹和变化策略上下文的问题,提出RePolicy方法,结合PolicyTraj-20K与带可验证奖励和策略上下文扰动的GRPO,在六个智能体安全基准上取得良好安全检测与策略调用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏