arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 35547 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 35547 篇

2510.19973 2026-05-15 cs.NI cs.AI 79%

A Tutorial on Cognitive Biases in Agentic AI-Driven 6G Autonomous Networks

面向6G自主网络的智能偏差教程

Hatim Chergui, Farhad Rezazadeh, Merouane Debbah, Christos Verikoukis

机构 * i2CAT Foundation(i2CAT基金会) Hostelworld Group(Hostelworld集团) Technical University of Catalonia (UPC)(技术大学(加泰罗尼亚)) Khalifa University of Science and Technology(卡里玛大学) ISI/ATH University of Patras(帕特拉大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 本文探讨了在6G自主网络中因人类设计引入的认知偏差问题,通过两个案例展示如何利用智能体AI缓解锚定偏差和时间偏差,提升网络管理和边缘计算的效率与节能效果。

Comments 26 pages, 18 figures, 4 tables, link to source code available. Accepted at IEEE OJCOMS

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04646 2026-05-15 cs.RO cs.LG 79%

ActivePusher: Active Learning and Planning with Residual Physics for Nonprehensile Manipulation

ActivePusher: 基于残差物理的主动学习与规划用于非抓取操作

Zhuoyun Zhong, Seyedali Golestaneh, Constantinos Chamzas

机构 * Department of Robotics Engineering, Worcester Polytechnic Institute (WPI)(机器人工程系,沃斯特理工学院(WPI))

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 本文提出ActivePusher框架,结合残差物理模型与不确定性主动学习,提升非抓取操作的数据效率和规划成功率。

Comments Accepted by the 2026 IEEE International Conference on Robotics & Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13702 2026-05-14 cs.AI 79%

Adaptive mine planning under geological uncertainty: A POMDP framework for sequential decision-making

在地质不确定性下的自适应采矿规划:一个用于序列决策的POMDP框架

Hamza Khalifi, Jef Caers, Yassine Taha, Mostafa Benzaazoua, Abdellatif Elghali

机构 * Geology & Sustainable Mining Institute (GSMI), University Mohammed VI Polytechnic (UM6P)(地质与可持续采矿研究所(GSMI),穆罕默德六世理工学院(UM6P)) Department of Earth and Planetary Sciences, Stanford University(地球与行星科学系,斯坦福大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出将采矿调度建模为部分可观测马尔可夫决策过程,通过混合SA-POMDP架构实现自适应决策,减少预期现实差距并提升净现值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.03496 2026-05-14 cs.AI cs.LO cs.RO 79%

Human Robot Collaborative Assembly Planning: An Answer Set Programming Approach

人类机器人协作装配规划:一种答案集编程方法

Momina Rizwan, Volkan Patoglu, Esra Erdem

机构 * Faculty of Engineering and Natural Sciences, Sabancı University, Istanbul, Turkey(工程与自然科学学院,萨班奇大学,伊斯坦布尔,土耳其)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出一种基于答案集编程的协作装配规划方法,结合常识推理和丰富的沟通动作,用于处理不确定性和确保安全协作。

Comments 36th International Conference on Logic Programming (ICLP 2020), University Of Calabria, Rende (CS), Italy, September 2020, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.00745 2026-05-14 cs.AI cs.LO cs.RO 79%

A Formal Framework for Robot Construction Problems: A Hybrid Planning Approach

机器人构建问题的正式框架:一种混合规划方法

Faseeh Ahmad, Esra Erdem, Volkan Patoglu

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出一种基于答案集编程的混合规划框架,用于解决机器人构建问题,确保结构稳定性、支撑性和任务顺序,通过基准实例验证了方法的有效性。

Comments 8 pages (double-column), 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13037 2026-05-14 cs.AI 79%

MAP: A Map-then-Act Paradigm for Long-Horizon Interactive Agent Reasoning

MAP:一种用于长周期交互代理推理的先映射再行动范式

Yuxin Liu, Ziang Ye, Yueqing Sun, Mingye Zhu, Jinwei Xiao, Zhuowen Han, Qi GU, Xunliang Cai, Lei Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团) Institution of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tianjin University(天津大学)

专题命中 规划决策 :agent(title);planning(abstract);分类 cs.AI

AI总结 本文提出MAP范式,通过先构建环境认知再执行任务,解决交互代理中环境感知延迟问题,实验显示在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26839 2026-05-14 cs.LG cs.CV 79%

From Pixels to BFS: High Maze Accuracy Does Not Imply Visual Planning

从像素到BFS:高迷宫精度并不意味着视觉规划

Alberto G. Rodriguez Salgado

机构 * Independent Researcher(独立研究者)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 本文通过MazeBench基准测试,揭示了多模态模型在视觉空间任务中依赖于文本网格转换和逐步路径枚举,而非真正的规划,高精度并不等同于人类空间理解。

Comments 15 pages, 10 figures. Code and mazes available at https://github.com/alrod97/LLMs_mazes

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08411 2026-05-14 cs.AI cs.RO 79%

Prismatic World Model: Learning Compositional Dynamics for Planning in Hybrid Systems

棱柱世界模型:学习组合动力学以在混合系统中规划

Mingwei Li, Xiaoyuan Zhang, Chengwei Yang, Zilong Zheng, Yaodong Yang

机构 * Beijing Institute of Technology(北京理工大学) Peking University(北京大学) NLCo Lab, Beijing Institute for General Artificial Intelligence(北大师范学院实验室,北京人工智能研究院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出Prismatic World Model,通过分解混合动力学为可组合的原始构件,解决机器人领域中基于模型的规划问题,提升轨迹优化算法的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11882 2026-05-13 cs.AI 79%

On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment

通过失败轨迹实现的在线自我进化以实现代理安全对齐

Bo Yin, Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出FATE框架,通过将验证者评分的失败轨迹转化为修复监督,结合Pareto-Front Policy Optimization方法,提升代理安全性同时保持有用行为,实验显示在不同模型和规模上均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11706 2026-05-13 cs.LG 79%

GRAFT: Graph-Tokenized LLMs for Tool Planning

GRAFT:基于图-令牌的大型语言模型用于工具规划

Xinyi Gao, Xinyu Ren, Junliang Yu, Tong Chen, Quoc Viet Hung Nguyen, Hongzhi Yin

机构 * The University of Queensland(昆士兰大学) Griffith University(格里菲斯大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 GRAFT通过内部化工具图和在线策略工具上下文蒸馏,提升工具规划的依赖意识和准确性,实现更可靠的复杂工作流中的LLM工具规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11117 2026-05-13 cs.LG cs.MA math.PR 79%

GRAFT-ATHENA: Self-Improving Agentic Teams for Autonomous Discovery and Evolutionary Numerical Algorithms

GRAFT-ATHENA:自我改进的代理团队用于自主发现和进化数值算法

Juan Diego Toscano, Zhaojie Chai, George Em Karniadakis

机构 * Division of Applied Mathematics, Brown University(布朗大学应用数学系)

专题命中 规划决策 :agentic(title,abstract);分类 cs.LG

AI总结 GRAFT-ATHENA通过自我改进的代理团队,在自主发现和进化数值算法中实现跨领域的方法积累与能力提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10754 2026-05-12 cs.AI 79%

The Agent Use of Agent Beings: Agent Cybernetics Is the Missing Science of Foundation Agents

代理行为的代理使用:代理循证学是基础代理的缺失科学

Xinrun Wang, Chang Yang, He Zhao, Zhuoyi Lin, Shuyue Hu

机构 * Singapore Management University(新加坡管理大学) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Institute for Infocomm Research, Agency for Science, Technology and Research (A*STAR)(信息通信研究院,科技研究局(A*STAR)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 本文提出代理循证学作为基础代理的理论基础,通过将经典循证学定律映射到代理设计原则,提出可靠性、持续运行和自我改进三大工程需求,以指导复杂任务中的代理设计与部署。

Comments Preliminary Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09465 2026-05-12 cs.CV cs.AI 79%

EvoDriveVLA: Evolving Driving VLA Models via Collaborative Perception-Planning Distillation

EvoDriveVLA: 通过协作感知-规划蒸馏进化驾驶VLA模型

Jiajun Cao, Xiaoan Zhang, Xiaobao Wei, Liyuqiu Huang, Zijian Wang, Hanzhen Zhang, Zhengyu Jia, Wei Mao, Hao Wang, Xianming Liu, Shuchang Zhou, Yang Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) XPeng Motors(小鹏汽车)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出EvoDriveVLA框架,结合自我锚定感知约束和未来引导轨迹优化,解决自动驾驶中感知退化和长期规划不稳定问题,实现nuScenes和NAVSIM的SOTA性能。

Comments 19 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08136 2026-05-12 cs.CL 79%

EconWebArena: Benchmarking Autonomous Agents on Economic Tasks in Realistic Web Environments

EconWebArena:在现实网络环境中评估自主代理在经济任务上的基准测试

Zefang Liu, Yinzhu Quan

机构 * Capital One Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :autonomous agent(title,abstract);分类 cs.CL

AI总结 本文提出EconWebArena基准,通过360个精心挑选的任务测试自主代理在经济任务中的能力,强调权威数据源和基于网络的经济推理,评估多种多模态LLM的表现,揭示性能差距和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10106 2026-05-12 cs.CV cs.AI 79%

ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models

ViSRA:一种基于视频的空间推理代理用于多模态大语言模型

Tingshu Mou, Jiabo He, Renying Wang, Ce Liu, Hao Yang, Tiehua Zhang, Jingjing Chen, Xingjun Ma

机构 * Fudan University(复旦大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI)) Tongji University(同济大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 ViSRA从无训练视角出发,提出一种人类对齐的视频空间推理代理框架,通过显式空间信息探索多模态大语言模型的空间推理机制,实现模块化和可扩展的空间推理,提升3D理解能力并减少训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09638 2026-05-12 cs.LG 79%

Plan2Cleanse: Test-Time Backdoor Defense via Monte-Carlo Planning in Deep Reinforcement Learning

Plan2Cleanse:通过深度强化学习中的蒙特卡洛规划实现测试时后门防御

Sze-Ann Chen, Zhi-Yi Chin, Kui-Yuan Chen, Chi-Yu Li, Ping-Chun Hsieh

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 本文提出Plan2Cleanse框架,利用蒙特卡洛树搜索在无需重新训练的情况下检测和缓解强化学习中的后门攻击,通过在MuJoCo、O-RAN和Atari环境中测试,显著提升了后门检测成功率和对抗性环境中的胜率。

Comments Published in Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09622 2026-05-12 cs.CV cs.AI 79%

Any2Any 3D Diffusion Models with Knowledge Transfer: A Radiotherapy Planning Study

任意到任意的3D扩散模型与知识转移:放射治疗计划研究

Yuhan Wang, Zihan Li, Han Liu, Simon Arberet, Martin Kraus, Yuyin Zhou, Florin-Cristian Ghesu, Dorin Comaniciu, Ali Kamen, Riqiang Gao

机构 * UC Santa Cruz(加州大学圣克ruz分校) Siemens Healthineers(西门子医疗) University of Washington(华盛顿大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出DiffKT3D,一种利用预训练视频扩散模型知识的统一Any2Any 3D扩散框架,通过模态特定嵌入实现多临床模态灵活条件化,结合临床导向的强化学习机制,提升放射治疗计划中的剂量预测精度与图像质量。

Comments Accepted by CVPR 2026 main conference. Compare to CVPR version, minor updates here are included (e.g., combine main text and appendix; clarify the timing scenario in appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09387 2026-05-12 cs.AI cs.RO 79%

NEXUS: Continual Learning of Symbolic Constraints for Safe and Robust Embodied Planning

NEXUS:用于安全和稳健体素规划的符号约束连续学习

Tiehan Cui, Peipei Liu, Yanxu Mao, Congying Liu, Mingzhe Xing, Datao You

机构 * School of Artificial Intelligence and Automation(人工智能与自动化学院) Huazhong University of Science and Technology(华中科技大学) School of Software(软件学院) Henan University(河南大学) Institute of Information Engineering(信息工程研究所) Chinese Academy of Sciences(中国科学院) School of Cyberspace Security(网络空间安全学院) University of the Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 NEXUS通过模块化框架实现体素代理的连续学习,将符号 artifacts 用于符号 grounding 和知识演化,将概率风险评估转化为确定性硬约束,提升任务成功率并抵御对抗攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09269 2026-05-12 cs.CL cs.CV 79%

DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification

DeltaRubric: 通过联合规划和验证实现生成式多模态奖励建模

Rui Liu, Dian Yu, Zhenwen Liang, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang

机构 * Tencent Hunyuan(腾讯文元) University of Maryland, College Park(马里兰大学 College Park 分校) University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校)

专题命中 规划决策 :planning(title,abstract);分类 cs.CL

AI总结 DeltaRubric通过联合规划和验证流程,提升多模态奖励建模的可靠性与泛化能力,实验表明其在多模态任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08477 2026-05-12 cs.CL 79%

Do Agents Need to Plan Step-by-Step? Rethinking Planning Horizon in Data-Centric Tool Calling

智能体是否需要分步规划?重新审视数据导向工具调用中的规划范围

Naoki Otani, Nikita Bhutani, Hannah Kim, Dan Zhang, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 规划决策 :planning(title,abstract);分类 cs.CL

AI总结 本文研究了数据导向任务中规划范围的影响,发现全范围规划结合延迟重规划在准确性和效率上优于单步规划。

Comments CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07584 2026-05-11 cs.AI 79%

Parallel Lifted Planning via Semi-Naive Datalog Evaluation

通过半 naive Datalog 评估实现并行提升规划

Dominik Drexler, Oliver Joergensen, Jendrik Seipp

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出一种基于半 naive Datalog 评估的并行提升规划方法,通过两级并行性提升规划效率,在多核环境下实现显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07370 2026-05-11 cs.RO cs.AI cs.MA cs.SY eess.SY 79%

MORPH-U: Multi-Objective Resilient Motion Planning for V2X-Enabled Autonomous Driving in High-Uncertainty Environments via Simulation

MORPH-U:基于仿真实现多目标鲁棒运动规划的V2X赋能自动驾驶高不确定性环境

Shih-Yu Lai

机构 * CARLA-based vehicle-side pipeline(基于CARLA的车辆侧流水线)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出MORPH-U,通过融合V2X与传感器数据构建局部动态地图,采用多目标优化方法在跟踪误差、安全余量、响应性和平滑度之间进行权衡,通过Pareto前沿分析选择操作点,并利用拜占庭启发的接受门防止故障触发下的不安全重规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07103 2026-05-11 cs.AI cs.MA 79%

ARMOR: An Agentic Framework for Reaction Feasibility Prediction via Adaptive Utility-aware Multi-tool Reasoning

ARMOR:一种通过自适应效用感知多工具推理的代理框架用于反应可行性预测

Ye Liu, Botao Yu, Xinyi Ling, Daniel Adu-Ampratwum, Xia Ning

机构 * Department of Biomedical Informatics(生物医学信息学系) Department of Computer Science and Engineering(计算机科学与工程系) Division of Medicinal Chemistry and Pharmacognosy(药物化学与药理学系) Translational Data Analytics Institute(转化数据分析研究所)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 ARMOR通过自适应效用感知多工具推理框架,有效整合多个工具的优势,提升反应可行性预测的准确性,尤其在存在工具预测冲突时表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06957 2026-05-11 cs.AI 79%

Learning and Reusing Policy Decompositions for Hierarchical Generalized Planning with LLM Agents

基于LLM代理的分层通用规划中的策略分解学习与重用

Shirin Sohrabi, Haritha Ananthakrishnan, Harsha Kokel, Kavitha Srinivas, Michael Katz

机构 * IBM

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出一种结合通用规划与分层任务分解的动态策略学习方法,通过自动分解学习可重用的策略组件,提升任务执行效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06924 2026-05-11 cs.CV cs.AI 79%

A$^2$RD: Agentic Autoregressive Diffusion for Long Video Consistency

A$^2$RD:基于代理的自回归扩散用于长视频一致性

Do Xuan Long, Yale Song, Min-Yen Kan, Tomas Pfister, Long T. Le

机构 * Google Cloud AI Research(谷歌云人工智能研究)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 A$^2$RD通过Retrieve-Synthesize-Refine-Update循环实现长视频一致性合成,提升视频生成的连贯性和叙事一致性。

Comments Project page: http://dxlong2000.github.io/AARD

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10512 2026-05-11 cs.LG cs.LO stat.ML 79%

Exponential Sample Complexity Separation between Flat and Hierarchical Agentic Theorem Provers

平坦与分层代理定理证明器的指数样本复杂度分离

Sho Sonoda, Shunta Akiyama, Yuya Uezato

机构 * CyberAgent RIKEN AIP(RIKEN先进研究所)

专题命中 规划决策 :agentic(title,abstract);分类 cs.LG

AI总结 研究通过分析教师证明器生成的数据分布,探讨了分层证明器在重复子证明中通过预测可重用证明图来减少样本需求的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06470 2026-05-08 cs.LG 79%

Hitting Time Isomorphism for Multi-Stage Planning with Foundation Policies

多阶段规划中的击中时间同构性

Magnus Victor Boock, Abdullah Akgül, Mustafa Mert Çelikok, Melih Kandemir

机构 * Department of Mathematics and Computer Science(数学与计算机科学系)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 本文提出基于击中时间同构性的新框架,通过学习希尔伯特空间位移几何,实现离线强化学习中的非对称表示学习,提升多阶段规划在长周期导航中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06200 2026-05-08 cs.CL 79%

A$^2$TGPO: Agentic Turn-Group Policy Optimization with Adaptive Turn-level Clipping

A$^2$TGPO: 基于自适应回合裁剪的代理回合策略优化

Dingwei Chen, Zefang Zong, Zhipeng Ma, Leo Luo, Yang Li, Chengming Li, Peng Chen, Jie Jiang

机构 * Tencent Inc(腾讯公司) The Chinese University of Hong Kong(香港中文大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.CL

AI总结 本文提出A$^2$TGPO,通过自适应回合裁剪和改进的归一化与累积方法,解决强化学习中代理大语言模型的回合级信用分配问题,提升多轮交互中单个工具调用的评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05951 2026-05-08 cs.AI 79%

HaM-World: Soft-Hamiltonian World Models with Selective Memory for Planning

HaM-World: 带选择性记忆的软哈密顿世界模型用于规划

Haoyun Tang, Haodong Cui, Keyao Xu, Kun Wang, Zhandong Mei

机构 * Xi’an Jiaotong University(西安交通大学) Huazhong University of Science and Technology(华中科技大学) Nankai University(南开大学) Nanyang Technological University(南洋理工大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 HaM-World通过分解潜在状态为规范子空间和上下文子空间,结合Mamba选择性状态空间记忆,提升规划稳定性与鲁棒性,实现高精度预测和任务完成。

Comments 22 pages, 5 figures. Code: https://github.com/HaoyunT/HaM_World

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05802 2026-05-08 cs.LG 79%

Selective Rollout: Mid-Trajectory Termination for Multi-Sample Agent RL

选择性回放:多样本代理强化学习中的中程轨迹终止

Zhiyuan Zhai, Xin Wang

机构 * Fudan University(复旦大学)

专题命中 规划决策 :agent(title);agentic(abstract);分类 cs.LG

AI总结 本文提出一种中程轨迹终止方法,通过在轨迹中途检测行动序列的编辑距离来提前停止无方差组,从而减少计算开销并提升测试任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏