arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 35547 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 35547 篇

2602.05031 2026-06-03 cs.LG 79%

Laplacian Representations for Decision-Time Planning

用于决策时规划的拉普拉斯表示

Dikshant Shehmar, Matthew Schlegel, Matthew E. Taylor, Marlos C. Machado

机构 * University of Cambridge(剑桥大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 本文提出利用拉普拉斯表示作为决策时规划的潜在空间,通过多时间尺度捕捉状态空间距离,并基于此设计层次规划算法ALPS,在离线目标条件强化学习任务中优于常用基线。

Comments Accepted at ICML 2026

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19883 2026-06-03 cs.AI 79%

Planning with Uncertainty: Symmetries, Policy Inference, and Solution Compression

不确定性规划:对称性、策略推理与解压缩

Frederico Messa, André Grahl Pereira

机构 * INF/UFRGS(乌尔巴诺-弗兰西斯科·里格尔大学信息学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出基于显式最佳优先策略空间搜索的FOND规划方法,通过定义策略等价关系、利用群论计算状态对称性、多项式时间策略推断以及整数规划实现部分状态策略压缩,显著提升求解效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
1204.3830 2026-06-03 cs.RO cs.AI cs.SY eess.SY 79%

Planning Optimal Paths for Multiple Robots on Graphs

图上多机器人路径规划的最优路径

Jingjin Yu, Steven M. LaValle

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出两种基于多流整数线性规划的模型,分别求解多机器人路径规划的最小最后到达时间和最小总距离问题,算法完备且保证最优解。

Comments Changed "agents" to "robots"

详情

展开后加载摘要…

URL PDF HTML 收藏
1203.2556 2026-06-03 cs.AI cs.SY eess.SY 79%

A Probabilistic Transmission Expansion Planning Methodology based on Roulette Wheel Selection and Social Welfare

基于轮盘赌选择和社会福利的概率输电扩展规划方法

Neeraj Gupta, Rajiv Shekhar, Prem Kumar Kalra

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出一种无需预先指定新增输电容量、利用社会福利概念的概率输电扩展规划方法,通过轮盘赌计算线路容量和潮流分析计算期望未供电量,并在改进IEEE 5节点系统上验证了仅新增线路不足以最小化期望未供电量。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02458 2026-06-02 cs.AI 79%

Beyond One-shot: AI Agents for Learning in Field Experiments

超越一次性:用于现场实验学习的AI智能体

Junjie Luo, Ritu Agarwal, Gordon Gao

专题命中 规划决策 :AI agent(title);agentic(abstract);分类 cs.AI

AI总结 研究通过工具增强的智能体AI自动从实验数据中学习并生成新干预措施,在医疗处方消息现场实验中证明其优于人类+聊天机器人方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02438 2026-06-02 cs.AI 79%

LLM-Evolved Pattern Generators for Optimal Classical Planning

LLM演化模式生成器用于最优经典规划

Windy Phung, Dominik Drexler, Arnaud Lequen, Jendrik Seipp

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出首个通过LLM驱动的进化程序合成学习可容许启发式函数的方法,用于最优经典规划,结合饱和成本分区保证A*搜索的最优性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02167 2026-06-02 cs.AI 79%

From Capability Models to Automated Planning: An AAS-Native Approach for Automatic PDDL Generation

从能力模型到自动规划:一种面向AAS的自动PDDL生成方法

Hamied Nabizada, Thomas Wirt, Luis Miguel Vieira da Silva, Felix Gehlhoff, Alexander Fay

机构 * Institute of Automation Technology, Helmut Schmidt University Hamburg(海德堡-施密特大学汉堡自动化技术研究所) Chair of Automation Technology, Ruhr University Bochum(博尔塔伦大学博德姆自动化技术教授团)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出一种基于资产管理外壳(AAS)能力模型自动生成PDDL规划问题的方法,使工程师无需掌握PDDL语法即可进行生产系统布局验证。

Comments Accepted at the 2026 IEEE 22nd International Conference on Automation Science and Engineering (CASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01779 2026-06-02 cs.CL 79%

HarnessForge: Joint Harness and Policy Evolution for Adaptive Agent Systems

HarnessForge:面向自适应智能体系统的协同框架与策略进化

Mingju Chen, Can Lv, Guibin Zhang, Heng Chang, Shiji Zhou

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北京航空航天大学) Tsinghua University(清华大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.CL

AI总结 提出HarnessForge元自适应框架,通过框架-策略协同进化实现LLM智能体系统的全系统自适应,在多个基准上显著提升性能。

Comments 25 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01626 2026-06-02 cs.LG 79%

IMWM: Intuition Models Complement World Models for Latent Planning

IMWM:直觉模型补充世界模型用于潜在规划

Baoqi Gao, Ruize Han, Miao Wang, Song Wang

机构 * Beihang University(北航) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 针对基于潜在世界模型的规划中搜索瓶颈问题,提出IMWM框架,通过直觉模型与三个轻量组件协作,在四个像素级任务上显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00981 2026-06-02 cs.CL 79%

Robust Asynchronous Planning via Auto-Formalization

通过自动形式化实现鲁棒的异步规划

Jiayi Zhang, Jianing Yin, Ben Zhou, Li Zhang

机构 * Drexel University(德雷塞尔大学) Arizona State University(亚利桑那州立大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.CL

AI总结 针对异步规划中并发、非均匀时长和执行时间约束的挑战,提出自动形式化方法,通过CP-SAT形式化器在依赖图规模从5到100动作时保持高准确率,并引入状态感知修复策略应对执行时约束更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00837 2026-06-02 cs.RO cs.LG 79%

Coarse-to-Fine Compositional Diffusion for Long-Horizon Planning

粗到细的组合扩散用于长时域规划

Byoungwoo Park, Utkarsh A. Mishra, Jaemoo Choi, Juho Lee, Yongxin Chen

机构 * KAIST(韩国科学技术院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 提出Coarse-to-Fine Compositional Diffusion (CoFi)方法,通过先形成全局骨架再细化局部细节,在长时域机器人规划、全景图像生成和长视频生成中提升全局一致性和局部质量,同时减少2-8倍去噪评估次数。

Comments Project page: https://cofi-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00611 2026-06-02 cs.AI 79%

TRACE: Trajectory Risk-Aware Compression for Long-Horizon Agent Safety

TRACE: 面向长程智能体安全的轨迹风险感知压缩

Zhepei Hong, Lin Wang, Liting Li, Haokai Ma, Junfeng Fang, Fei Shen, Dan Zhang, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) South China Normal University(华南师范大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 提出轨迹风险感知压缩方法TRACE,通过压缩器-阅读器架构将长轨迹压缩为潜在证据状态,以聚合稀疏风险信号并提升长程安全检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09153 2026-06-02 cs.RO cs.AI cs.CV cs.GR 79%

SceneSmith: Agentic Generation of Simulation-Ready Indoor Scenes

SceneSmith: 面向仿真就绪室内场景的智能体生成

Nicholas Pfaff, Thomas Cohn, Sergey Zakharov, Rick Cory, Russ Tedrake

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 提出层次化智能体框架SceneSmith,通过VLM智能体协作从自然语言生成仿真就绪的室内场景,相比先前方法生成3-6倍物体且碰撞率低于2%。

Comments ICML 2026 Spotlight; Project page: https://scenesmith.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09953 2026-06-02 cs.RO cs.AI 79%

DAG-Plan: Generating Directed Acyclic Dependency Graphs for Dual-Arm Cooperative Planning

DAG-Plan:生成有向无环依赖图用于双臂协作规划

Zeyu Gao, Yao Mu, Jinye Qu, Mengkang Hu, Shijia Peng, Chengkai Hou, Lingyue Guo, Ping Luo, Shanghang Zhang, Yanfeng Lu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences (CASIA)(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院(CASIA)) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,北京大学计算机科学学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) OpenGVLab, Shanghai AI Laboratory(上海人工智能实验室,OpenGVLab)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出DAG-Plan框架,首次使用有向无环图作为双臂协调的核心表示,通过一次LLM解析生成结构化DAG,实现自适应并行执行,在双臂厨房基准测试中成功率提升48%,执行效率提升84.1%。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30785 2026-06-01 cs.AI 79%

Learning Agent-Compatible Context Management for Long-Horizon Tasks

面向长时任务的学习智能体兼容上下文管理

Lu Yi, Runlin Lei, Liuyi Yao, Yuexiang Xie, Yuyang Li, Wenhao Zhang, Zhewei Wei, Yaliang Li, Jian-Yun Nie

机构 * Renmin University of China(中国人民大学) Tongyi Lab, Alibaba Group(阿里云实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Université de Montréal(蒙特利尔大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 提出AdaCoM方法,通过外部LLM对冻结智能体进行端到端强化学习上下文管理,在长时任务中提升性能并揭示保真度-可靠性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30318 2026-05-29 cs.GR cs.AI cs.CV 79%

Before the Shutter: Aesthetic and Actionable Portrait Photography Planning in 3D Scenes

快门之前:3D场景中美学的且可执行的人像摄影规划

Ruixiang Jiang, Chang Wen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出在3D场景中生成人像姿态、相机、照明和曝光方案的方法,通过构建摄影场景图实现美学引导的规划,生成视觉上引人注目且几何与光度可行的人像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30002 2026-05-29 cs.AI 79%

KairosAgent: Agentic Time Series Forecasting with Fused Semantic Reasoning

KairosAgent:融合语义推理的智能体时间序列预测

Kun Feng, Ziwei Shan, Yuchen Fang, Yiyang Tan, Sihan Lu, Shuqi Gu, Lintao Ma, Xingyu Lu, Kan Ren

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) Ant Group(蚂蚁集团)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 提出KairosAgent框架,通过结合基于LLM的推理器和基于TSFM的预测器,并引入强化学习范式,实现跨模态时间序列的零样本预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29966 2026-05-29 cs.AI 79%

Compass: Navigating Global Marine Lead Data Integration through Expert-Guided LLM Agent

Compass: 通过专家引导的LLM代理导航全球海洋铅数据整合

Yiming Liu, Bin Lu, Meng Jin, Ziyuan Sang, Shuo Jiang, Lei Zhou, Xinbing Wang, Chenghu Zhou, Jing Zhang

机构 * School of Information Science Electronic Engineering,\ Jiao Tong University Shanghai China School of Artificial Intelligence,\ Jiao Tong University Shanghai China State Key Laboratory of Estuarine Coastal Research,\ China Normal University Shanghai China School of Oceanography,\ Jiao Tong University Shanghai China Institute of Geographical Science Natural Resources Research,\ Academy of Sciences Beijing China Electronic Engineering,\ Jiao Tong University School of Artificial Intelligence,\ Jiao Tong University Coastal Research,\ China Normal University School of Oceanography,\ Jiao Tong University Natural Resources Research,\ Academy of Sciences

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 针对海洋铅数据分散于非结构化论文中的问题,提出专家引导的LLM代理框架Compass,结合知识树分解任务,从23万篇论文中提取3751条铅记录,构建最大海洋铅数据库,准确率达92%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11944 2026-05-29 cs.RO cs.AI 79%

A Review of Learning-Based Motion Planning: Toward a Data-Driven Optimal Control Approach

基于学习的运动规划综述:迈向数据驱动的最优控制方法

Jia Hu, Yang Chang, Haoran Wang

机构 * College of Transportation Key Laboratory of Road and Traffic Engineering of the Ministry of Education(交通运输学院 道路交通工程教育部重点实验室) Institute for Advanced Study(先进研究院) Tongji University(同济大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文系统综述了数据驱动最优控制范式,通过融合最优控制的理论保证与机器学习的自适应能力,为自动驾驶运动规划提供了三维实现路线图,并指出了四个未来研究方向。

Comments 44 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04758 2026-05-29 cs.RO cs.AI cs.MA 79%

ScheduleStream: Temporal Planning with Samplers for GPU-Accelerated Multi-Arm Task and Motion Planning & Scheduling

ScheduleStream: 基于采样器的时序规划用于GPU加速的多臂任务与运动规划及调度

Caelan Garrett, Fabio Ramos

机构 * NVIDIA Research Seattle Robotics Lab (SRL)(NVIDIA西雅图机器人实验室) University of Sydney(悉尼大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出ScheduleStream,首个通用框架,通过混合持续动作和领域无关算法,结合GPU加速采样器,实现多臂并行任务与运动规划及调度。

Comments Project website: https://schedulestream.github.io

Journal ref 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26270 2026-05-29 cs.AI 79%

Graph-Enhanced Policy Optimization in LLM Agent Training

图增强策略优化在LLM智能体训练中的应用

Jiazhen Yuan, Zhike Gong, Jinquan Hang, Zhengbiao Bai, Wei Zhao

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 提出图增强策略优化(GEPO)框架,通过状态转移图的双层结构信用分配(任务条件关键性评分),在LLM多步智能体训练中提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29262 2026-05-29 cs.AI 79%

Harmonizing Real-Time Constraints and Long-Horizon Reasoning: An Asynchronous Agentic Framework for Dynamic Scheduling

协调实时约束与长视距推理:一种用于动态调度的异步智能体框架

Shijie Cao, Yuan Yuan, Jing Liu

机构 * School of Computer Science and Engineering, Beihang University, Beijing 100191, China(北京航空航天大学计算机科学与工程学院) Shenzhen Loop Area Institute, Shenzhen, China(深圳环形区研究所) Qingdao Research Institute, Beihang University(青岛研究院) Hangzhou Innovation Institute, Beihang University(杭州创新研究院) School of Artificial Intelligence, Xidian University, Xi’an 710071, Shaanxi, China(西安电子科技大学人工智能学院) Guangzhou Institute of Technology, Xidian University, Guangzhou 510555, Guangdong, China(广州技术研究所)

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI

AI总结 提出RACE-Sched异步智能体框架,通过双流架构解耦策略执行与逻辑推理,利用LLM合成和验证符号启发式规则,在保证实时性的同时提升动态调度质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07707 2026-05-29 cs.AI 79%

Hierarchical Task Network Planning with LLM-Generated Heuristics

基于LLM生成启发式的层次任务网络规划

Felipe Meneguzzi, Alexandre Buchweitz, Augusto B. Corrêa, Victor Scherer Putrich, André Grahl Pereira

机构 * University of Aberdeen, UK(爱丁堡大学(英国)) PUCRS, Brazil(巴西普埃布拉联邦大学) University of Oxford, UK(牛津大学(英国)) Saarland University, Germany(萨尔大学(德国)) Universidade Federal do Rio Grande do Sul, Brazil(巴西里约格兰德 do 南大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 研究利用大语言模型为层次任务网络规划生成搜索启发式,通过Pytrich规划器在六个基准领域评估,结果表明LLM生成的启发式在覆盖度上接近最优HTN规划器,并在83%的共享问题上显著减少搜索开销。

Comments 9 pages, 3 figures; submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08013 2026-05-29 cs.AI 79%

Small Agent Group is the Future of Digital Health

小型智能体群是数字健康的未来

Yuqiao Meng, Luoxi Tang, Dazheng Zhang, Rafael Brens, Elvys J. Romero, Nancy Guo, Safa Elkefi, Zhaohan Xi

机构 * State University of New York at Binghamton(纽约州立大学布inghamton分校) University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 本文提出小型智能体群(SAG)通过协作推理替代单一大型模型,在数字健康中实现更优的有效性、可靠性和部署效率。

Comments ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28454 2026-05-28 cs.AI 79%

GONDOR to the Rescue: Satisficing Planning with Low Memory

GONDOR 救援:低内存下的满意规划

Yonatan Vernik, Alexander Tuisov, Alexander Shleyfman

机构 * Computer Science Department, Bar-Ilan University(巴伊兰大学计算机科学系) Independent Researcher(独立研究员)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出 GONDOR 算法,通过周期压缩搜索树并保留稀疏锚点状态,在严格内存限制下扩展 GBFS,实现低内存预算下的满意规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27873 2026-05-28 cs.AI 79%

AIBuildAI-2: A Knowledge-Enhanced Agent for Automatically Building AI Models

AIBuildAI-2:一种用于自动构建AI模型的知识增强智能体

Ruiyi Zhang, Peijia Qin, Qi Cao, Li Zhang, Pengtao Xie

机构 * Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) Department of Medicine, University of California San Diego(加州大学圣地亚哥分校医学系)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 针对现有自动构建AI模型的智能体因依赖大语言模型静态参数知识而性能受限的问题,提出AIBuildAI-2,通过引入分层、可进化的外部知识系统,动态加载相关上下文,实现设计决策的专家知识支撑,在MLE-Bench上取得70.7%奖牌率并在心脏病预测竞赛中排名前6.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27724 2026-05-28 cs.RO cs.AI 79%

HumanoidMimicGen: Data Generation for Loco-Manipulation via Whole-Body Planning

HumanoidMimicGen: 通过全身规划生成行走操作数据

Kevin Lin, Ajay Mandlekar, Caelan Reed Garrett, Nikita Chernyadev, Yu Fang, Runyu Ding, Yuqi Xie, Justin Tran, Linxi Fan, Yuke Zhu

机构 * NVIDIA The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出HumanoidMimicGen方法,通过全身规划自动生成人形机器人行走操作演示数据,在模拟基准上使联合训练的策略性能提升20%。

Comments website: https://humanoidmimicgen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27703 2026-05-28 cs.AI 79%

Hierarchical Prompt-Domain Control and Learning for Resource-Constrained Agentic Language Models

面向资源受限智能体语言模型的分层提示域控制与学习

Joan Vendrell Gallart, Russell Bent, Michael Grosskopf

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 提出分层控制与学习框架,通过蒸馏学习输出模式、在线监控与提示域控制,解决资源受限下智能体语言模型的可靠性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27375 2026-05-28 cs.CL 79%

LCO: LLM-based Constraint Optimization for Safer Agentic LLMs in Real-world Tasks

LCO:基于LLM的约束优化,用于现实任务中更安全的智能体LLM

Jiayong Wan, Jiawei Chen, Zhaoxia Yin, Liu Shuyuan, Hang Su

机构 * East China Normal University(东华大学) Beijing Zhongguancun Academy(北京中关村学院) Tsinghua University(清华大学)

专题命中 规划决策 :agentic(title);autonomous agent(abstract);分类 cs.CL

AI总结 提出LCO框架,通过自思考模块和进化采样模块约束LLM行为,在不微调模型的情况下减少上下文奖励黑客行为,实验表明在输出优化和策略优化场景中显著提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10325 2026-05-28 cs.AI 79%

Verifiable Process Rewards for Agentic Reasoning

可验证过程奖励用于智能体推理

Huining Yuan, Zelai Xu, Huaijie Wang, Xiangmin Yi, Jiaxuan Gao, Xiao-Ping Zhang, Yu Wang, Chao Yu, Yi Wu

机构 * Tsinghua University(清华大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 提出可验证过程奖励(VPR)框架,通过符号或算法预言机将密集的中间步骤验证转化为强化学习的逐轮监督信号,解决长程智能体推理中的信用分配问题,并在搜索、约束和后验验证三种场景中验证其有效性。

Comments Corrected minor typos and LLM-assisted data extraction errors. The main conclusions are unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏