arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 93944 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 35728 篇

2103.03359 2021-05-04 cs.AI cs.LG cs.MA cs.NE 80%

Cognitive Homeostatic Agents

Amol Kelkar

专题命中 规划决策 :autonomous agent(abstract,journal_ref);agent(abstract);planning(abstract);分类 cs.AI、cs.LG

Comments Accepted at AAMAS2021 Blue Sky Ideas Track

Journal ref In Proc. of the 20th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2021), Online, May 3-7, 2021, IFAAMAS, 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27225 2026-08-28 cs.RO cs.AI 新提交 79%

STEP: State-Aware Task Estimation and Planning with Multi-Modal LLMs for Human-Robot Collaboration

STEP:基于多模态大语言模型的状态感知任务估计与规划,用于人机协作

Maitrey Gramopadhye, Prakash Baskaran, Xiao Liu, Songpo Li, Soshi Iba

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Honda Research Institute(本田研究所)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型用于人机协作任务规划时的状态理解缺失问题,提出STEP方法,在机器人装配模拟任务中使动作可执行性提升32.8%、最终状态误差降低14.8%。

Comments Published in IEEE International Conference on Robot and Human Interactive Communication (RO-MAN), 2026, 8 pages, 4 figuers, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27219 2026-08-28 cs.CL 新提交 79%

BALMS: Benchmarking Agentic LLMs for Longitudinal Mental Health Sensing

BALMS:面向纵向心理健康感知的智能体大语言模型基准测试

Yu Yvonne Wu, Arvind Pillai, Yuliang Chen, Yuwei Zhang, Sudarshan Regmi, Tess Z. Griffin, Michael V. Heinz, Lisa A. Marsch, Nicholas C. Jacobson, Andrew Campbell

机构 * Dartmouth College(达特茅斯学院) University of Cambridge(剑桥大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.CL

AI总结 该研究提出首个面向纵向心理健康感知的智能体大语言模型基准BALMS,经多数据集、任务与主干评估发现零样本智能体表现有限,思维链提示有提升但存不足,凸显了对特定智能体的需求。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25531 2026-08-28 cs.CL 版本更新 79%

ClueWeaver: Reward-Guided Dual-Agent Evidence Reasoning for Compact LLMs on Literary Long Narratives

ClueWeaver:面向紧凑型大语言模型的、针对文学长篇叙事的奖励引导双智能体证据推理框架

Jihao Zhu, Zhiwei Yang, Wenxiao Zhang, Junqian Zhao, Qi You, Fangqi Wang, Zheyuan Deng, Hanzhe Yang, Yu Liu, Jin B. Hong

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) University of Aberdeen(阿伯丁大学) The University of Western Australia(西澳大学) Brown University(布朗大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.CL

AI总结 ClueWeaver是用于紧凑型本地模型的双智能体证据推理框架,可提升本地语言模型在长篇叙事问答与声明验证任务中的性能,提供可检查的证据推理轨迹。

Comments Accepted by ICONIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15763 2026-08-28 cs.CL 版本更新 79%

Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report

TaoLive数字虚拟人智能体技术报告:训练智能体随其Harness进化

TaoLive AIGC LLM Team, Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu, Meiguang Jin, Junfeng Ma, Weihang Pan, Jiaxin Zhao, Zulong Chen

机构 * TaoLive(陶境科技)

专题命中 规划决策 :agent(title);tool use(abstract);分类 cs.CL

AI总结 本研究针对直播电商数字虚拟人主播的实时需求,提出HAT方法,结合HSA的三阶段训练,使35B紧凑模型在低延迟下适配Harness变化,性能优于基础模型及通用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16514 2026-08-28 cs.RO cs.AI 版本更新 79%

No Plan, Yet Human: A Reactive Robotics Model Predicts Human Planning Failures on a Clinical Task

无计划,却有人类:一种反应式机器人模型预测临床任务中人类计划失败

Michael Migacev, Vito Mengers, Antonia Köngeter, Oliver Brock

机构 * Robotics and Biology Laboratory, Technische Universität Berlin, Germany(技术大学柏林机器人与生物学实验室,德国) Science of Intelligence, Research Cluster of Excellence, Berlin, Germany(智能科学,卓越研究集群,柏林,德国) Robotics Institute Germany(德国机器人研究所)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 该研究利用反应式梯度下降框架AICON,通过塔罗伦敦测试揭示人类计划能力下降时的反应模式,发现其能更准确预测24个问题的难度排序,并在留出验证中表现优异,揭示了生物系统组织方式的普遍规律。

Comments Accepted at SAB26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25641 2026-08-27 cs.RO cs.AI 新提交 79%

Leveraging Inter-object Affordances for Efficient Planning in Contact-rich Tasks

利用物体间可供性实现接触密集型任务的高效规划

Pouya P. Niaz, Justus Piater, Alejandro Agostini

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对传统TAMP方法在接触密集型任务中规划时间长、成功率低的问题,提出结合VLM与U-TAMP的方法,在模拟厨房场景中实现了更高的规划成功率与更快的规划速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16287 2026-08-27 cs.LG 版本更新 79%

SCALE: State-Calibrated Latent Embeddings for JEPA Planning in the Right Geometry

SCALE:用于正确几何空间中JEPA规划的状态校准潜在嵌入

Jiaming Hu, Yan Zheng, Tian Wang

机构 * Boston University(波士顿大学) Unity Technologies(Unity科技公司)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 该研究提出SCALE正则化器,为LeWM表示校准几何属性,在多任务、多求解器和多计算预算下均提升规划性能,证明规划依赖信息对几何的塑造作用。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24870 2026-08-26 cs.AI 新提交 79%

SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL

SPO++:面向异步智能体强化学习的流对齐策略优化

Kai Ruan, Jinghao Lin, Qianshan Wei, Ziqi Zhou, Zihe Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Duke University(杜克大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 规划决策 :agentic(title);tool-use(abstract);分类 cs.AI

AI总结 SPO++通过标准化终端结果优势、按策略事件组织提示证据优化SPO,在ALFWorld和Math-TIR上提升异步智能体强化学习的在线学习效率,动作token测度归一化是其核心有效组件。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24022 2026-08-26 cs.CR cs.AI 新提交 79%

What Guides the Agent? Adjudicating Unauthorized Behavior via Localizing Behavior-Guiding Instructions

智能体的决策依据是什么?通过定位行为引导指令来裁决未授权行为

Yichao Gao, Yumo Zhang, Yunhao Yao, Haohua Du, Puhan Luo, Ruiqi Li, Zhiqiang Wang

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 针对LLM智能体易受动态注入攻击的问题,提出Attnlocate框架,通过目标检测定位行为引导指令以裁决未授权行为,在多场景下表现优异且可跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23956 2026-08-26 cs.AI 新提交 79%

Recursive Agentic Reasoning

递归智能体推理

Shengxin Zhang, Xiaomin Wu, Xiyang Wu, Jing Xie

机构 * Google(谷歌) University of Maryland(马里兰大学)

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文将测试时推理方法统一为递归算子,通过共享框架对比发现BRANCH算子在多场景下提升准确率,且配对评估是测试时计算评估的标准协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10059 2026-08-26 cs.AI 版本更新 79%

Strategic Exploitation in LLM Agent Markets: A Simulation Framework for E-Commerce Trust

LLM代理市场中的战略利用:电子商务信任的模拟框架

Shijun Lei, Quang Nguyen, Swapneel S Mehta, Zeping Li, Huichuan Fu, Xiaolong Zheng, Siki Chen, Yunji Liang, Philip Torr, Zhenfei Yin

机构 * Northwestern Polytechnical University(西北工业大学) Boston University(波士顿大学) Fudan University(复旦大学) Wuhan University(武汉大学) Chinese Academy of Sciences(中国科学院) University of Oxford(牛津大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 本文提出TruthMarketTwin模拟框架,用于研究LLM代理在电子商务市场中的行为,发现LLM代理在传统市场中会利用声誉治理的弱点,而强制执行可减少欺骗并重塑战略推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23197 2026-08-26 cs.RO cs.AI 版本更新 79%

Balancing Safety and Optimality in Robot Path Planning: Algorithm and Metric

在机器人路径规划中平衡安全性和最优性:算法与度量

Jatin Kumar Arora, Soutrik Bandyopadhyay, Sunil Sulania, Shubhendu Bhasin

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出统一路径规划算法UPP,通过自适应启发式加权动态平衡安全与最优性,引入OptiSafe指标评估,实验证明在复杂环境中性能优于现有方法。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22449 2026-08-25 cs.RO cs.AI 新提交 79%

EMPIRE: Explicit Manipulation Planning as a Learnable Intermediate Representation for Egocentric Hand-Motion Forecasting

EMPIRE:将显式操作规划作为可学习中间表征用于自我中心视角下手运动预测

Wen Wang, Ruibing Hou, Hong Chang, Shiguang Shan, Xilin Chen

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对现有手运动预测方法忽略操作过程、梯度干扰的问题,提出两阶段框架EMPIRE,构建EMPIRE-651K数据集,实现了更优的手运动预测精度。

Comments 14 pages, 10 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22237 2026-08-25 cs.AI 新提交 79%

Read Less, Solve More: Token-Efficient Sparse Reading for AI Agents

少读多解:面向智能体的令牌高效稀疏阅读

Zedong Liu, Jiaan Wu, Xinyang Ma, Le Xu, Kai Wang, Yuanchao Hu, Dingwen Tao, Guangming Tan

专题命中 规划决策 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 针对智能体过度阅读导致的成本高、证据稀释问题,提出无需训练的SparseRead阅读层,可减少92.9%令牌量、89.0%耗时,且在多模型、多场景下保持或提升任务质量,可移植性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21897 2026-08-25 cs.AI 新提交 79%

From Solver Feedback to Faithful Plans: Multi-Role Reinforcement Learning for Symbolic Planning

从求解器反馈到可信规划:用于符号规划的多角色强化学习

Chenghao Zhang, Yikai Mao, Shanqi Liu, Haoyu Gao, SaiSai Hu, Dan Roth

机构 * University of Pennsylvania(宾夕法尼亚大学) Georgia Institute of Technology(佐治亚理工学院) Pace University(佩斯大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 该研究提出基于求解器的多角色强化学习框架,仅用求解器反馈实现无人工演示的自然语言转PDDL,在PlanBench上显著提升规划成功率与可信性,降低语义漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21440 2026-08-25 cs.RO cs.AI 新提交 79%

Geo-VLA: Geometry-Aware Vision-Language-Action Planning via Internalization of Map Semantics

Geo-VLA:通过内化地图语义实现几何感知的视觉-语言-动作规划

Ran Chen, Jiaxing Ren, Zhikun Zhang, Yunhao Hou, Junbao Zhuo, Bochao Zou

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对VLA模型在复杂驾驶场景中规划性能不足的问题,提出可即插即用的Geo-VLA框架,结合自研Geo-QA数据集,在NAVSIM v1上实现单目VLA规划器的新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14354 2026-08-25 cs.AI 版本更新 79%

ScienceFlow: A long-horizon agent for ML research, scientific discovery and beyond

ScienceFlow:面向机器学习研究、科学发现及更广泛领域的长时智能体

Mingming Zhao, Jiqian Dong, Kangping Xu, Zadid Hasan, Chengrui Fan, Shan Jiang, Shuai Mao, Yating Ling, Linyi Zou, Tailin Zhou, Yun Hin Chan, Wenkai Zhang, Zhanhong Zhou, Guowei Huang, Hongliang Li, Wenjing Cun, Zhitang Chen, Mingxuan Yuan, Yanhui Geng

机构 * Noah’s Ark Lab, Huawei(华为诺亚方舟实验室)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 ScienceFlow是一款端到端自主研究智能体框架,通过ESTRA机制与证据感知执行控制器实现长时研究的状态管理与资源分配,在24小时预算内的MLE-bench基准测试中取得70.22%的Any-Medal最优分数,为长时自主研究提供了有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13433 2026-08-25 cs.RO cs.AI 79%

Spatially Grounded Long-Horizon Task Planning in the Wild

在真实环境中进行具有长时域的任务规划

Sehun Jung, HyunJee Song, Dong-Hee Kim, Reuben Tan, Jianfeng Gao, Yong Jae Lee, Donghyun Kim

机构 * Korea University(韩国大学) Microsoft Research(微软研究院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于空间的规划任务,引入了GroundedPlanBench基准,评估机器人在真实环境中的长时域动作规划能力,并通过V2GP框架提升空间接地规划性能。

Comments 9 pages, 7 figures

Journal ref 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21204 2026-08-24 cs.RO cs.LG 新提交 79%

Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning

超越模仿:基于离线Q规划的机器人策略自改进

Varun Giridhar, Anant Khandelwal, Jeremy A. Collins, Ignat Georgiev, Animesh Garg

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 该研究提出Q规划方法,为大型视觉运动BC策略配备离线Q函数,通过仅微调Q函数实现自改进,在仿真和真实机器人任务中均显著提升机器人操作性能,且优于多种对比方法。

Comments Project page with videos: https://varungiridhar.github.io/qplanning/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21186 2026-08-24 cs.LG 新提交 79%

A Neurosymbolic Approach for Constructing Planning Domain Models from Clinical Narratives

一种从临床叙事构建规划领域模型的神经符号方法

Ranveer Singh, Saurabh Mathur, Michael Skinner, Prasad Tadepalli, Kristian Kersting, Sriraam Natarajan

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 针对临床叙事难以构建外科手术概率规划模型的问题,提出神经符号框架NSPIN,结合预训练LLM从2660份阑尾切除术记录生成的模型可泛化且符合临床实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21157 2026-08-24 cs.DC cs.AI 新提交 79%

HIERA: Workload-Aware Planning Across Implementation Spaces for GPU Kernel Optimization

HIERA:面向GPU内核优化的跨实现空间工作负载感知规划

Jinghao Wang, Qiqi Gu, Chenpeng Wu, Jianguo Yao, Haibing Guan, Xijun Li

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 HIERA是一种跨实现空间的GPU内核优化分层规划框架,在KernelBench实验中优于无训练方法,还在科学计算模板算子上实现1.53倍加速,无需额外训练即可接近CUDA-L1性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20510 2026-08-24 cs.AI 新提交 79%

A Temporal Planning Approach for Intelligent Flood Response

面向智能防洪响应的时序规划方法

Fazlul Hasan Siddiqui, Md. Monjurul Islam, Sabah Binte Noor

机构 * Dhaka University of Engineering & Technology(达卡工程技术大学) Bangladesh Army University of Engineering & Technology(孟加拉国陆军工程技术大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本研究提出一种智能防洪响应框架,利用时序规划技术建模防洪响应全生命周期,整合多类关键要素并支持执行中重规划,通过两种规划语言表述,实验验证其可行性与可扩展性并指导规划器选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27204 2026-08-24 cs.CR cs.SE 版本更新 79%

MalSkills: Detecting Malicious Skills in the Agentic Supply Chain via Neuro-symbolic Reasoning

我的爱,华生。通过神经符号推理跨异构工件检测恶意技能

Shenao Wang, Junjie He, Yanjie Zhao, Yayi Wang, Kan Yu, Haoyu Wang

专题命中 规划决策 :agentic(title,abstract);分类 cs.SE

AI总结 本文提出MalSkills框架,通过符号解析与LLM语义分析提取异构工件中的安全敏感操作,构建技能依赖图并进行神经符号推理,实现恶意技能检测,实验表明其在F1得分上优于现有方法。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20237 2026-08-21 cs.AI 新提交 79%

Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models

面向多模态大语言模型的符合规则的视觉空间规划

Yu Chen, Ting Lei, Yaoyi Li, Jia Cai, Zhecen Wu, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) Yinwang Intelligent Technology Co., Ltd(银湾智能科技有限公司)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型的规则遵循空间规划问题,构建了RuleMaze基准,提出语言-逻辑-函数混合方法和解耦多模态规划(DMP),提升了规则遵循度与规划成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19842 2026-08-21 cs.AI 新提交 79%

SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning

SAPO:用于智能体强化学习的单回滚自回归策略优化

Dayang Liang, Lang Feng, Bo An, Yunlong Liu

机构 * Xiamen University(厦门大学) Nanyang Technological University(南洋理工大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 本研究针对智能体强化学习现有方法的三大局限,提出SAPO框架,其共享策略与价值函数的自回归主干,结合广义优势估计器,在ALFWorld、WebShop任务上性能优于PPO和GRPO,内存与计算效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15654 2026-08-21 cs.RO cs.AI 版本更新 79%

PO-PDDL: Learning Symbolic POMDPs from Visual Demonstrations for Robot Planning Under Uncertainty

PO-PDDL: 从视觉演示中学习符号化POMDP以实现不确定性下的机器人规划

Wenjing Tang, Xuanjin Jin, Yuan Liu, Renming Huang, Cewu Lu, Panpan Cai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出PO-PDDL符号化POMDP框架,通过从机器人执行视频中重建潜在状态轨迹、识别部分可观测性并学习随机转移与观测模型,实现不确定性下的鲁棒任务规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21874 2026-08-21 cs.RO cs.AI 版本更新 79%

A Physics-Informed Neural Network Approach for UAV Path Planning in Dynamic Environments

动态环境下无人机路径规划的物理信息神经网络方法

Shuning Zhang

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 针对动态环境下无人机路径规划问题,提出PINN框架,将动力学等约束嵌入学习,仿真显示其在多指标上优于A*等传统方法,可统一模型与数据驱动规划。

Comments Withdrawn due to a substantive methodological error that affects the main conclusions of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18846 2026-08-20 cs.AI 新提交 79%

ORBITER: Conflict-Aware Decision-Making for Agentic Last-Mile Delivery

ORBITER:面向智能体的最后一公里配送的冲突感知决策方法

Mingzhao Li, Chenxi Liu, Yan Zhao, Hao Miao

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 本文针对最后一公里配送决策的可解释性与可靠性问题,提出ORBITER框架,结合LLM与结构化决策机制,在四城市数据上较最优基线平均提升9.2%,验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18682 2026-08-20 cs.AI 新提交 79%

RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training

RTPO:用于稳定智能体强化学习训练的反向回合策略优化

Yugu Li, Jimmy Cao, Jianglin Qiao, Siyi Hu

机构 * Adelaide University(阿德莱德大学) The University of Sydney(悉尼大学) Curtin University(科廷大学) School of CSIT(计算机科学与信息技术学院) ACFR(澳大利亚空间研究中心) School of EECMS(电子工程、计算机与数学科学学院)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 针对多回合智能体RL训练不稳定问题,提出RTPO方法,通过反向回合策略优化消除上下文不匹配与异步漂移,实验显示其较基线提升21.50%、10.76%。

详情

展开后加载摘要…

URL PDF HTML 收藏