Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control
基于漂移的策略优化:面向在线机器人控制的原生一步生成策略
机构 * University of Science and Technology of China(中国科学技术大学) ; iFLYTEK
AI总结 本文提出一种原生一步生成策略框架,通过将迭代细化移至训练阶段,提升在线机器人控制的效率与稳定性,实验显示其在推理速度和性能上优于多步扩散策略。