发表机构
LandSpace Technology Co.,Ltd.; Shanghai Jiao Tong University(蓝箭航天空间科技股份有限公司; 上海交通大学)
机构由 AI 辅助整理,请以论文原文为准。AI 中文总结
DynaForge提出规划引导的残差学习框架,结合全局规划与残差策略生成动态操作演示,将成功率从41.30%提升至78.37%,并显著优于DOMINO基线。
AI 中文摘要
动态物体操作对于在真实环境中运行的机器人至关重要,然而生成高质量演示的方法仍然有限。为静态任务设计的方法不易迁移到动态场景。在动态演示生成器中,基于规划的方法在接触附近可能失败,而DOMINO风格的重放简化了动态交互,可能限制策略学习可用的经验。我们提出DynaForge,一个规划引导的框架,学习用于动态操作演示生成的残差校正。DynaForge结合了跨任务阶段的低频全局规划与高频以物体为中心的逆运动学,并应用残差策略在动态交互期间校正动作。一种隐式课程将回放按匹配条件分组,并选择混合成功组,将残差强化学习聚焦于不断发展的能力前沿。在Can和Bottle任务上,在相同的名义环境步预算下,它使用的优化器步数仅为普通GRPO的0.73倍,同时观察到更高的最终成功率。在九个仿真任务中,DynaForge将平均演示生成成功率从规划先验的41.30%提升至78.37%。每个任务使用800个演示时,在DynaForge数据上训练的DP3策略达到49.11%的平均成功率,而DOMINO数据仅为7.07%。在三个真实世界动态任务中,DynaForge训练的策略达到30-60%的成功率,而DOMINO训练的策略仅为0-10%,展示了DynaForge的仿真到现实迁移能力。
英文摘要
Dynamic object manipulation is essential for robots operating in real-world environments, yet methods for generating high-quality demonstrations remain limited. Methods designed for static tasks do not readily transfer to dynamic settings. Among dynamic demonstration generators, planning-based methods can fail near contact, while DOMINO-style replay simplifies dynamic interactions and may limit the experience available for policy learning. We present DynaForge, a planning-guided framework that learns residual corrections for dynamic manipulation demonstration generation. DynaForge combines low-frequency global planning with high-frequency object-centric inverse kinematics across task phases, and applies a residual policy to correct actions during dynamic interaction. An implicit curriculum groups rollouts under matched conditions and selects mixed-success groups, focusing residual reinforcement learning on the evolving competence frontier. On Can and Bottle, it uses 0.73x as many optimizer steps as vanilla GRPO at the same nominal environment-step budget, with higher observed final success rates. Across nine simulation tasks, DynaForge increases mean demonstration-generation success from 41.30% of the planning prior to 78.37%. With 800 demonstrations per task, DP3 policies trained on DynaForge data achieve 49.11% mean success, compared with 7.07% for DOMINO data. On three real-world dynamic tasks, DynaForge-trained policies achieve 30-60% success, compared with 0-10% for DOMINO-trained policies, showing the ability of DynaForge for sim-to-real transfer.
Comments8 pages, 6 figures. Under review