Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning
基于思维图的奖励进化:一种用于强化学习的双层语言模型框架
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Tokyo(东京大学)
AI总结 本文提出RE-GoT框架,结合LLM与VLM的图思维推理,通过任务分解和视觉反馈迭代优化奖励函数,实验表明在RoboGen和ManiSkill2任务中均优于现有方法。
Journal ref IEEE International Conference on Robotics and Automation (ICRA 2026)