Freeform Preference Learning for Robotic Manipulation
自由形式偏好学习用于机器人操作
机构 * Stanford University(斯坦福大学)
AI总结 提出自由形式偏好学习(FPL),通过自然语言定义偏好轴并学习语言条件奖励模型,在长时域操作任务中比稀疏奖励和二元偏好方法提升38个百分点,支持行为组合与测试时策略引导。
作者
Robotics / Machine Learning
自由形式偏好学习用于机器人操作
机构 * Stanford University(斯坦福大学)
AI总结 提出自由形式偏好学习(FPL),通过自然语言定义偏好轴并学习语言条件奖励模型,在长时域操作任务中比稀疏奖励和二元偏好方法提升38个百分点,支持行为组合与测试时策略引导。