Counterfactual Reasoning and Environment Design for Active Preference Learning
主动偏好学习的反事实推理与环境设计
AI总结 研究机器人主动偏好学习中现有方法的不足,提出CRED方法,通过联合优化环境设计和轨迹选择,利用反事实推理生成轨迹,经实验验证该方法能改善奖励学习并在不同环境有效泛化。
Comments RSS 2025 Workshop on Human-in-the-Loop Robot Learning: Teaching, Correcting, and Adapting