ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning
ODYSSE:用于个性化智能体推理的逐情节策略优化
机构 * The University of Queensland(昆士兰大学) ; Griffith University(格里菲斯大学)
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI
AI总结 研究个性化智能体推理问题,提出基于强化微调框架ODYSSE,核心方法是逐情节GRPO,通过情节级奖励机制等解决长动作跨度等问题,经实验验证其在个性化GUI推理任务中优于其他模型,有效提升个性化智能体推理能力。