Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference
回顾性工具优化:通过轨迹回滚上的自我偏好改进LLM智能体
机构 * City University of Hong Kong(香港城市大学) ; Microsoft Research Asia(微软亚洲研究院)
AI总结 提出一种自监督方法RHO,利用历史轨迹回滚和自偏好选择优化智能体工具集,无需真实标签,在SWE-Bench Pro上通过单轮优化将通过率从59%提升至78%。
Comments Code: https://github.com/wbopan/retro-harness ; Project website: https://paper-rho.wenbo.io