Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents
语义一致性策略优化:用于LLM智能体强化学习
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 针对基于组的强化学习中语义一致的中间步骤因轨迹成败获得相反信用的问题,提出无价值奖励塑造方法SCPO,通过从组内成功兄弟步骤恢复信用,在ALFWorld和WebShop上达到93.7%和74.8%的成功率。
Comments 16 pages, 7 figures, 5 tables. Under review at EMNLP 2026