SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning
SRPO:用于长程推理的自反思策略优化
机构 * School of artificial intelligence, Wuhan University(武汉大学人工智能学院) ; School of computer science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) ; Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所)
AI总结 本研究提出 SRPO 框架,将人类的自反思能力内化到 LLMs 中,无需额外模型即可将稀疏监督转化为密集训练信号,在数学推理等基准上以高数据效率取得了最先进性能。
Comments Accepted to ICML 2026