2601.22448
2026-07-10
cs.LG
cs.CL
版本更新
HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning
HeaPA:用于大语言模型强化学习的难度感知堆采样和策略内查询增强
Weiqi Wang, Xin Liu, Binxuan Huang, Hejie Cui, Rongzhi Zhang, Changlong Yu, Shuowei Jin, Jingfeng Yang, Qingyu Yin, Zhengyang Wang, Zheng Li, Yifan Gao, Priyanka Nigam, Bing Yin, Lihong Li, Yangqiu Song
机构
*
Stores Foundational AI, Amazon Inc.(亚马逊公司基础人工智能部)
;
Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系)
AI总结
研究大语言模型强化学习中提示采样问题,提出HeaPA方法,通过难度感知堆采样和策略内查询增强,维持动态提示池,跟踪能力前沿,在多数据集和基准测试中提升准确率,减少计算量,尤其在中大型模型规模下效果显著。