On the Convergence of Self-Improving Online LLM Alignment
关于自改进在线大语言模型对齐的收敛性
机构 * The University of Hong Kong(香港大学) ; Yale University(耶鲁大学) ; Purdue University(普渡大学)
专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI、cs.LG
AI总结 针对SAIL算法收敛性分析缺失的问题,提出SAIL-RevKL正则化目标,证明其满足PL条件并实现近线性样本复杂度,在MuJoCo和LLM对齐任务上优于原始SAIL。
Comments Accepted at UAI 2026