Greedy Sampling Is Provably Efficient for RLHF
机构 * Electrical and Computer Engineering University of Virginia(电气与计算机工程大学弗吉尼亚大学) ; Princeton Language and Intelligence Princeton University(普林斯顿语言与智能普林斯顿大学)
专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)
Comments NeurIPS 2025