RLAC: Reinforcement Learning with Adversarial Critic for Free-Form Generation Tasks
机构 * Shanghai Jiao Tong University(上海交通大学) ; UC Berkeley(加州大学伯克利分校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
Comments Project page: https://mianwu01.github.io/RLAC_website/