Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);prompting(abstract)
Comments Accepted to ACL 2025 (Main)
机构 * Tsinghua University(清华大学) ; Meituan(美团) ; Northeastern University(东北大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Meta AI ; Wuhan University(武汉大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);SFT(abstract);分类 cs.AI
专题命中 后训练与偏好优化 :preference optimization(abstract)