RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use
机构 * RLFactory Team(RLFactory团队)
专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);large language model(abstract);language model(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
机构 * RLFactory Team(RLFactory团队)
专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);large language model(abstract);language model(abstract)
机构 * Sorbonne Université, CNRS, ISIR(索邦大学、国家科学研究中心、ISIR) ; FEE CTU(捷克技术大学电子工程系) ; CIIRC CTU Prague(捷克技术大学普拉格研究所) ; Institut universitaire de France (IUF)(法国国家科学院)
专题命中 后训练与偏好优化 :post-training(title,abstract)
Comments Accepted to ICCV 2025
机构 * Principled Evolution(原则进化)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 53 pages, 7 figures, 8 tables. Open-source implementation available at: https://github.com/Principled-Evolution/argen-demo. Work explores the integration of policy-as-code for AI alignment, with a case study in culturally-nuanced, ethical AI using Dharmic principles
机构 * Columbia University(哥伦比亚大学)
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG