RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training
机构 * Peking University(北京大学)
专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
机构 * Peking University(北京大学)
专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Cornell University(康奈尔大学) ; University of Washington(华盛顿大学)
专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);language model(abstract);分类 cs.CL、cs.LG
机构 * Noah’s Ark Lab, Huawei Technologies Ltd.(华为技术有限公司诺亚实验室) ; Chandar Research Lab(昌达研究实验室) ; Mila – Quebec AI Institute(魁北克AI研究院) ; Université de Montréal(蒙特利尔大学) ; Polytechnique Montréal Canada(蒙特利尔理工学院加拿大) ; CIFAR AI Chair(CIFAR人工智能主席)
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)
机构 * National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Eastern Institute of Technology(东方技术研究所)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);SFT(abstract);分类 cs.CL
Comments Accepted by ACM MM 2025
机构 * Johns Hopkins University(约翰霍普金斯大学) ; St. Jude Children’s Research Hospital(圣犹大儿童研究医院)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG
专题命中 后训练与偏好优化 :LLM(abstract)