Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future
专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);preference optimization(abstract)
Comments 12 pages, 5 figures
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);preference optimization(abstract)
Comments 12 pages, 5 figures
专题命中 后训练与偏好优化 :large language model(title);language model(title);分类 cs.CL
机构 * University of Arkansas at Little Rock(阿拉伯塔大学拉夫洛克分校)
专题命中 后训练与偏好优化 :foundation model(title,abstract);分类 cs.AI、cs.LG
Comments Published in the Proceedings of the 2025 3rd International Conference on Robotics, Control and Vision Engineering (RCVE'25). 6 pages, 3 figures, 1 table
Journal ref RCVE'25: Proceedings of the 2025 3rd International Conference on Robotics, Control and Vision Engineering
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Xi’an Jiaotong University(西安交通大学) ; Peking University(北京大学) ; Yale University(耶鲁大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG
机构 * Lenovo Research(联想研究) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tsinghua University(清华大学) ; Beijing Jiaotong University(北京交通大学) ; Shandong University(山东大学)
专题命中 后训练与偏好优化 :language model(abstract)