Base Models Beat Aligned Models at Randomness and Creativity
机构 * Stanford University(斯坦福大学) ; University of British Columbia(不列颠哥伦比亚大学)
专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);分类 cs.CL
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
机构 * Stanford University(斯坦福大学) ; University of British Columbia(不列颠哥伦比亚大学)
专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);分类 cs.CL
机构 * FAIR at Meta(Meta旗下的FAIR)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.LG
机构 * Renmin University of China(中国人民大学) ; Gaoling School of Artificial Intelligence(甘肃学校人工智能学院) ; University of Toronto(多伦多大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI
机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, Guangdong(科学与工程学院,香港中文大学(深圳)) ; Alibaba Group(阿里巴巴集团) ; School of Engineering, Westlake University(工程学院,西湖大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI
机构 * Shanghai AI Lab(上海AI实验室)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI
机构 * Meituan(美团)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
Comments Work In Progress
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
Comments Published at the Thirteenth International Conference on Learning Representations (ICLR 2025)
机构 * Virginia Tech(弗吉尼亚理工大学) ; Amazon(亚马逊公司)
专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.LG
Comments Data-Centric Human Preference with Rationales for Direct Preference Alignment
专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.AI
Comments We are withdrawing this paper because the main contributions and methodology have significantly changed after further research and experimental updates. The current version no longer reflects our results and main contribution / topic
机构 * University of Waterloo(滑铁卢大学)
专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.AI
Comments 9 pages, 3 figures, accepted to the IJCAI 2025 Human-Centred AI track. Project repository at: https://osf.io/8yxf2/
机构 * Tsinghua University(清华大学) ; The University of Texas at Austin(得克萨斯大学) ; NVIDIA(英伟达)
专题命中 后训练与偏好优化 :pretraining(abstract);preference optimization(abstract);分类 cs.LG
Comments ICML 2025 Spotlight Project Page: https://research.nvidia.com/labs/dir/ddo/ Code: https://github.com/NVlabs/DDO
机构 * Department of Computer Science, National University of Singapore(计算机科学系,新加坡国立大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
Comments ACL 2025
机构 * Brandeis University(布兰迪斯大学) ; Colorado State University(科罗拉多州立大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
Comments 11 pages, 2 figures, 2 tables, CoNLL 2025
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
机构 * Meituan Inc.(美团公司) ; National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) ; Pennsylvania State University(宾夕法尼亚大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanjing University(南京大学) ; Fudan University(复旦大学) ; Nanyang Technological University(南洋理工大学)
专题命中 后训练与偏好优化 :language model(abstract);instruction tuning(abstract);分类 cs.CL
Comments ACL 2025 Findings
专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
Comments Code and data: https://github.com/minnesotanlp/mpo
机构 * Department of Computer Science University of Texas at Dallas(计算机科学系 德克萨斯大学达拉斯分校)
专题命中 后训练与偏好优化 :LLM(abstract);prompting(abstract);分类 cs.CL
Journal ref https://aclanthology.org/2025.coling-main.73/
机构 * Department of Automation, Tsinghua University(清华大学自动化系) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 后训练与偏好优化 :pretraining(abstract);preference optimization(abstract);分类 cs.AI
Comments IJCAI 2025
机构 * Beijing Electronic Science and Technology Institute(北京电子科学技术研究所)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG
Comments Data- and Model-aware Reward Learning for Data Extraction. arXiv admin note: substantial text overlap with arXiv:2503.18991
机构 * CASIA(中国科学院自动化研究所) ; THU(清华大学) ; KuaiShou(快手) ; NJU(南京大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
Comments Home page: https://github.com/yfzhang114/r1_reward
专题命中 后训练与偏好优化 :LLM(abstract);SFT(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.LG
Comments 16 pages, 7 figures
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
Comments 33 pages, 5 figures, 28 tables
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
Comments 28 pages, 6 figures, 21 tables