arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-12 至 2025-12-12 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 5 篇

2512.10040 2025-12-12 cs.LG cs.AI stat.ML 86%

Intelligently Weighting Multiple Reference Models for Direct Preference Optimization of LLMs

智能加权多个参考模型以直接优化大语言模型的偏好

Skyler Wu, Aymen Echarghaoui

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出四种新的加权策略以优化大语言模型的偏好,发现单参考DPO在多数情况下优于多参考方法。

Comments Working paper. 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10601 2025-12-12 cs.LG 85%

Multi-Objective Reward and Preference Optimization: Theory and Algorithms

多目标奖励与偏好优化:理论与算法

Akhil Agnihotri

专题命中 后训练与偏好优化 :preference optimization(title);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本论文提出多目标约束优化算法MOPO,通过理论与算法结合,提升约束强化学习在控制、偏好学习和大语言模型对齐中的性能与安全性。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10365 2025-12-12 cs.LG cs.AI cs.CL 75%

GPG: Generalized Policy Gradient Theorem for Transformer-based Policies

基于Transformer策略的广义策略梯度定理

Hangyu Mao, Guangting Dong, Zhicheng Dou

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于Transformer策略的广义策略梯度定理,揭示了标准策略梯度定理和GRPO的特殊案例,并探讨了其在训练大型语言模型中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03772 2025-12-12 cs.LG cs.AI cs.CL 75%

GTPO: Stabilizing Group Relative Policy Optimization via Gradient and Entropy Control

GTPO:通过梯度和熵控制稳定群体相对策略优化

Marco Simoni, Aleksandar Fontana, Giulio Rossolini, Andrea Saracino, Paolo Mori

机构 * National Doctorate on Artificial Intelligence, Sapienza Università di Roma(人工智能国家博士学院,罗马萨皮恩扎大学) Department of Excellence in Robotics and AI, TeCIP, Scuola Superiore Sant’Anna, Pisa(机器人与人工智能卓越部门,TeCIP,圣安娜高等学院,比萨) Institute of Informatics and Telematics, National Research Council of Italy, Pisa(信息与电信研究所,意大利国家研究理事会,比萨)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GTPO通过梯度和熵控制稳定群体相对策略优化,提升大语言模型对齐的训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10575 2025-12-12 cs.CL 70%

RoleRMBench & RoleRM: Towards Reward Modeling for Profile-Based Role Play in Dialogue Systems

RoleRMBench & RoleRM:迈向基于角色扮演的对话系统奖励建模

Hang Ding, Qiming Feng, Dongqi Liu, Qi Zhao, Tao Yao, Shuo Wang, Dongsheng Chen, Jian Li, Zhenye Gan, Jiangning Zhang, Chengjie Wang, Yabiao Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Saarland University(萨尔兰州大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RoleRMBench与RoleRM旨在通过连续隐式偏好训练提升角色扮演对话系统中奖励建模的准确性与连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏