As Simple as Fine-tuning: LLM Alignment via Bidirectional Negative Feedback Loss
专题命中 后训练与偏好优化 :LLM(title,abstract);RLHF(abstract);preference optimization(abstract);分类 cs.CL
Comments 20 pages, 9 figures
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :LLM(title,abstract);RLHF(abstract);preference optimization(abstract);分类 cs.CL
Comments 20 pages, 9 figures
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);preference optimization(abstract);分类 cs.AI
Journal ref EMNLP 2024
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
Comments Accepted at EMNLP 2024
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
Comments EMNLP 2024
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);preference optimization(abstract);分类 cs.CL
Comments 27pages, 15 tables
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);RLHF(abstract);分类 cs.AI
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);preference optimization(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);preference optimization(abstract);分类 cs.LG
Comments 44 pages, 19 figures, 12 tables
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);RLHF(abstract);分类 cs.LG
Comments 20 pages, 9 figures
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
Comments To appear at NAACL 2024
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
Comments Project Website: https://opendatalab.github.io/HA-DPO, Code: https://github.com/opendatalab/HA-DPO
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);RLHF(abstract);分类 cs.CL
Comments EMNLP 2023 Camera Ready
专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL
Comments Preprint
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
Comments 22 pages,11 figures
专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
引用在偏好数据中的作用
机构 * University of Maryland(马里兰大学) ; Johns Hopkins University(约翰斯·霍普金斯大学)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI
AI总结 本文在科学问答场景下,通过混合效应模型研究引用对人类与四个开源LLM偏好的影响,发现人类偏好多样且数量少的引用,LLM也有相关偏好,还探讨了对偏好数据收集的启示。
Wasserstein分布鲁棒遗憾优化用于人类反馈的强化学习
机构 * Department of Statistics and Operations Research, University of North Carolina(统计与运筹学系,北卡罗来纳大学) ; Imperial Business School, Imperial College London(帝国理工学院伦敦商学院) ; Department of Management Science and Engineering, Stanford University(管理科学与工程系,斯坦福大学)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文提出Wasserstein分布鲁棒遗憾优化(DRRO)用于强化学习从人类反馈,通过简单分配模型研究提示问题,展示在ℓ1-地面成本Wasserstein模糊集下,内最坏遗憾有精确解,最优策略具有水填充结构,从而实现高效政策梯度算法。
DataClaw0: 从原始流中智能定制多模态数据
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Shenzhen University of Advanced Technology(深圳理工大学) ; Tsinghua University(清华大学)
专题命中 后训练与偏好优化 :SFT(summary_cn,abstract_cn);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 提出DataClaw0模型,通过两阶段流水线将生成语义合成锚定于确定性事实锚点,结合SFT与GRPO实现复杂数据精炼意图的对齐,首个数据精炼基准验证其高效性。
Comments add base model: Qwen3.5-27B
NormWorlds-CF:使用变质关系GRPO进行求解器验证的反事实规范推理
机构 * Tsinghua University(清华大学)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract);language model(abstract);post-training(abstract)
AI总结 介绍NormWorlds-CF用于可执行规则世界的反事实规范推理,其求解器能产生多种结果用于监督评估。通过实验对比不同奖励机制对任务的影响,显示验证的反事实结构可影响训练后表现。
OR 否则:用于策略优化的可微信赖域
机构 * Quantiphi Inc(昆蒂菲公司) ; Self Machines Inc(自机器公司) ; The University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 研究 PPO 和 GRPO 中裁剪代理目标导数突变问题,提出用输出重置(OR)规则优化。通过对比实验,在广义优势估计下 PPO-OR 有更高奖励模型得分,组相对优势下 GRPO-OR 虽平均得分未升但差异更小,OR 改变了优化行为但奖励效果有别。
Comments 22 pages, 5 figures
LatentGym: 具有可控潜在结构的跨任务经验学习测试平台
机构 * Columbia University(哥伦比亚大学) ; Oumi Blog | Code | Models(Oumi博客 | 代码 | 模型)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 提出LatentGym测试平台,通过可控潜在变量分离探索与利用,研究LLM代理在跨任务序列中的适应性学习机制。
Comments 61 pages
通过检索增强生成和多目标对齐统一查询自动补全中的排序与生成
机构 * Apple(苹果公司) ; UC Berkeley(加州大学伯克利分校)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 提出一个统一框架,通过检索增强生成(RAG)和多目标直接偏好优化(DPO)将查询自动补全重构为端到端列表生成,解决传统流水线长尾覆盖不足和生成方法幻觉风险的问题,并在大规模商业搜索平台上验证了有效性。
Comments 11 pages, 4 figures
Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea