InCo-DPO: Balancing Distribution Shift and Data Quality for Enhanced Preference Optimization
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL、cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG
Comments Published as a conference paper at ICLR 2025
专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);分类 cs.AI、cs.LG
专题命中 后训练与偏好优化 :LLM(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG
Comments 17 pages, 7 figures
专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
Comments ENLSP-IV NeurIPS Workshop 2024
专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract);分类 cs.CL、cs.LG
Comments NeurIPS 2024. Code & models: https://github.com/princeton-nlp/SimPO. v3 updates: Gemma 2 results (Appendix J); more discussions about length normalization (Section 2.2) and KL regularization (Section 2.3)
专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);分类 cs.AI、cs.LG
Comments The paper has been accepted by NeurIPS 2024
专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.CL、cs.LG
Comments NeurIPS 2024
专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Comments to be published in AIES 2024 Proceedings
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL、cs.LG
Comments Added acknowledgemnts
专题命中 后训练与偏好优化 :foundation model(title,abstract);prompting(abstract);分类 cs.AI、cs.LG
Comments ICML 2024
专题命中 后训练与偏好优化 :preference optimization(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG
Comments Accepted at ICML 2023 main conference
专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);分类 cs.AI、cs.LG
Comments Added experiments
专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);分类 cs.CL、cs.LG
Comments 19 pages, 6 figures, 21 tables
专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
Comments Presented at ICLR 2024
专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI
Comments 24 pages, 41 figures
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG
专题命中 后训练与偏好优化 :RLHF(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG
专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.CL、cs.LG
Comments INTERSPEECH 2020
基于变分学习的RLVR参数探索
机构 * INSAIT, Sofia University “St. Kliment Ohridski”(INSAIT,圣克莱门特奥赫里德斯基索非亚大学) ; National Research Center for Applied Cybersecurity ATHENE(ATHENE国家应用网络安全研究中心)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文针对LLM强化学习的探索问题,提出参数空间探索思路,引入3PO方法,在OLMo-3-1025-7B等模型的数学推理等任务上,以相近计算成本相比GRPO提升性能,减少训练中的异常分组与轨迹。
GraphQAG:一种用于问答对生成的知识图谱引导型可视分析框架
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 该研究针对长文档知识碎片化的问题,提出GraphQAG知识图谱引导型可视分析框架,经评估可帮助用户优化问答对集合,提升问答对的全面性与可信度。
DPO-F+:使代码修复反馈与开发者偏好对齐
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 研究针对大语言模型在代码修复中开发者难解读输出的问题,提出DPO-f+框架,通过定义指标、构建数据集、微调模型及评估反馈质量,提升反馈准确性与对齐度,增强了代码理解和人机协作。
Comments 10 pages, 2 figures
基于近似查询处理和代理模型的AI工作流查询中心优化
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract)
AI总结 提出将AI工作流视为声明式查询,利用近似查询处理(AQP)和代理模型(PM)过滤减少昂贵模型调用,在TPC-DS和LLM流水线上实现85-90%和60-70%的调用减少。