Unified Preference Optimization: Language Model Alignment Beyond the Preference Frontier
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI
Comments Accepted at Transactions on Machine Learning Research (TMLR)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI
Comments Accepted at Transactions on Machine Learning Research (TMLR)
机构 * Fudan University(复旦大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);DPO(abstract);分类 cs.AI
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.LG
Comments 9 Pages, 3 Figures
专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL
Comments Accepted to ICLR 2025
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.AI
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract);分类 cs.LG
Comments NeurIPS accepted version
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL
Comments 20 pages, 9 figures
专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.AI
Comments 8 pages, 19 figures
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL
Comments 24 pages, 5 pages
专题命中 偏好对齐 :safety(title,abstract);RLHF(abstract);AI safety(abstract);分类 cs.AI
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL
Comments Accepted to ACL (Main) 2024
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.CY
Comments Accepted at NeurIPS 2023 (Spotlight). Project page: https://github.com/IBM/Dromedary
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL
Comments 21 pages, 11 figures, 5 tables
机构 * Mila Quebec AI Institute(魁北克AI研究所) ; Université de Montréal(蒙特利尔大学) ; Allen Institute for AI(人工智能研究院) ; Google Deepmind(谷歌DeepMind) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 偏好对齐 :RLHF(title,abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments accepted at ICLR 2025, code at https://github.com/mnoukhov/async_rlhf, integrated into the open-instruct library https://github.com/allenai/open-instruct
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Large Language Models; Reasoning; Alignment
DiverValue-Bench:用于使大语言模型与多元人类价值观对齐的基准及微调框架
专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI
AI总结 该研究推出覆盖74个国家/地区的人群感知基准DiverValue-Bench,发现现有LLMs存在地理与人口统计学价值观对齐差异,结合LoRA与DPO的轻量微调可提升对齐效果,为全球公平AI开发提供实用基础。
Comments 11 pages, 5 figures. Accepted to IJCAI-ECAI 2026 (Human-Centred AI Special Track). v2: Updated to the camera-ready version
小语言模型领域适应的可信性代价:一项跨架构实证研究
专题命中 偏好对齐 :DPO(abstract,abstract_cn);safety(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文通过对三类SLM架构、三个领域、两类训练数据及四种微调策略的216组实验,量化了领域适应的可信性代价,发现对抗扰动训练数据可提升适应质量且不降低可信性,部分安全策略反而增加对抗伤害易感性。
Comments 13 pages, 7 tables, 2 appendices (Reproducibility Checklist; Software and Data Availability). Code, model checkpoints, and datasets publicly available at https://github.com/rbpdlf/slm-trw
稳定价值冲突解决的几何视角
机构 * University of Illinois - Urbana-Champaign(伊利诺伊大学厄巴纳 - 香槟分校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型在RLHF训练中应对价值冲突的问题,核心方法是利用思维链推理,通过几何视角分析其作用,创建新的以价值冲突为重点的CoT设计,提升了道德推理性能,为改进模型处理复杂价值冲突请求的性能提供新途径。
Comments Accepted to ICML Workshop on High-Dimensional Learning Dynamics
RLearner-LLM: 通过混合直接偏好优化平衡大语言模型中的逻辑性与流畅性
机构 * University of Auckland(奥克兰大学) ; Aalto University(阿alto大学)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出RLearner-LLM,通过融合DeBERTa-v3 NLI信号与验证器LLM评分,解决直接偏好优化在知识密集型生成中的逻辑对齐问题,实现NLI指标显著提升。
隐藏共识:人类反馈中的偏好有效性压缩
机构 * YTL AI Labs ; Universiti Malaya(马来亚大学) ; Monash University Malaysia(莫纳什大学马来西亚校区) ; Universiti Malaysia Sarawak(马来西亚沙捞越大学)
专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出偏好有效性压缩问题,即RLHF将多元有效反馈压缩为单一奖励目标,导致对齐测量偏差。通过马来西亚语料分析,79%的提示存在多个多数支持响应,表明多数聚合测量的是argmax可接受性而非多元对齐。
Comments 28 pages. When AI learns from human feedback, it forces a single "correct" answer, but sometimes multiple answers are all genuinely valid, and that nuance gets thrown away
人们真正希望从AI中得到什么?偏好多元性映射
机构 * Oxford Internet Institute, University of Oxford(牛津大学互联网研究所) ; Meedan
专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.CY
AI总结 通过分析75个国家1500份开放式回答,发现不同人对AI的期望各异,多数价值观仅被少数人要求,且同一词语(如“真实性”)含义分歧,某些能力存在争议,揭示当前RLHF偏好聚合方法的根本缺陷。
Comments Accepted at the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)
PageLLM:面向整页优化的大语言模型多粒度奖励框架
机构 * Arizona State University(亚利桑那州立大学) ; Nokia(诺基亚) ; University of Kansas(堪萨斯大学)
专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.AI、cs.LG
AI总结 针对整页优化中人工标注成本高和页面级连贯性与项目级放置粒度不匹配的问题,提出PageLLM框架,通过将隐式反馈解耦为粗粒度页面级奖励和细粒度项目级奖励,结合PPO的RLHF进行微调,显著提升排序性能并在线上部署中取得收益。
InfiFPO:通过偏好优化实现大型语言模型的隐式模型融合
机构 * The Hong Kong Polytechnic University (PolyU)(香港理工大学) ; Zhejiang University(浙江大学) ; PolyU-Daya Bay Technology and Innovation Research Institute(香港理工大学-大亚湾技术与创新研究院)
专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.LG
AI总结 提出InfiFPO方法,通过将DPO中的参考模型替换为融合源模型,在序列级别合成多源概率,实现隐式模型融合,从而在偏好对齐阶段有效融合多个LLM并提升性能。
Journal ref NeurIPS 2025
Optimus: 一种用于在微调对话AI时缓解毒性行为的稳健防御框架
机构 * University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);safety(abstract);jailbreak(abstract)
AI总结 本研究提出Optimus框架,通过整合训练无关的毒性分类方案和双重策略对齐过程,有效缓解微调过程中的毒性问题,并在有毒性分类器偏差时仍能保持高召回率,优于现有最佳防御方法StarDSS。
Comments Accepted at ACM CODASPY 2026
扰动探测:对齐语言模型中FFN行为电路的双次提示诊断
机构 * Palo Alto Networks(帕洛阿尔托网络公司)
专题命中 偏好对齐 :RLHF(summary_cn,abstract);safety(abstract);分类 cs.CL、cs.LG
AI总结 通过双次提示传递和无反向传播的扰动探测,识别LLM中两种行为电路结构,揭示RLHF组织的行为机制及模板层编辑工具。
基于探针的数据归因:发现并缓解LLM微调后的不良行为
机构 * California Institute of Technology(加利福尼亚理工学院)
专题命中 偏好对齐 :DPO(summary_cn,abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于探针的数据归因方法,通过分析测试提示和偏好对的激活差异向量,识别导致特定行为的数据点,并通过重新训练验证归因。该方法在OLMo 2的生产DPO训练中发现有害行为,过滤数据点可显著减少此类行为。
裁剪不安全的票据:一种资源高效的更安全且更稳健的大语言模型框架
机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);safety(abstract);jailbreak(abstract)
AI总结 本文提出一种资源高效的剪枝框架,通过识别并移除与不安全行为相关的参数,减少不安全生成并提高对抗鲁棒性,同时保持模型性能。