Improved Algorithms for Differentially Private Language Model Alignment
机构 * Peking University(北京大学)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Peking University(北京大学)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);DPO(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
Comments Accepted to ICLR 2025
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.CL、cs.LG
Comments Accepted in ICLR 2025
专题命中 偏好对齐 :RLHF(title,abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
Comments NeurIPS 2024 Workshop SFLLM
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);DPO(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :trustworthy(title,abstract);RLHF(abstract);safety(abstract);分类 cs.AI、cs.LG
Comments 33 pages, 20 figures
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :harmlessness(title,abstract);RLHF(abstract);red teaming(abstract);分类 cs.AI、cs.LG
Comments 18 pages, 7 figures
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI
Comments 18 pages, 9 figures, 4 tables
专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);harmlessness(abstract);分类 cs.CL
Comments Published in ICLR 2025, code in https://github.com/exlaw/TIS-DPO
《智能体AI的搭车指南:从基础到系统》
机构 * Haggai Roitman
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文为构建自主AI系统提供全面实践参考,覆盖从Transformer架构、训练优化到对齐、推理、检索增强生成、记忆系统、智能体设计模式及多智能体协调的完整技术栈。
Comments version 1.3
用户侧记忆中的子模块不对称性:一个诊断框架
机构 * EpistemicaLab — Independent Research(EpistemicaLab — 独立研究)
专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出一个诊断框架,将LLM用户侧记忆分解为行为一致性、事实存在和事实缺失三个正交子模块,发现参数记忆与检索记忆在不同子模块上存在不对称性,且RLHF调优加剧了这种不对称性。
Comments Preprint. Code: https://github.com/EpistemicaLab/substrate-asymmetry-memory
MaPPO:结合先验知识的最大后验偏好优化
机构 * Purdue University(普渡大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; Amazon(亚马逊) ; Meta, FAIR ; Yonsei University(延世大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MaPPO通过整合先验奖励知识优化偏好学习,提升对齐性能,无需额外超参数,适用于离线和在线设置,支持DPO变体插件,实验显示在多个基准上效果显著。
机构 * Zhejiang University(浙江大学) ; ByteDance(字节跳动) ; National University of Singapore(新加坡国立大学) ; Angelalign Inc., China(中国Angelalign公司)
专题命中 偏好对齐 :alignment(title,abstract);trustworthy(title)
开放权重模型的行为重编程:认知可塑性与对齐边界
机构 * National Supercomputing Centre, Slovakia(斯洛伐克国家超级计算中心)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.AI
AI总结 该研究通过大规模并行超参数搜索等方法,对开放权重LLMs进行行为重编程,实现了主动苏格拉底式对话框架,明确了PEFT的边界等关键结论,为跨语言行为修改提供了实证框架。
Comments Preprint submitted to arXiv, August 12, 2026. 13 pages, 5 figures
在弱到强对齐中评估风险:从偏差-方差视角出发
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft(微软) ; InstaDeep ; New York University(纽约大学)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI
AI总结 本文从偏差-方差视角分析弱到强对齐的风险,通过连续置信度分数研究经验组件,发现强模型方差是欺骗的主要预测因素,表明弱强依赖性的重要性。
探索用于生物医学数据到文本生成的小语言模型的训练后对齐:以药品说明书为例
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.CL
AI总结 该研究对生物医学数据到文本生成任务训练小语言模型的方法进行比较分析,在药品说明书数据集上用基于Qwen的SLMs探索多种训练后方法,通过整理数据评估模型,结果显示对齐后的SLMs性能优异,GRPO跨数据集性能最稳健。
Comments 10 pages, 1 figures
基于Shapley值的大语言模型对齐数据估值:通过顺序偏好优化
机构 * Criteo AI lab(Criteo AI实验室) ; FairPlay joint team(FairPlay联合团队) ; CREST ; ENSAE ; Institut Polytechnique de Paris(巴黎理工学院) ; Inria(法国国家科学与技术研究院)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.LG
AI总结 研究大语言模型对齐中数据估值问题,针对基于Shapley值估值计算量大的挑战,提出顺序偏好优化方法,可高效近似Shapley值,计算真实偏好数据集的Shapley值并揭示各源对模型对齐的作用。
以真实意图铺路:意图感知训练提升跨训练机制下的LLM安全分类
机构 * University of Groningen(格罗宁根大学) ; University Politehnica of Bucharest(布加勒斯特理工大学) ; NVIDIA(英伟达)
专题命中 偏好对齐 :safety(title,abstract);DPO(abstract,abstract_cn);分类 cs.CL
AI总结 提出意图感知训练方法,通过显式建模用户意图信号提升安全分类器鲁棒性,在多个训练机制下取得最优平均性能。