Harnessing RLHF for Robust Unanswerability Recognition and Trustworthy Response Generation in LLMs
机构 * Sichuan University of Science and Engineering(四川理工学院) ; Zagazig University(扎加齐亚大学)
专题命中 偏好对齐 :RLHF(title,abstract);trustworthy(title);分类 cs.CL
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Sichuan University of Science and Engineering(四川理工学院) ; Zagazig University(扎加齐亚大学)
专题命中 偏好对齐 :RLHF(title,abstract);trustworthy(title);分类 cs.CL
Macro: 通过偏好对齐优化提升多语言反事实解释
机构 * Technische Universität Berlin(柏林技术大学) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) ; University of Duisburg-Essen(杜伊斯堡- Essen大学) ; LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Saarland Informatics Campus(萨尔兰州信息学校区) ; BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院) ; Centre for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出Macro框架,通过直接偏好优化改进多语言反事实解释,提升有效性的同时保持最小性,避免翻译基线的严重最小性问题,并在多个指标上优于监督微调方法。
Comments In submission
多模态对齐与偏好优化用于零样本条件RNA生成
机构 * Univ. Grenoble Alpes, CNRS, Grenoble INP, LJK(格勒诺布尔阿尔卑斯大学、法国国家科学研究中心、格勒诺布尔INP、LJK实验室) ; Center for Computational Mathematics, Flatiron Institute(计算数学中心、Flatiron研究所)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 提出Moirain框架,通过多模态监督微调和直接偏好优化实现条件RNA序列生成,在零样本条件下生成具有高结合亲和力的生物合理RNA序列。
传递性与循环性:动态大语言模型对齐的显式偏好分解
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳校区)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出Hybrid Reward-Cyclic模型,通过博弈论分解显式分离传递性和循环性偏好,结合动态自我博弈优化方法提升大语言模型对齐效果,实验证明其在混合传递-循环设置中具有结构优势和更高的准确率。
Comments Accepted by ICML 2026
一对GRPO家族的统一:从隐式到显式的偏好约束用于稳定和通用的RL对齐
机构 * Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文提出了一种统一的偏好基于RL优化框架,通过Soft-Pair-GRPO和Hard-Pair-GRPO两种变体,解决了主流配对偏好学习中政策更新不稳定、梯度方向模糊等问题,提升了对齐质量与训练稳定性。
强化学习对齐的泛化极限
机构 * Aladdin Security Inc(阿拉丁安全公司)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了强化学习对齐技术的泛化能力限制,提出复合越狱方法,通过结合多种攻击技术提高攻击成功率,验证了安全训练无法广泛泛化 hypothesis。
Comments 7 pages, 2 figures, 2 tables, accepted at JSAI 2026
FedPDPO:联邦个性化直接偏好优化用于大语言模型对齐
机构 * College of Intelligence and Computing, Tianjin University, Tianjin, China(智能与计算学院,天津大学,天津,中国) ; College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG
AI总结 本文提出FedPDPO,一种联邦个性化直接偏好优化框架,通过参数高效微调和个性化奖励头解决非iid数据下的大语言模型对齐问题,实验显示在联邦内域和跨域设置中平均准确率提升达4.80%。
Comments under review
SafeDPO: 一种简单的方法用于直接偏好优化并增强安全性
机构 * LG AI Research(LG人工智能研究)
专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG
AI总结 SafeDPO通过简单理论驱动的目标,实现轻量级且有效的安全对齐,提升安全性的同时保持有用性。
Comments 40 pages
Journal ref In Proceedings of the International Conference on Learning Representations (ICLR), 2026
多目标对齐语言模型以实现个性化心理治疗
机构 * Department of Computer Science, University of California, Los Angeles, CA, USA(计算机科学系,加州大学洛杉矶分校) ; Department of Psychology, The University of Texas at Austin, Austin, TX, USA(心理学系,德克萨斯大学奥斯汀分校) ; Department of Psychiatry, NYU Grossman School of Medicine, New York, NY, USA(精神病学系,纽约大学格罗斯曼医学院)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract);分类 cs.CL、cs.LG
AI总结 本文提出多目标对齐框架,通过直接偏好优化提升语言模型在心理治疗中的共情与安全性能,实验显示其在平衡患者偏好与临床安全方面优于传统方法。
SAFER: 通过稀疏自动编码器探索奖励模型的安全性
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
AI总结 SAFER通过稀疏自动编码器探索奖励模型的安全性,揭示可解释特征并改进安全性对齐。
符合反馈对齐:量化答案级可靠性以实现鲁棒的大语言模型对齐
机构 * Arizona State University(亚利桑那州立大学)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
AI总结 Conformal Feedback Alignment通过量化答案级可靠性提升大语言模型对齐的鲁棒性和数据效率。
Comments Accetped to Findings of EACL
从失败中学习:通过失败意识反向强化学习理解LLM对齐
机构 * Imperial College London(帝国理工学院伦敦分校) ; Amazon AGI(亚马逊人工智能实验室)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.LG
AI总结 本文提出一种失败意识反向强化学习算法,通过聚焦于误分类或困难的例子来提取更准确的奖励函数,从而提升LLM对齐的可解释性和安全性。
Comments Preprint
ECLIPTICA -- 一种通过CITA进行可切换LLM对齐的框架
机构 * San José State University(圣何塞州立大学) ; Google(谷歌) ; Apple(苹果) ; Pragya Lab, BITS Pilani Goa, India(BITS Pilani Goa 印度分校实验室)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 ECLIPTICA通过CITA实现LLM对齐的可切换框架,以高效率提升指令对齐性能。
序列到序列奖励建模:通过语言反馈改进RLHF
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 通过序列到序列奖励建模方法改进RLHF,提升LLMs对齐人类意图的性能。
Comments 7 pages
反射偏好优化(RPO):通过提示引导的反思增强策略对齐
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; Alibaba Group(阿里巴巴集团)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
AI总结 RPO通过提示引导的反思增强策略对齐,减少幻觉并提升多模态基准性能。
PROPS: 大型语言模型的逐步隐私自对齐
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
AI总结 PROPS通过多阶段隐私保护对齐框架,在保护偏好标签隐私的同时提升LLM对齐效果,实现更高的胜率。
Comments Accepted in the Transactions on Machine Learning Research (TMLR), 2025
Journal ref Transactions on ML Research (TMLR) 2025
打破安全性与能力的权衡:具有可验证奖励的强化学习在LLMs中维持安全护栏
专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG
AI总结 本文提出通过可验证奖励的强化学习方法,在提升LLM推理能力的同时维持安全性,挑战了传统安全性与能力权衡的假设。
Comments AAAI-26 Workshop on Post-AI Formal Methods
机构 * The University of Osaka(大阪大学) ; Lattice Lab, Toyota Motor Corporation(丰田公司Lattice实验室) ; Machine Learning Research Group, University of Oxford(牛津大学机器学习研究组) ; RIKEN AIP(理化学研究所AIP)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
Comments Accepted by the 39th Conference on Neural Information Processing Systems (NeurIPS2025), 49 pages, 7 figures
机构 * Independent(独立研究者)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.LG
机构 * Tsinghua University(清华大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Soochow University(苏州大学)
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);DPO(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
机构 * Hong Kong Polytechnic University(香港理工大学) ; MemTensor (Shanghai) Technology Co., Ltd(MemTensor(上海)科技有限公司) ; University of Science and Technology of China(中国科学技术大学) ; China Telecom Corporation Limited Beijing Research Institute(中国电信北京研究院) ; Nanjing University of Information Science and Technology(南京信息工程大学)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG
Comments Accepted to 34th International Joint Conference on Artificial Intelligence (IJCAI 2025)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);harmlessness(abstract);分类 cs.CL、cs.AI
Comments AIES '25: Proceedings of the 2025 AAAI/ACM Conference on AI, Ethics, and Society
机构 * Microsoft Corporation(微软公司)
专题命中 偏好对齐 :safety(title,abstract);RLHF(abstract);AI safety(abstract);分类 cs.AI、cs.LG
机构 * Zhejiang University(浙江大学) ; Hongkong Polytechnic University(香港理工大学) ; University College London(伦敦大学学院) ; Westlake University(西湖大学) ; King's College London(国王学院) ; Southern University of Science and Technology(南方科技大学)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI
Journal ref ICML 2025
机构 * Amazon(亚马逊公司) ; Technion(技术学院) ; Duke(杜克大学)
专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG
机构 * University of Maryland(马里兰大学) ; Capital One(Capital One公司)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG
Journal ref AAAI 2025
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG
Comments Working in progress
机构 * Peking University(北京大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG