arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-17 至 2025-12-17 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2512.08786 2025-12-17 cs.CL cs.AI 88%

A Systematic Evaluation of Preference Aggregation in Federated RLHF for Pluralistic Alignment of LLMs

对联邦RLHF中偏好聚合的系统评估:为LLM的多元化对齐

Mahmoud Srewa, Tianyu Zhao, Salma Elmalaki

机构 * Department of Electrical Engineering and Computer Science University of California, Irvine(电气工程与计算机科学系 加州大学伊文斯分校)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种自适应偏好聚合方法,通过动态调整权重提升联邦RLHF中LLM的公平性与对齐性能。

Comments This paper is accepted at the NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18127 2025-12-17 cs.IR cs.AI cs.CL cs.LG 88%

Holistic Utility Preference Learning for Listwise Alignment

整体效用偏好学习用于列表对齐

Jiacong Zhou, Xianyun Wang, Min Zhang, Jun Yu

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(计算机科学与技术学院,杭州电子科技大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);safety(abstract)

AI总结 DRPO通过整体效用学习提升列表对齐效果,优化响应排名质量

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14100 2025-12-17 cs.LG cs.LO 85%

A First-Order Logic-Based Alternative to Reward Models in RLHF

基于一阶逻辑的强化学习人类反馈中奖励模型的替代方案

Chunjin Jian, Xinhua Zhu

机构 * School of Computer Science(计算机科学系) Engineering Guangxi Normal University Guilin, China(广西师范大学)

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);DPO(abstract);分类 cs.LG

AI总结 本文提出基于一阶逻辑的奖励机制,替代传统奖励建模,通过逻辑一致性提升模型对齐性能,实验显示其在性能和鲁棒性上优于标准微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13837 2025-12-17 cs.LG 83%

Explainable reinforcement learning from human feedback to improve alignment

通过人类反馈改进强化学习的可解释性以提升对齐

Shicheng Liu, Siyuan Xu, Wenjie Qiu, Hangfan Zhang, Minghui Zhu

机构 * Department of Electrical Engineering, Pennsylvania State University(宾夕法尼亚州立大学电气工程系) Department of Computer Science, Rutgers University(罗格斯大学计算机科学系) College of Information Sciences and Technology, Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出通过纠正RLHF中不满意响应的原因来提升语言模型对齐性的方法,结合事后解释与卸载技术改进模型响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14503 2025-12-17 cs.IR cs.CL 57%

RecGPT-V2 Technical Report

RecGPT-V2 技术报告

Chao Yi, Dian Chen, Gaoyang Guo, Jiakai Tang, Jian Wu, Jing Yu, Mao Zhang, Wen Chen, Wenjun Yang, Yujie Luo, Yuning Jiang, Zhujin Gao, Bo Zheng, Binbin Cao, Changfa Wu, Dixuan Wang, Han Wu, Haoyi Hu, Kewei Zhu, Lang Tian, Lin Yang, Qiqi Huang, Siqi Yang, Wenbo Su, Xiaoxiao He, Xin Tong, Xu Chen, Xunke Xi, Xiaowei Huang, Yaxuan Wu, Yeqiu Yang, Yi Hu, Yujin Yuan, Yuliang Yan, Zile Zhou

机构 * RecGPT Team(RecGPT 团队)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 RecGPT-V2通过多代理系统、元提示框架、受约束强化学习和代理作为裁判框架,提升推荐系统意图推理的效率和准确性,实现60%的GPU消耗降低和11.46%的NER提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13714 2025-12-17 cs.AI 57%

AI-Powered Annotation Pipelines for Stabilizing Large Language Models: A Human-AI Synergy Approach

基于AI的标注流程用于稳定大语言模型:一种人机协同方法

Gangesh Pathak, Prasanna Kumar

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的标注流程,通过人机协同方法系统识别并修复大语言模型的不稳定性,提升模型的可靠性和鲁棒性。

Comments 16 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏