arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-08 至 2026-01-08 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 2 篇

2601.03537 2026-01-08 cs.AI cs.CL 88%

STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules

通过安全规则的自教推理提升安全性

Di Wu, Yanyan Zhao, Xin Lu, Mingzhe Li, Bing Qin

机构 * Research Center for Social Computing and Information Retrieval(社会计算与信息检索研究中心) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 安全训练 :safety(title,abstract);alignment(title);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 STAR-S通过自教推理提升大型语言模型的安全性,有效防御对抗攻击。

Comments 19 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03320 2026-01-08 cs.LG cs.AI 62%

Ratio-Variance Regularized Policy Optimization for Efficient LLM Fine-tuning

基于比率方差正则化的策略优化用于高效的LLM微调

Yu Luo, Shuo Han, Yihan Hu, Dong Li, Jianye Hao

机构 * Department of Foundation Model, 2012 Labs, Huawei(华为2012实验室基础模型部门) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 R²VPO通过正则化策略比率的方差,提升LLM微调的稳定性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏