AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
机构 * University of Colorado, Boulder(科罗拉多大学波德罗尔分校) ; Charles Analytics, Aurora(查尔斯分析公司)
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI
Comments 12 pages, 1 figure
机构 * The Ohio State University(俄亥俄州立大学) ; Scale AI ; University of California, Berkeley(加州大学伯克利分校)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
Comments We publicly release WebGuard, along with its annotation tools and fine-tuned models, to facilitate open-source research on monitoring and safeguarding web agents. All resources are available at https://github.com/OSU-NLP-Group/WebGuard
专题命中 安全训练 :safety(abstract)
专题命中 安全训练 :safety(abstract)
Comments Submitted Manuscript. This pre-print has not undergone any post-review modifications/improvements