SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; MiLM Plus, Xiaomi Inc.(小米公司)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; MiLM Plus, Xiaomi Inc.(小米公司)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract)
专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI
Comments Technical Report
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
专题命中 安全训练 :safety(abstract,comments);分类 cs.CL、cs.AI、cs.LG;alignment(comments)
Comments Accepted at AAAI 2026 AI Alignment Track, Source code: https://github.com/HahmDY/agentic-ft-safety
专题命中 安全训练 :trustworthy(abstract);分类 cs.CL
Comments Accepted by AAAI 2026 Main Track
专题命中 安全训练 :safety(abstract);分类 cs.AI
Comments 16 pages including appendices, accepted to AAAI 2026; fixed some typoes
机构 * Department of Electrical and Computer Engineering, National University of Singapore(国立新加坡大学电气与计算机工程系) ; Department of Control Science and Engineering, Shanghai Institute of Intelligent Science and Technology(上海智能科学与技术研究院控制科学与工程系)
专题命中 安全训练 :safety(abstract)
Comments 12 pages, 9 figures