SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; MiLM Plus, Xiaomi Inc.(小米公司)
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV