Reinforcement Learning Foundations for Deep Research Systems: A Survey
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI
Comments 39 pages, second version
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI
Comments 39 pages, second version
机构 * Harvard University(哈佛大学)
专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.LG
Comments Accepted to NeurIPS 2025 (Spotlight Paper)