Leveraging Group Relative Policy Optimization to Advance Large Language Models in Traditional Chinese Medicine
专题命中 安全训练 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.AI
机构 * EPFL(苏黎世联邦理工学院) ; LatentWorlds AI ; TUDelft(代尔夫特理工大学) ; Embodied AI SA(具身人工智能股份有限公司)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
Comments Accepted by NeurIPS 2025 SpaVLE workshop. 4 pages, 2 figures(in main paper, excluding references and supplements)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY
机构 * MATS & Anthropic Fellows Program(MATS与Anthropic Fellow项目) ; Thinking Machines Lab(Thinking Machines实验室) ; Anthropic
专题命中 安全训练 :safety(abstract);分类 cs.AI
专题命中 安全训练 :safety(abstract)
Comments 52 pages; 3 figures; PRIMEarxiv template; fully reproducible artifact (code, configs, plots)
机构 * University of Bonn(波恩大学) ; Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究所) ; Center for Robotics(机器人中心) ; University of Mainz(美因茨大学) ; Fraunhofer Institute for Intelligent Analysis and Information Systems IAIS(弗劳恩霍夫智能分析与信息系统研究所)
专题命中 安全训练 :trustworthy(abstract)
机构 * Humanoid Robots Lab, University of Bonn(波恩大学人形机器人实验室)
专题命中 安全训练 :safety(abstract)