Adversarial Reinforcement Learning for Large Language Model Agent Safety
机构 * Google(谷歌) ; Google Deepmind(谷歌DeepMind) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Sony AI(索尼人工智能)
专题命中 提示注入 :safety(title,abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG