Active Attacks: Red-teaming LLMs via Adaptive Environments
机构 * KAIST(韩国科学技术院) ; Mila – Québec AI Institute(魁北克人工智能研究所) ; LawZero ; Omelet ; Université de Montréal(蒙特利尔大学)
Comments 22 pages, 7 figures, 18 tables
作者
Machine Learning
机构 * KAIST(韩国科学技术院) ; Mila – Québec AI Institute(魁北克人工智能研究所) ; LawZero ; Omelet ; Université de Montréal(蒙特利尔大学)
Comments 22 pages, 7 figures, 18 tables