Scaling Patterns in Adversarial Alignment: Evidence from Multi-LLM Jailbreak Experiments
对抗对齐中的扩展模式:来自多LLM jailbreak实验的证据
专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过多LLM jailbreak实验揭示了模型大小不对称对对抗鲁棒性的影响,发现攻击者规模与有害输出严重性呈正相关,且攻击者对齐性可缓解有害响应。