Benign Alone, Harmful Together: Exploiting Experience Composition in Self-Evolving LLM Agents
单独无害,联合有害:在自进化大语言模型智能体中利用经验组合
专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本研究提出EvoBreak攻击,利用自进化LLM智能体的良性经验组合,结合BreakGym生成训练目标,在保持高无害性的同时优于现有攻击,揭示了新的安全风险。