Learning to Follow In-Context Watermark Instructions via Self-Distillation
通过自蒸馏学习遵循上下文水印指令
AI总结 针对当前LLM无法同时遵循上下文水印指令并保持答案质量的问题,提出带logits扰动的自蒸馏(SDLP)与强化学习结合的两阶段训练方法,在Qwen3-14B和GPT-OSS-20B上显著提升水印可检测性且维持响应质量。
作者
AI / Security
通过自蒸馏学习遵循上下文水印指令
AI总结 针对当前LLM无法同时遵循上下文水印指令并保持答案质量的问题,提出带logits扰动的自蒸馏(SDLP)与强化学习结合的两阶段训练方法,在Qwen3-14B和GPT-OSS-20B上显著提升水印可检测性且维持响应质量。