Learning to Follow In-Context Watermark Instructions via Self-Distillation
通过自蒸馏学习遵循上下文水印指令
AI总结 针对当前LLM无法同时遵循上下文水印指令并保持答案质量的问题,提出带logits扰动的自蒸馏(SDLP)与强化学习结合的两阶段训练方法,在Qwen3-14B和GPT-OSS-20B上显著提升水印可检测性且维持响应质量。
作者
AI / Security
通过自蒸馏学习遵循上下文水印指令
AI总结 针对当前LLM无法同时遵循上下文水印指令并保持答案质量的问题,提出带logits扰动的自蒸馏(SDLP)与强化学习结合的两阶段训练方法,在Qwen3-14B和GPT-OSS-20B上显著提升水印可检测性且维持响应质量。
通过检索增强型大语言模型中的水印金丝雀实现数据集保护
机构 * University of Florida(佛罗里达大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 本研究提出CanaryTrace方法,通过在IP数据集中插入带水印的金丝雀文档,可高效检测RA-LLMs对数据集的未经授权使用,且不影响RAG系统性能。
Comments EMNLP2026