arXivDaily arXiv每日学术速递 周一至周五更新

作者

Dawn Song

AI / Security

2026-09-01 至 2026-09-01 共收录 2
2608.29030 2026-09-01 cs.AI 新提交

Learning to Follow In-Context Watermark Instructions via Self-Distillation

通过自蒸馏学习遵循上下文水印指令

Yepeng Liu, Tianyi Chen, Xuandong Zhao, Dawn Song, Yuheng Bu

AI总结 针对当前LLM无法同时遵循上下文水印指令并保持答案质量的问题,提出带logits扰动的自蒸馏(SDLP)与强化学习结合的两阶段训练方法,在Qwen3-14B和GPT-OSS-20B上显著提升水印可检测性且维持响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10673 2026-09-01 cs.CR cs.CL 版本更新

Dataset Protection via Watermarked Canaries in Retrieval-Augmented LLMs

通过检索增强型大语言模型中的水印金丝雀实现数据集保护

Yepeng Liu, Xuandong Zhao, Dawn Song, Yuheng Bu

机构 * University of Florida(佛罗里达大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本研究提出CanaryTrace方法,通过在IP数据集中插入带水印的金丝雀文档,可高效检测RA-LLMs对数据集的未经授权使用,且不影响RAG系统性能。

Comments EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏