arXivDaily arXiv每日学术速递 周一至周五更新

作者

Dawn Song

AI / Security

2026-04-22 至 2026-04-22 共收录 2
2510.18333 2026-04-22 cs.CR cs.CL

Position: LLM Watermarking Should Align Stakeholders' Incentives for Practical Adoption

位置:LLM水印应使所有相关方的利益一致以实现实际应用

Yepeng Liu, Xuandong Zhao, Dawn Song, Gregory W. Wornell, Yuheng Bu

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) UC Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文探讨了LLM水印技术中利益相关方激励不一致的问题,提出通过设计激励一致的水印方法,如上下文水印,来解决实际应用中的障碍,强调在特定领域内实现可靠工具的重要性。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13281 2026-04-22 cs.AI cs.CL

RepIt: Steering Language Models with Concept-Specific Refusal Vectors

RepIt:通过概念特定拒绝向量引导语言模型

Vincent Siu, Nathan W. Henry, Nicholas Crispino, Yang Liu, Dawn Song, Chenguang Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Berkeley(加州大学伯克利分校)

AI总结 RepIt通过隔离语言模型激活中的概念特定表示,揭示当前安全评估的漏洞,展示如何利用少量资源实现针对特定概念的拒绝抑制。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏