arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Anthropic

2026-03-16 至 2026-03-16 共收录 1
2511.02620 2026-03-16 cs.CR cs.LG

Verifying LLM Inference to Detect Model Weight Exfiltration

验证大语言模型推理以检测模型权重外泄

Roy Rinberg, Adam Karvonen, Alexander Hoover, Daniel Reuter, Keri Warr

机构 * Harvard University(哈佛大学) ML Alignment & Theory Scholars (MATS)(对齐与理论学者(MATS)) Stevens Institute of Technology(史蒂文斯理工学院) Anthropic

AI总结 本文提出通过验证LLM推理来检测模型权重外泄,通过安全游戏形式化外泄问题,提出可证明缓解隐写外泄的验证框架,并评估了不同参数规模的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏