Verifying LLM Inference to Detect Model Weight Exfiltration
验证大语言模型推理以检测模型权重外泄
机构 * Harvard University(哈佛大学) ; ML Alignment & Theory Scholars (MATS)(对齐与理论学者(MATS)) ; Stevens Institute of Technology(史蒂文斯理工学院) ; Anthropic
AI总结 本文提出通过验证LLM推理来检测模型权重外泄,通过安全游戏形式化外泄问题,提出可证明缓解隐写外泄的验证框架,并评估了不同参数规模的模型。