Censored LLMs as a Natural Testbed for Secret Knowledge Elicitation
被屏蔽的LLM作为秘密知识提取的自然测试场
机构 * Harvard University(哈佛大学) ; Warsaw University of Technology(华沙理工大学) ; IDEAS Research Institute(IDEAS研究所) ; CentraleSupélec(中央理工学院) ; Anthropic(Anthropic公司)
AI总结 研究利用被屏蔽的LLM测试秘密知识提取技术,发现开放式权重模型在诚实提取和谎言检测中存在局限性,且无法完全消除虚假回应。