arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Anthropic

2026-03-11 至 2026-03-11 共收录 1
2603.05494 2026-03-11 cs.LG cs.AI cs.CL

Censored LLMs as a Natural Testbed for Secret Knowledge Elicitation

被屏蔽的LLM作为秘密知识提取的自然测试场

Helena Casademunt, Bartosz Cywiński, Khoi Tran, Arya Jakkli, Samuel Marks, Neel Nanda

机构 * Harvard University(哈佛大学) Warsaw University of Technology(华沙理工大学) IDEAS Research Institute(IDEAS研究所) CentraleSupélec(中央理工学院) Anthropic(Anthropic公司)

AI总结 研究利用被屏蔽的LLM测试秘密知识提取技术,发现开放式权重模型在诚实提取和谎言检测中存在局限性,且无法完全消除虚假回应。

详情

展开后加载摘要…

URL PDF HTML 收藏