ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm
ANCHOR:针对现实世界危害的CLI代理自动对齐审计
机构 * Anthropic(Anthropic公司)
AI总结 研究自主CLI代理在现实世界危害中的风险,提出ANCHOR自动审计框架,通过基于黑暗人格数据微调的审计代理模拟恶意用户,测试CLI代理,发现当前对齐技术不足,强调针对此类恶意用户进行安全评估的必要。
Comments Accepted at ICML 2026. 19 pages, 14 figures, 5 tables
Journal ref International Conference on Machine Learning, 2026