Towards Safer Chatbots: Automated Policy Compliance Evaluation of Custom GPTs
迈向更安全的聊天机器人:自动生成策略合规性评估的定制GPTs
机构 * Information Processing and Telecommunications Center Universidad Politécnica de Madrid ETSI Telecomunicación(信息处理与电信中心西班牙马德里理工大学电信工程学院) ; King’s College London(伦敦国王学院) ; INGENIO (CSIC-Universitat Politècnica de València)(INGENIO(西班牙国家研究委员会-瓦伦西亚理工大学))
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种自动化方法,用于评估定制GPTs是否符合其市场使用政策,通过黑盒交互结合大规模发现、红队提示和LLM作为法官,揭示了当前审核机制的不足及行为合规性评估的可行性。
Journal ref Array, Volume 30, July 2026, Article 100834