MENTOR: A Metacognition-Driven Self-Evolution Framework for Uncovering and Mitigating Implicit Domain Risks in LLMs
MENTOR: 一种元认知驱动的自我进化框架,用于发现和缓解大语言模型中的隐式领域风险
机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) ; Shanghai AI Lab, Shanghai Innovation Institute(上海人工智能实验室,上海创新研究院)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型在特定领域(如教育、金融、管理)中存在的隐式安全风险,提出基于元认知自我评估和动态规则知识图谱的MENTOR框架,通过激活级引导信号有效降低攻击成功率。