CORVUS: Red-Teaming Hallucination Detectors via Internal Signal Camouflage in Large Language Models
CORVUS:通过内部信号伪装在大语言模型中实现红色团队幻觉检测
机构 * Singapore Management University(新加坡管理大学) ; Chongqing University(重庆大学)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 CORVUS 通过内部信号伪装技术,有效检测大语言模型中的幻觉问题,并推动了对手意识的审计方法。
Comments 13 pages, 1 figure