Towards Transparent AI Grading: Semantic Entropy as a Signal for Human-AI Disagreement
机构 * Thoughtworks AI Research Labs(Thoughtworks人工智能研究实验室)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Thoughtworks AI Research Labs(Thoughtworks人工智能研究实验室)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG