But what is your honest answer? Aiding LLM-judges with honest alternatives using steering vectors
但你的诚实答案是什么?利用引导向量辅助LLM-法官的诚实替代方案
机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) ; University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) ; Independent(独立)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出JUSSA框架,通过引导向量优化法官的诚实性,提升对欺骗性回答的检测能力,实验显示在不同 dishonesty 水平下,GPT-4.1和Claude Haiku的AUROC均有显著提升,但任务复杂度不匹配时性能下降。