Understanding and Mitigating Dataset Corruption in LLM Steering
理解并缓解LLM引导中的数据集损坏
机构 * Department of Computer Science, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校计算机科学系) ; Kahlert School of Computing, University of Utah(犹他大学凯尔特计算学校)
AI总结 研究对比引导在数据集损坏下的鲁棒性,发现其对中等损坏较稳健,但恶意篡改会引发副作用,通过替换高维均值计算为鲁棒估计器可缓解影响。