Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments
这会改变你的答案吗?通过反事实实验评估现实场景中大语言模型(LLM)行为的解释
机构 * Anthropic
AI总结 本研究提出CHIVE流程,通过反事实实验评估大语言模型行为的解释,发现常见可解释性技术无预测提升,且CHIVE生成的训练数据可实现分布外泛化。
大厂专区
这会改变你的答案吗?通过反事实实验评估现实场景中大语言模型(LLM)行为的解释
机构 * Anthropic
AI总结 本研究提出CHIVE流程,通过反事实实验评估大语言模型行为的解释,发现常见可解释性技术无预测提升,且CHIVE生成的训练数据可实现分布外泛化。