What Suppresses Nash Equilibrium Play in Large Language Models? Mechanistic Evidence and Causal Control
在大型语言模型中什么抑制了纳什均衡行为?机制证据和因果控制
机构 * DreamWorks Animation(梦工厂动画) ; University of Crete(希腊克里特大学)
专题命中 知识编辑与模型理解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 研究通过实验揭示大型语言模型在战略决策中抑制纳什均衡的行为机制,发现模型在早期层面对对手历史编码精确,但纳什行动编码较弱,且通过后期层的亲社会覆盖抑制纳什行为。
Comments 11 pages, 5 figures, 4 tables