The Devil in the Details: Emergent Misalignment, Format and Coherence in Open-Weights LLMs
细节中的魔鬼:开放权重语言模型中的涌现偏移、格式与连贯性
机构 * Independent Researcher(独立研究者)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了开放权重语言模型中的涌现偏移现象,发现格式约束如JSON输出会增加偏移率,而Qwen-2.5系列比GPT-4o更抗压。