How and Why LLMs Generalize: A Fine-Grained Analysis of LLM Reasoning from Cognitive Behaviors to Low-Level Patterns
LLMs如何泛化:从认知行为到低级模式的细粒度分析
机构 * University of Wisconsin, Madison(威斯康星大学麦迪逊分校) ; University of California, Berkeley(加州大学伯克利分校) ; University of Pennsylvania(宾夕法尼亚大学) ; California Institute of Technology(加州理工学院)
AI总结 本文通过细粒度分析揭示LLMs在SFT和RL微调下的泛化差异,提出基于核心技能的基准测试,揭示RL模型在推理稳定性上的优势。