Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization
注意力揭示大语言模型推理:预规划与锚定节奏实现细粒度策略优化
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Alibaba Group(阿里巴巴集团)
AI总结 本文通过注意力机制揭示大语言模型推理中的预规划与锚定节奏,并据此提出三种细粒度强化学习策略,在多种推理任务上取得一致性能提升。
Comments 31 pages, 9 figures, 20 tables. Accepted at ICML 2026