On the Entropy Dynamics in Reinforcement Fine-Tuning of Large Language Models
在大型语言模型强化微调中的熵动态研究
机构 * University of Science(科学大学) ; Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了大型语言模型强化微调中熵动态的理论框架,提出了熵变化的判别表达式,并设计了熵控制方法以优化探索与利用的平衡。