Tracking Drift: Variation-Aware Entropy Scheduling for Non-Stationary Reinforcement Learning
追踪漂移:面向非平稳强化学习的变异性感知熵调度
Tongxi Wang, Zhuoyang Xia, Xinran Chen, Shan Liu
机构
*
School of Future Technology, Southeast University, Nanjing, China(东南大学未来技术学院,南京,中国)
;
School of Automation, Southeast University, Nanjing, China(东南大学自动化学院,南京,中国)
Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning
大规模进化策略:超越强化学习的LLM微调
Xin Qiu, Yulu Gan, Conor F. Hayes, Qiyao Liang, Yinggan Xu, Roberto Dailey, Elliot Meyerson, Babak Hodjat, Risto Miikkulainen
机构
*
University of California, Los Angeles, Los Angeles, CA, USA(加州大学洛杉矶分校)
;
Cognizant AI Lab, San Francisco, CA, USA(Cognizant AI实验室)
;
The University of Texas at Austin, Austin, TX, USA(德克萨斯大学奥斯汀分校)
;
Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院)