Actor-Curator: Co-adaptive Curriculum Learning via Policy-Improvement Bandits for RL Post-Training
Actor-Curator: 通过策略改进带状机为RL后训练实现联合适应课程学习
Zhengyao Gu, Jonathan Light, Raul Astudillo, Ziyu Ye, Langzhou He, Henry Peng Zou, Wei Cheng, Santiago Paternain, Philip S. Yu, Yisong Yue
机构
*
University of Illinois Chicago(伊利诺伊大学香槟分校)
;
Caltech(加州理工学院)
;
RPI(罗切斯特理工学院)
;
MBZUAI(澳门大学人工智能研究院)
;
University of Chicago(芝加哥大学)
;
NEC Laboratories America(NEC美国实验室)
Recursive Self-Aggregation Unlocks Deep Thinking in Large Language Models
递归自聚合解锁大语言模型的深度思考
Siddarth Venkatraman, Vineet Jain, Sarthak Mittal, Vedant Shah, Johan Obando-Ceron, Yoshua Bengio, Brian R. Bartoldson, Bhavya Kailkhura, Guillaume Lajoie, Glen Berseth, Nikolay Malkin, Moksh Jain
机构
*
Mila – Québec AI Institute(魁北克AI研究所)
;
Université de Montréal(蒙特利尔大学)
;
McGill University(麦吉尔大学)
;
LawZero(法零)
;
LLNL(劳伦斯利弗莫尔国家实验室)
;
University of Edinburgh(爱丁堡大学)
;
CIFAR AI Chair(CIFAR人工智能 chair)
;
CIFAR Fellow