Trajectory Balance with Asynchrony: Decoupling Exploration and Learning for Fast, Scalable LLM Post-Training
轨迹平衡与异步性:解耦探索与学习以实现快速、可扩展的LLM后训练
Brian Bartoldson, Siddarth Venkatraman, James Diffenderfer, Moksh Jain, Tal Ben-Nun, Seanie Lee, Minsu Kim, Johan Obando-Ceron, Yoshua Bengio, Bhavya Kailkhura
机构
*
Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)
;
Mila – Quebec AI Institute(魁北克AI研究院)
;
Université de Montréal(蒙特利尔大学)
;
KAIST(韩国科学技术院)
;
CIFAR Fellow
Evaluating Generalization Capabilities of LLM-Based Agents in Mixed-Motive Scenarios Using Concordia
利用Concordia评估基于LLM的智能体在混合动机场景中的泛化能力
Chandler Smith, Marwa Abdulhai, Manfred Diaz, Marko Tesic, Rakshit S. Trivedi, Alexander Sasha Vezhnevets, Lewis Hammond, Jesse Clifton, Minsuk Chang, Edgar A. Duéñez-Guzmán, John P. Agapiou, Jayd Matyas, Danny Karmon, Akash Kundu, Aliaksei Korshuk, Ananya Ananya, Arrasy Rahman, Avinaash Anand Kulandaivel, Bain McHale, Beining Zhang, Buyantuev Alexander, Carlos Saith Rodriguez Rojas, Caroline Wang, Chetan Talele, Chenao Liu, Chichen Lin, Diana Riazi, Di Yang Shi, Emanuel Tewolde, Elizaveta Tennant, Fangwei Zhong, Fuyang Cui, Gang Zhao, Gema Parreño Piqueras, Hyeonggeun Yun, Ilya Makarov, Jiaxun Cui, Jebish Purbey, Jim Dilkes, Jord Nguyen, Lingyun Xiao, Luis Felipe Giraldo, Manuela Chacon-Chamorro, Manuel Sebastian Rios Beltran, Marta Emili García Segura, Mengmeng Wang, Mogtaba Alim, Nicanor Quijano, Nico Schiavone, Olivia Macmillan-Scott, Oswaldo Peña, Peter Stone, Ram Mohan Rao Kadiyala, Rolando Fernandez, Ruben Manrique, Sunjia Lu, Sheila A. McIlraith, Shamika Dhuri, Shuqing Shi, Siddhant Gupta, Sneheel Sarangi, Sriram Ganapathi Subramanian, Taehun Cha, Toryn Q. Klassen, Wenming Tu, Weijian Fan, Wu Ruiyang, Xue Feng, Yali Du, Yang Liu, Yiding Wang, Yipeng Kang, Yoonchang Sung, Yuxuan Chen, Zhaowei Zhang, Zhihan Wang, Zhiqiang Wu, Ziang Chen, Zilong Zheng, Zixia Jia, Ziyan Wang, Dylan Hadfield-Menell, Natasha Jaques, Tim Baarslag, Jose Hernandez-Orallo, Joel Z. Leibo
机构
*
Cooperative AI Foundation(合作人工智能基金会)
;
University of Oxford(牛津大学)
;
UC Berkeley(伯克利大学)
;
Quebec Artificial Intelligence Institute(魁北克人工智能研究所)
;
Leverhulme Centre for the Future of Intelligence, University of Cambridge(未来智能研究中心,剑桥大学)
;
MIT(麻省理工学院)
;
Google DeepMind(谷歌DeepMind)
;
Center on Long-Term Risk(长期风险中心)
;
Google Research(谷歌研究)
;
University of Washington(华盛顿大学)
;
Centrum Wiskunde & Informatica(数学与信息研究所)
;
Utrecht University(乌得勒支大学)
;
Universitat Politècnica de València(瓦伦西亚理工大学)
;
Concordia Contest Participants with Notable Contributions(康科德比赛有显著贡献的参与者)
机构
*
Pritzker School of Molecular Engineering, University of Chicago(芝加哥大学普利兹克分子工程学院)
;
Chemical Sciences and Engineering Division, Argonne National Laboratory(阿贡国家实验室化学科学与工程 division)
;
Department of Computer Science, University of Chicago(芝加哥大学计算机科学系)
机构
*
Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳研究院)
;
Southwestern University of Finance and Economics(西南财经大学)
;
Engineering Research Center of Intelligent Finance, Ministry of Education(教育部智能金融工程研究中心)
;
Tongji University(同济大学)
机构
*
ByteDance Seed(字节跳动种子基金)
;
School of Mathematical Sciences, Tongji University(同济大学数学科学学院)
;
Department of Automation, Tsinghua University(清华大学自动化系)
Few-shot Protein Fitness Prediction via In-context Learning and Test-time Training
少样本蛋白质适应性预测通过上下文学习和测试时训练
Felix Teufel, Aaron W. Kollasch, Yining Huang, Ole Winther, Kevin K. Yang, Pascal Notin, Debora S. Marks
机构
*
Harvard Medical School(哈佛医学院)
;
University of Copenhagen(哥本哈根大学)
;
Novo Nordisk A/S(诺和诺德公司)
;
Microsoft Research(微软研究院)
;
Technical University of Denmark(丹麦技术大学)