Skill Issue: Are Skills Language-Invariant in LLMs?
技能问题:大型语言模型的技能是否具有语言不变性?
Bobby Cheng, Adam Gaber, Zhengyuan Liu, Catherine Arnett, Omer Goldman, Cheston Tan, Leshem Choshen
机构
*
A*STAR(新加坡科技研究局)
;
Weizmann Institute of Science(魏茨曼科学研究所)
;
MIT-IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室)
;
University of Cambridge(剑桥大学)
;
EleutherAI
Precipitation Downscaling Using Foundation Model-Conditioned Diffusion
基于基础模型条件扩散的降水降尺度方法
Victor Nascimento Ribeiro, Jorge Guevara, Jorge Sebastian Moraga, Chris Lucas, Natalie Lord, Andrew Taylor, Edward Lockhart, Will Trojak, Johannes Schmude, Anne Jones
机构
*
IBM Research(IBM研究院)
;
Fathom
;
STFC Hartree Centre(STFC哈特雷中心)
AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
你的强化学习奖励函数是你的最佳搜索PRM:统一强化学习与基于搜索的文本生成
Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che, Dimitris N. Metaxas
机构
*
Rutgers University(新泽西州立大学)
;
Nanyang Technological University(南洋理工大学)
;
University of Connecticut(康涅狄格大学)
;
Fudan University(复旦大学)
;
NVIDIA Research(NVIDIA研究)
;
Red Hat AI Innovation(红帽AI创新)
;
MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室)
;
Massachusetts Institute of Technology(麻省理工学院)