机构
*
Knight Foundation School of Computing and Information Sciences, Florida International University(佛罗里达国际大学奈特基金会计算与信息科学学院)
;
SRI International(SRI国际公司)
;
University of Florida(佛罗里达大学)
;
Oak Ridge National Laboratory(橡树岭国家实验室)
;
Army Cyber Institute, United States Military Academy(美国军事学院陆军网络研究所)
;
Oakland University(奥克兰大学)
Reinforcing Multi-Turn Reasoning in LLM Agents via Fine-Grained Reward Structure and Credit Assignment
通过细粒度奖励结构与信用分配增强大语言模型智能体的多轮推理能力
Quan Wei, Siliang Zeng, Chenliang Li, Zhongruo Wang, William Brown, Oana Frunza, Wei Deng, Anderson Schneider, Yuriy Nevmyvaka, Yang Katie Zhao, Alfredo Garcia, Mingyi Hong
机构
*
University of Minnesota(明尼苏达大学)
;
Texas A&M University(德克萨斯A&M大学)
;
Prime Intellect
;
Morgan Stanley(摩根大通)
AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
你的强化学习奖励函数是你的最佳搜索PRM:统一强化学习与基于搜索的文本生成
Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che, Dimitris N. Metaxas
机构
*
Rutgers University(新泽西州立大学)
;
Nanyang Technological University(南洋理工大学)
;
University of Connecticut(康涅狄格大学)
;
Fudan University(复旦大学)
;
NVIDIA Research(NVIDIA研究)
;
Red Hat AI Innovation(红帽AI创新)
;
MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室)
;
Massachusetts Institute of Technology(麻省理工学院)
CommentsPre-publication draft. Forthcoming as Open Access from Oxford University Press. Please cite the OUP version when available. Note title change: previously, "Going Whole Hog: A Philosophical Defence of AI Cognition"
Yujun Wang, Tao Zhang, Jinhe Bi, Aniri, Wenxuan Ye, Boliang Liu, Sikuan Yan, Shuning Wang, Xuebing Zhou, Sören Pirk, Hinrich Schütze, Yunpu Ma
机构
*
LMU Munich(慕尼黑大学)
;
Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
;
Huawei Heisenberg Research Center(华为海森堡研究中心)
;
Zhejiang University(浙江大学)
;
Technical University of Munich (TUM)(慕尼黑工业大学)
;
TU Berlin(柏林工业大学)
;
Kiel University(基尔大学)