Comments15 pages. Extended preprint incorporating versions accepted at Agent Skills '26 (ACM CAIS 2026) and the KDD 2026 Workshop on Enterprise AI Agents: From Prototypes to Production (oral presentation). Open-source implementation: this https URL (https://github.com/NVIDIA/SkillEvaluator)
AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
你的强化学习奖励函数是你的最佳搜索PRM:统一强化学习与基于搜索的文本生成
Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che, Dimitris N. Metaxas
机构
*
Rutgers University(新泽西州立大学)
;
Nanyang Technological University(南洋理工大学)
;
University of Connecticut(康涅狄格大学)
;
Fudan University(复旦大学)
;
NVIDIA Research(NVIDIA研究)
;
Red Hat AI Innovation(红帽AI创新)
;
MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室)
;
Massachusetts Institute of Technology(麻省理工学院)
HIP: Hessian Interatomic Potentials without derivatives
HIP从臀部射出:无需导数的Hessian互作用势
Andreas Burger, Luca Thiede, Nikolaj Rønne, Varinia Bernales, Nandita Vijaykumar, Tejs Vegge, Arghya Bhowmik, Alan Aspuru-Guzik
机构
*
University of Toronto(多伦多大学)
;
Vector Institute for Artificial Intelligence(向量人工智能研究所)
;
Technical University of Denmark(丹麦技术大学)
;
CAPeX Pioneer Center for Accelerating P2X Materials Discovery(CAPeX加速P2X材料发现先锋中心)
;
Acceleration Consortium(加速联盟)
;
Canadian Institute for Advanced Research (CIFAR)(加拿大高等研究院)
;
NVIDIA(英伟达)