Expected Reward Prediction, with Applications to Model Routing
预期奖励预测,及其在模型路由中的应用
机构 * Stanford University Inception Labs(斯坦福大学Inception实验室) ; Stanford University Cognition Labs(斯坦福大学Cognition实验室) ; Google DeepMind(谷歌DeepMind) ; University of Chicago(芝加哥大学)
AI总结 本文研究了基于响应级奖励模型预测模型对特定提示的适应性,提出了一种简单有效的预期奖励预测路由方法,实验证明其在模型路由中的优越性。
Comments ICML 2025 Workshop on Models of Human Feedback for AI Alignment