Mining Intrinsic Rewards from LLM Hidden States for Efficient Best-of-N Sampling
从LLM隐藏状态中挖掘内在奖励以实现高效的Best-of-N采样
机构 * Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫阳学院) ; National University of Singapore(新加坡国立大学) ; Tongji University(同济大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
AI总结 SWIFT通过从LLM隐藏状态中挖掘内在奖励,实现高效Best-of-N采样,提升模型性能并减少计算成本。
Comments Accepted by KDD 2026 (Research Track). Project page: https://aster2024.github.io/swift-website/