Progressive Content Refinement with Decaying Reward Joint LinUCB
结合衰减奖励的渐进式内容优化与联合LinUCB
机构 * Rakuten Group, Inc.(乐天集团)
专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对现有迭代优化方法忽略奖励衰减导致过度利用的问题,提出结合奖励衰减建模与EM算法的联合LinUCB算法,在Sentiment Reversal和GSM8K基准上显著优于强基线。