Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B
更多采样,更少反思:在相同 token 成本下,自改进(Self-Refine)和反思(Reflexion)不敌重复采样,模型规模从 15 亿到 70 亿参数
专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究发现,在相同 token 成本下,自改进、反思等含自我检查的语言模型方法均不敌重复采样,且模型规模增长会使自我检查方法的性能优势减弱,70 亿参数模型上的改写方法仍显著弱于基线。