Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning
逐步惩罚以实现高效推理链
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Amazon(亚马逊)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SWAP通过逐步自适应惩罚减少推理链长度并提升准确性。
Comments Preprint