Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
高效路径与密集奖励:用于大语言模型的概率流推理
机构 * Meituan(美团) ; Tsinghua University(清华大学) ; Peking University(北京大学) ; Dalian University of Technology(大连理工大学)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)
AI总结 CoT-Flow通过概率流框架提升大语言模型的推理效率与性能,采用流引导解码和流强化学习方法实现信息高效推理路径和密集奖励函数。