Learning Planning-based Reasoning by Trajectories Collection and Process Reward Synthesizing
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
Comments 17 pages, 9 figures. EMNLP 2024