RL Tango: Reinforcing Generator and Verifier Together for Language Reasoning
机构 * MIT(麻省理工学院) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
Comments NeurIPS 2025. The first two authors contributed equally