SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning
机构 * Peking University(北京大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft(微软公司)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
机构 * Peking University(北京大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft(微软公司)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
专题命中 复杂问题求解 :reasoning(title,abstract)
机构 * College of Future Information Technology, Fudan University(复旦大学未来信息科技学院) ; StepFun ; Shanghai Innovation Institute(上海创新研究院)
专题命中 复杂问题求解 :self-correction(title)
Comments ICCV 2025
机构 * IBM T.J. Watson Research Center(IBM T.J. Watson研究院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI、cs.LG
Comments 47 pages, 10 figures. Code: https://github.com/agodinezmm2007/docling_mod. Demo: https://youtu.be/ZCy5ESJ1gVE?si=K8CttwgTj7yGrWjn. ETL+multi-agent RAG framework for literature synthesis, 35.1% improvement over PDF chunking. Real application: reduced 17,400 papers to 24 relevant ones (99.86%) in 10 minutes for wastewater epidemiology review
专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.CL、cs.AI
Journal ref NeurIPS 2024 Creativity and Generative AI Workshop
专题命中 复杂问题求解 :reasoning(abstract)
Comments TRL@ACL2025