Dual-Phase LLM Reasoning: Self-Evolved Mathematical Frameworks
双阶段LLM推理:自演化数学框架
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);self-correction(abstract)
AI总结 本文提出双阶段训练框架,通过自动生成的长链式思考数据增强模型自我纠正能力,提升数学问题解决性能。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
双阶段LLM推理:自演化数学框架
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);self-correction(abstract)
AI总结 本文提出双阶段训练框架,通过自动生成的长链式思考数据增强模型自我纠正能力,提升数学问题解决性能。
攀登推理的阶梯:在SFT之后,大语言模型能解决什么问题?
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Wisconsin, Madison(威斯康星大学麦迪逊分校) ; Allen Institute for AI(人工智能研究院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过分析AIME24数据集,揭示了大语言模型在数学推理任务中不同难度层级的进阶要求,发现SFT对提升推理能力有限,而扩大数据规模更有效。
更短但不更差:通过易样本作为长度正则化器进行节俭推理
机构 * MBZUAI ; Ecole Polytechnique(巴黎政治学院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 通过易样本作为长度正则化器,使模型在不增加输出长度的情况下更高效地解决复杂问题。
TIME:面向上下文触发的显式推理的时序智能元推理引擎
机构 * Independent Researcher(独立研究者)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 TIME通过引入时序智能元推理引擎,改进对话模型的显式推理能力,提升时间感知和推理效率。
Comments 14 pages, 3 figures with 27 page appendix. See https://github.com/The-Coherence-Initiative/TIME and https://github.com/The-Coherence-Initiative/TIMEBench for associated code
AdaFuse: 用于大语言模型的自适应集成解码与测试时缩放
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 AdaFuse通过自适应集成解码与测试时缩放,提升大语言模型在多种任务上的生成性能。
IIB-LPO: 通过迭代信息瓶颈进行潜在策略优化
机构 * DeepSeek-AI
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 IIB-LPO通过迭代信息瓶颈方法,解决LLM推理中的探索崩溃问题,实现更多样化的推理路径和更高的性能表现。
Hi-ZFO:通过重要性引导的张量选择实现层次化零阶和一阶LLM微调
机构 * School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) ; State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 Hi-ZFO通过结合一阶和零阶优化,提升LLM微调的精度与探索能力,有效解决训练中的局部极小值问题。
Comments 13 pages, 4 figures
协调标记与序列:动态混合策略优化用于RLVR
机构 * School of Informatics, Xiamen University(厦门大学信息学院) ; LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司语言模型团队) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出动态混合策略优化方法,通过结合标记级和序列级重要性比率,提升RLVR在数学推理任务中的性能。
基于数学知识图谱的方程驱动框架用于基于方程的预测和可靠的增材制造
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出基于数学知识图谱的框架,结合大语言模型与增材制造知识图谱,实现可靠的知识提取和外推建模,提升预测的准确性和物理一致性。
Comments preprint