Dual-Phase LLM Reasoning: Self-Evolved Mathematical Frameworks
双阶段LLM推理:自演化数学框架
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);self-correction(abstract)
AI总结 本文提出双阶段训练框架,通过自动生成的长链式思考数据增强模型自我纠正能力,提升数学问题解决性能。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
双阶段LLM推理:自演化数学框架
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);self-correction(abstract)
AI总结 本文提出双阶段训练框架,通过自动生成的长链式思考数据增强模型自我纠正能力,提升数学问题解决性能。
攀登推理的阶梯:在SFT之后,大语言模型能解决什么问题?
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Wisconsin, Madison(威斯康星大学麦迪逊分校) ; Allen Institute for AI(人工智能研究院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过分析AIME24数据集,揭示了大语言模型在数学推理任务中不同难度层级的进阶要求,发现SFT对提升推理能力有限,而扩大数据规模更有效。
更短但不更差:通过易样本作为长度正则化器进行节俭推理
机构 * MBZUAI ; Ecole Polytechnique(巴黎政治学院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 通过易样本作为长度正则化器,使模型在不增加输出长度的情况下更高效地解决复杂问题。
TIME:面向上下文触发的显式推理的时序智能元推理引擎
机构 * Independent Researcher(独立研究者)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 TIME通过引入时序智能元推理引擎,改进对话模型的显式推理能力,提升时间感知和推理效率。
Comments 14 pages, 3 figures with 27 page appendix. See https://github.com/The-Coherence-Initiative/TIME and https://github.com/The-Coherence-Initiative/TIMEBench for associated code
AdaFuse: 用于大语言模型的自适应集成解码与测试时缩放
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 AdaFuse通过自适应集成解码与测试时缩放,提升大语言模型在多种任务上的生成性能。
IIB-LPO: 通过迭代信息瓶颈进行潜在策略优化
机构 * DeepSeek-AI
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 IIB-LPO通过迭代信息瓶颈方法,解决LLM推理中的探索崩溃问题,实现更多样化的推理路径和更高的性能表现。
Hi-ZFO:通过重要性引导的张量选择实现层次化零阶和一阶LLM微调
机构 * School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) ; State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 Hi-ZFO通过结合一阶和零阶优化,提升LLM微调的精度与探索能力,有效解决训练中的局部极小值问题。
Comments 13 pages, 4 figures
协调标记与序列:动态混合策略优化用于RLVR
机构 * School of Informatics, Xiamen University(厦门大学信息学院) ; LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司语言模型团队) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出动态混合策略优化方法,通过结合标记级和序列级重要性比率,提升RLVR在数学推理任务中的性能。
基于数学知识图谱的方程驱动框架用于基于方程的预测和可靠的增材制造
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出基于数学知识图谱的框架,结合大语言模型与增材制造知识图谱,实现可靠的知识提取和外推建模,提升预测的准确性和物理一致性。
Comments preprint
从实验室到现实应用:在仓库级别评估代理代码推理
机构 * The Chinese University of Hong Kong(香港中文大学) ; Sun Yat-sen University(中山大学)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 RepoReason提出了一种白盒诊断基准测试,通过执行驱动的突变框架和动态程序切片,量化推理能力,揭示集成宽度是代理代码推理的主要瓶颈。
逻辑参数化神经符号推理:通过可控逻辑形式实现可验证的大语言模型推理
机构 * University of Luxemburg(卢森堡大学) ; University of Sheffield(谢菲尔德大学)
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出逻辑参数化框架,通过可控逻辑形式提升神经符号推理的鲁棒性与适应性,实验表明内部逻辑策略在不同领域具有更优表现。
Comments Work in progress
检测、解释、升级:面向LLM代理的可持续对话破裂管理
机构 * Department of Electrical and Computer Engineering and Ingenuity Labs Research Institute, Queen’s University(电气与计算机工程系和Ingenuity Labs研究研究所,皇后大学)
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL
AI总结 本文提出了一种可持续对话破裂管理框架,通过高效检测器和升级架构,在LLM代理中实现资源高效的对话破裂管理,提升对话AI的可靠性和成本效益。
KALE-LM-Chem:迈向化学人工智能脑的愿景与实践
机构 * University of Science and Technology of China(科学技术大学) ; ShanghaiTech University(上海科技大学) ; USTC Knowledge Computing Lab(USTC知识计算实验室) ; State Key Laboratory of Communication Content Cognition People's Daily Online(通信内容认知国家重点实验室)
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出KALE-LM-Chem模型,旨在通过整合领域知识和逻辑,推动化学领域的智能AI发展,提升科学发现效率。
利用逻辑编程和大语言模型自动化生成MDP用于机器人应用
机构 * Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学) ; Department of Industrial Engineering, University of Trento(工业工程系,特伦托大学)
专题命中 逻辑推理 :planning(abstract);分类 cs.AI
AI总结 本文提出结合大语言模型与形式方法,通过逻辑编程自动生成可执行的MDP策略,用于机器人中的概率规划。
Comments 9 pages, 11 figures, 2 tables, 2 algorithms, accepted for publication in IEEE Robotics and Automation Letters
Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 2, pp. 1770-1777, Feb. 2026
面向上下文的解码方法用于忠实的视觉-语言生成
机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学)
专题命中 逻辑推理 :reasoning(abstract)
AI总结 本文提出了一种无需训练的上下文嵌入注入方法,通过利用上下文嵌入信号在解码过程中保持视觉一致性,有效减少视觉-语言模型中的幻觉问题。
ART:可解释性声明验证的自适应推理树
机构 * Capital One ; Stevens Institute of Technology(史蒂文斯理工学院)
专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG
AI总结 ART通过自适应推理树提升声明验证的可解释性和可靠性,通过分层论证结构和法官LLM裁决实现透明且可挑战的决策。
用生成代理模拟城市规划中的多利益相关者决策
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 本研究通过多生成代理系统模拟城市规划中的多利益相关者决策,探讨人口因素对集体决策的影响,并提升决策的公平性和效率。
Journal ref Advances in Transdisciplinary Engineering, Vol. 76, pp. 40-49, IOS Press, 2026
重新思考供应链规划:一种生成范式
机构 * Tsinghua University, Beijing, China(清华大学) ; JD.com, Beijing, China(京东) ; Faculty of Engineering and Faculty of Business and Economics, The University of Hong Kong, China(香港大学工程学院和商学院) ; College of Engineering, University of California, Berkeley, CA, USA(加州大学伯克利分校工程学院)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 本文提出一种基于生成式人工智能的供应链规划范式,通过智能代理框架提升规划准确性与库存率,实现动态需求下的适应性协调。
符号规划与在极度密集环境中无分配代理的多智能体路径寻找
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 本文提出五种基于搜索的算法,用于解决在极度密集环境中无分配代理的多智能体路径寻找问题,通过图搜索方法高效生成重新排列计划。
Comments AAAI Conference on Artificial Intelligence (AAAI-26)
通过整合基于大语言模型的规划和机动性驱动的控制实现非抓取工具-物体 manipulation
机构 * organization= Department of Mechanical Engineering, The Hong Kong Polytechnic University , addressline= KLN, Hong Kong ; organization= School of Advanced Engineering, The Great Bay University , addressline= Dongguan, China ; organization= Department of Robotics, Mohamed Bin Zayed University of Artificial Intelligence , addressline= Abu Dhabi, UAE ; organization= Department of Surgery, The Chinese University of Hong Kong , addressline= NT, Hong Kong ; organization= Department of Computer Science, University of Liverpool , addressline= Liverpool, UK
专题命中 规划推理 :planning(title,abstract)
AI总结 本文提出了一种结合大语言模型和机动性驱动控制的方法,用于实现非抓取工具-物体 manipulation任务。
战术空交通管制中的未来能力代理
机构 * University of Exeter(埃克塞特大学) ; NATS(英国航空交通服务提供商)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Agent Mallard,一种基于规则的前瞻性规划代理,用于战术空交通管制,通过嵌入随机数字双胞胎实现安全冲突解决,并在简化场景中展示与专家推理一致的性能。
见或说图:基于视觉语言模型的 agent 驱动可扩展图结构理解
机构 * University of Science and Technology of China(中国科学技术大学) ; Data Darkness Lab, MIRACLE Center, USTC(数据黑暗实验室,MIRACLE中心,USTC) ; MIRACLE Center, Suzhou Institute for Advance Research, USTC(MIRACLE中心,苏州先进研究所,USTC)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 GraphVista 是一种基于视觉语言模型的 agent 驱动框架,通过分层图检索和模态协调机制,实现大规模图结构理解的可扩展性和性能提升。
ACDZero:用于掌握自动化网络防御的MCTS代理
机构 * Dept of ECE, George Washington University(电子工程系,乔治华盛顿大学) ; Dept of ECE, Northeastern University(电子工程系,东北大学) ; Dept of EECS, United States Military Academy(电子工程与科学系,美国军事学院)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG
AI总结 ACDZero通过基于MCTS的规划策略和图神经网络实现高效自动化网络防御,提升防御奖励和鲁棒性。
QueryGym: 关系数据库中的分步交互
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 QueryGym通过提供关系数据库分步交互环境,促进LLM查询规划代理的透明评估与错误修复研究。
PRISMA:基于强化学习的多智能体架构中两阶段策略优化
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 PRISMA通过两阶段组相对策略优化,结合推理引导协作,解决多跳问答中的检索崩溃和学习不稳定问题,实现高性能和稳定部署。
通过智能仿真建模实现协议优化:PRISM
机构 * Argonne National Laboratory(阿贡国家实验室)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 PRISM通过智能仿真建模实现实验协议的自动化设计、验证和执行,结合语言模型代理、数字孪生验证和机器人执行,提供端到端的实验流程解决方案。
Comments 43 pages, 8 figures, submitted to RSC Digital Discovery. Equal contribution: B. Hsu, P.V. Setty, R.M. Butler. Corresponding author: A. Ramanathan
代理AI与网络安全的综述:挑战、机遇与用例原型
机构 * Tennessee Tech University(田纳西科技大学) ; University of Nebraska Omaha(内布拉斯加大学奥马哈分校) ; Purdue University(普渡大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本文综述了代理AI在网络安全中的应用,探讨了其在防御和攻击方面的双重用途,分析了系统性风险,并展示了三个实际用例以说明其在网络安全中的行为和影响。
医疗人设悖论:临床语言模型中的行为先验
机构 * Brown University(布朗大学) ; University of Tuebingen(图宾根大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究揭示医疗人设在临床语言模型中产生上下文依赖的性能权衡,显示其在重症护理任务中提升表现,但在初级护理中降低性能,且互动风格影响风险倾向。
证据链的构建:基于引用感知的鲁棒深度搜索代理强化学习
机构 * Tsinghua University(清华大学) ; Zhipu AI(智谱AI)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出引用感知评分框架和组相对策略优化方法,用于提升深度搜索代理的鲁棒性和推理质量。
真相的 facade:揭示并缓解 LLM 对欺骗性证据的易感性
机构 * Xi’an Jiaotong University(西安交通大学) ; National University of Singapore(新加坡国立大学) ; Yunnan University(云南大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出 MisBelief 框架揭示 LLM 对复杂欺骗性证据的脆弱性,并提出 DIS 机制缓解这一问题,提升模型对误导性证据的抵御能力。