Broken Chains: The Cost of Incomplete Reasoning in LLMs
断裂的链条:在大语言模型中不完整推理的成本
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG
AI总结 研究探讨了大语言模型在不同推理模式下在标记限制下的表现,发现截断推理可能有害,代码退化较好,混合推理表现欠佳,鲁棒性取决于模型。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
断裂的链条:在大语言模型中不完整推理的成本
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG
AI总结 研究探讨了大语言模型在不同推理模式下在标记限制下的表现,发现截断推理可能有害,代码退化较好,混合推理表现欠佳,鲁棒性取决于模型。
可扩展的大语言模型推理加速与低秩蒸馏
机构 * CMU Department of Electrical and Computer Engineering(卡内基梅隆大学电气与计算机工程系) ; Carnegie Mellon University(卡内基梅隆大学) ; Meta FAIR at Meta(Meta FAIR) ; CMU(卡内基梅隆大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Caprese通过低秩蒸馏方法恢复高效推理方法中丢失的数学推理能力,同时减少参数数量和延迟,提升响应效率。
基于先例的推理:通过测试时先例学习缓解大推理模型中的过度思考
机构 * South China University of Technology(华南理工大学) ; Pazhou Laboratory(黄埔实验室) ; DAMO Academy(达摩院)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 PIR通过测试时先例学习,优化大推理模型的推理过程,减少冗余探索并提升准确率与效率的平衡。
wd1: 为扩散语言模型推理的加权策略优化
机构 * Department of Statistical Science, University College London, United Kingdom(伦敦大学统计科学系) ; UCL AI Centre, University College London, United Kingdom(伦敦大学UCL人工智能中心) ; Graduate School of AI, Ulsan National Institute of Science and Technology, South Korea(韩国乌山国立科学与技术研究院人工智能研究生院) ; Department of Mathematics and Computer Science, Universität Basel, Switzerland(巴塞尔大学数学与计算机科学系)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 wd1通过加权策略优化提升扩散语言模型推理能力,实现更高准确率和更低计算成本。
Comments Accepted to ICLR 2026
RV-Syn: 基于结构化函数库的理性且可验证的数学推理数据合成
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) ; Ant Group(蚂蚁集团) ; Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理重点实验室)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 RV-Syn通过结构化函数库生成可验证的数学推理数据,提升数据质量和生成效率。
Comments Accepted to EACL 2026
从模糊到精确:通过有理算术的Halo架构实现无限深度推理
机构 * Hansheng Ren(独立研究者)
专题命中 数学推理 :reasoning(title);分类 cs.AI、cs.LG
AI总结 Halo架构通过有理算术实现无限深度推理,结合双环拓扑和精确推断单元,提升模型稳定性和效率,实现从模糊到精确的数学框架转型。
Comments Architecture update: Formalizes the Dual-Ring Topology and the Clean Transformer
通过克隆实现通用学习委托
机构 * Qiuzhen College, Tsinghua University(清华大学齐振学院) ; Pattern Recognition Center, WeChat AI, Tencent Inc(微信AI模式识别中心,腾讯公司)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 SELFCEST通过代理强化学习实现通用学习委托,利用克隆技术在不同并行上下文中分配资源,提升数学推理和长上下文问答任务的准确性与效率。
Comments Code available at https://github.com/SuffixAutomata/SELFCEST
超大规模进化策略
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 EGGROLL通过低秩学习提升算术强度,实现大规模参数模型的高效训练,稳定预训练非线性循环语言模型并提升推理任务性能。
Comments 76 pages, 15 figures, Website at https://eshyperscale.github.io/
基于有前景标记的强化学习用于大语言模型
机构 * huawei(华为技术有限公司)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 基于有前景标记的强化学习框架通过解耦战略决策与标记生成,有效提升大语言模型的训练稳定性与样本效率。
LACONIC:面向LLM的长度感知约束强化学习
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Salesforce AI Research(Salesforce AI研究院) ; National University of Singapore(新加坡国立大学) ; University of Alberta(阿尔伯塔大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 LACONIC通过长度感知约束强化学习,在保持任务性能的同时有效控制输出长度,减少50%以上。
R-Diverse: 缓解自博弈LLM训练中的多样性幻觉
机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Wuhan AI Research(武汉人工智能研究所) ; National University of Singapore(新加坡国立大学) ; Tsinghua University(清华大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 R-Diverse通过引入记忆增强惩罚和技能感知测量,缓解自博弈LLM训练中的多样性幻觉问题,提升模型推理能力。
离散共轭匹配
机构 * Massachusetts Institute of Technology(麻省理工学院) ; FAIR at Meta(Meta 的 FAIR)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出离散共轭匹配方法,用于微调离散生成模型,通过离散域上的共轭估计器解决熵正则化奖励优化问题。
Comments ICLR 2026
CodeGlance:通过多维特征分析理解LLM中的代码推理挑战
专题命中 代码与定理证明 :reasoning(title,abstract);CoT(abstract)
AI总结 CodeGlance通过多维特征分析揭示LLM在代码推理中的挑战,发现未见过的函数推理对小型模型尤为困难,提出改进策略并提供开发指导。
用LLM增强的递归推理器近似人类战略推理
机构 * Royal Holloway University of London(伦敦皇家霍洛威大学)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出了一种基于LLM增强的递归推理器框架,通过多智能体超游戏模型评估LLM的递归推理能力,并展示了其在近似人类行为和最优解达成方面的优势。
面向执行状态的LLM推理用于自动化漏洞证明生成
专题命中 代码与定理证明 :reasoning(title,abstract)
AI总结 DrillAgent通过结合LLM语义推理与执行状态反馈,实现自动化漏洞证明生成,显著提升漏洞检测效率。
Comments Version 1.0 (13 pages, 7 figures)
首次证明冲刺
机构 * Hyperreal Enterprises Ltd(超现实企业有限公司)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI
AI总结 本文通过多智能体证明冲刺方法,解决十个研究级问题,采用结构意识验证和层切换策略提高证明可靠性与校准。
Comments 144 pages, 7 color images. Submission to First Proof February 2026 (arxiv:2602.05192, https://1stproof.org/), uploaded 20:07 Friday, 13 February 2026 Pacific Time (PT)
通过自我进化实现Rust代码的自动证明生成
机构 * Peking University(北京大学) ; Microsoft Research(微软研究院) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Columbia University(哥伦比亚大学) ; University of California Irvine(加州大学 Irvine 分校)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI
AI总结 SAFE框架通过自我进化循环和自我调试机制,提升开源模型自动编写Rust代码证明的能力,准确率达52.52%
UAVGENT: 一种语言引导的分布式控制框架
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 UAVGENT通过结合语言引导的任务推理与分布式反馈控制,实现了多无人机系统在复杂任务中的鲁棒性和稳定性。
OneLatent:视觉潜在推理中的单令牌压缩
机构 * Tsinghua University(清华大学) ; Institute of Science Tokyo(东京科学研究所) ; Waseda University(早稻田大学)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)
AI总结 OneLatent通过将中间推理压缩为单个潜在令牌,提升了视觉推理效率,同时保持较高的准确性。
Interspeech 2026音频推理挑战:评估音频推理模型和代理的推理过程质量
机构 * Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; Queen Mary University of London(伦敦大学Queen Mary) ; NVIDIA(NVIDIA公司) ; Carnegie Mellon University(卡内基梅隆大学) ; Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) ; Microsoft Corporation(微软公司)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 Interspeech 2026音频推理挑战通过评估推理过程质量,探讨了音频推理模型和代理在事实性和逻辑性方面的表现及改进方向。
Comments The official website of the Audio Reasoning Challenge: https://audio-reasoning-challenge.github.io
人工智能武器与影响:前沿模型在模拟核危机中展现出复杂的推理能力
机构 * King’s College London(伦敦国王学院)
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI
AI总结 研究通过模拟核危机检验前沿AI模型的策略推理能力,发现其在复杂决策中展现出与人类相似的推理模式,但存在独特行为特征。
Comments 45 pages, 6 figures, 27 tables
构建杀伤链:一种零样本框架,用于边缘节点上的目标验证和战术推理
机构 * With the Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系)
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出了一种零样本框架,通过边缘设备实现目标验证和战术推理,验证了分层架构在动态军事环境中的有效性。
Comments 8 Pages, 3 Figures
代数量子智能:一种可重复的机器创造力新框架
机构 * Happiness Planet, Ltd.(幸福星球有限公司) ; Hitachi, Ltd.(日立株式会社)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出代数量子智能框架,通过非交换代数结构扩展语义空间,提升机器创造力的可重复性和表现。
Protect$^*$: 通过神经符号状态编码实现可操控的逆合成
机构 * Deep Forest Sciences(深林科技) ; Departament de Farmacologia, Toxicologia i Química Terapèutica, Universitat de Barcelona(巴塞罗那大学药理学、毒理学与治疗化学系) ; Institut de Nanociència i Nanotecnologia IN2UB, Universitat de Barcelona(巴塞罗那大学纳米科学与纳米技术研究所)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Protect$^*$通过神经符号状态编码实现逆合成的可控生成,结合规则推理与神经模型,提升化学合成路径的可靠性与准确性。
通过隐式学习实现提升的关系概率推断
机构 * Washington University in St. Louis(华盛顿大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出了一种基于隐式学习的方法,实现第一-order概率逻辑的隐式学习和提升推断,解决了传统方法在模型构建上的局限性。
MATEO:一种多模态基准,用于LVLMs中的时间推理和规划
机构 * Signals and Interactive Systems Lab, University of Trento, Italy(特伦托大学信号与交互系统实验室) ; University of Trento(特伦托大学) ; Amazon(亚马逊)
专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MATEO是一个多模态基准,用于评估和提升大型视觉语言模型在时间推理和规划方面的能力。
语言模型中的内部规划:刻画视野与分支意识
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 规划推理 :planning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过分析语言模型内部计算结构,揭示规划视野与分支意识的特性,为理解模型内部动态提供通用工具。
Comments Accepted to ICLR 2026
基于提示的低空边缘智能:模块化代理与生成推理
专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 本文提出P2AECF框架,通过模块化代理和生成推理实现灵活、高效和适应的低空边缘智能。
ParaCook: 多智能体系统中高效时间规划的研究
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of California, Merced(加州大学梅尔德分校)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 ParaCook通过简化动作空间和烹饪任务实例化,为多智能体系统高效时间规划提供基准测试框架,评估LLMs在并行协调和高层次优化中的表现。
BFS-PO:用于大规模推理模型的最佳优先搜索
机构 * Department of Engineering, University of Modena(Modena大学工程系) ; Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 BFS-PO是一种通过最佳优先搜索策略减少大规模推理模型过度思考问题的强化学习算法,提高了推理准确性和响应简洁性。