L2CEval: Evaluating Language-to-Code Generation Capabilities of Large Language Models
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG
Comments Project Website: https://l2c-eval.github.io/
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG
Comments Project Website: https://l2c-eval.github.io/
专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments Accepted for publication in the Associate Computer Machinery
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
Comments Solving Challenging Math Word Problems Using GPT-4 Code Interpreter with Code-based Self-Verification
专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments The first three authors contributed equally. Our code and data are publicly available at http://reasonwithpal.com/
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.LG
专题命中 数学推理 :planning(title)
LongWoF-Bench:评估用于可验证长工作流任务的EvoMap基因
机构 * EvoMap ; Tsinghua University(清华大学)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL
AI总结 该研究提出LongWoF-Bench基准,发现通过EvoMap将验证的执行轨迹转化为可复用的Gene,能显著提升多模型在长工作流任务上的表现,且优于Skill和参考蒸馏的Gene。
停止与路由大语言模型(LLM)评审小组
机构 * School of Computer Science and Engineering(计算机科学与工程学院) ; Sun Yat-sen University(中山大学)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL
AI总结 该研究将LLM评审小组设计建模为角色条件分配问题,提出策略优化评审调用,经多类审计对比,生成可复用的评审调用计划。
Comments 21 pages, 2 figures, 20 tables. Accepted at WISE 2026
StateBridge:面向大语言模型多智能体系统潜在通信的无训练隐藏状态对齐
机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI
AI总结 StateBridge 是一种无训练的潜在通信方法,通过闭式正交变换对齐大语言模型多智能体的隐藏状态,在 26 个模型-任务对中 22 个取得最优或并列最优性能,优于基线。
Comments 18 pages, 3 figures, 4 tables, accepted by COLM2026
数学视觉图表:评估大型语言模型数学图表生成能力的综合基准
机构 * Pandita AI Inc.(潘迪塔人工智能公司)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG
AI总结 本研究推出首个专门评估LLMs数学图表生成能力的基准Math-Vision Diagrams,涵盖文本到代码与图像范式,测试发现LLMs在该任务上存在困难,相关资源将开源。
Comments Accepted at ICANN 2026
ExeCRE:基于执行一致性引导的自校正代码生成可靠性估计
专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI
AI总结 ExeCRE是基于执行一致性的代码可靠性估计框架,可减少自校正代码生成中的误导性反馈,提升有效性与稳定性,在GPT-5.2搭配LiveCodeBench及数学推理场景均有显著收益。
Comments 13 pages, 5 figures. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)
何时投票,何时重写:基于分歧的策略路由用于测试时扩展
机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) ; Department of Foundation Model, 2012 Labs, Huawei(华为2012实验室基础模型部门) ; Harbin Institute of Technology, Shenzhen (HITSZ)(哈尔滨工业大学深圳(哈工大深圳))
专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI
AI总结 本文提出基于输出分歧的策略路由方法,通过动态选择不同扩展策略提升数学推理任务的准确性,减少计算成本。
给自己的笔记:大语言模型能从经验抽象中受益吗?
机构 * Auton Lab, Carnegie Mellon University(卡内基梅隆大学自动实验室)
专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL
AI总结 研究大语言模型能否从经验抽象中受益,通过从其在MATH训练集的痕迹提取抽象存入可检索库,探索推理时检索和强化学习两种使用模式,发现能提高模型在数学和逻辑推理基准上的性能,且框架可转移。
验证、修复、重复还是停止?大语言模型代理中用于有噪声验证-修复循环的稳健停止方法
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 研究大语言模型代理中验证-修复循环有噪声时缺乏停止原则的问题,提出VRR-Stop框架,通过四参数噪声模型和信念过滤估计有效性,依真实边际增益符号决策,配对VRR-Guard,提升了停止可靠性与真实有效性。
Comments 18 pages, 10 figures, 10 tables. Under review
AIMO可解释性挑战
机构 * National Institute of Informatics(日本国立信息学研究所) ; Munich Center for Machine Learning / MaiNLP LMU(慕尼黑机器学习中心/慕尼黑大学语言与文学计算研究所) ; University of Tübingen(图宾根大学) ; Fuzhou University(福州大学) ; Masaryk University(马萨里克大学) ; University College London(伦敦大学学院) ; University of Oxford(牛津大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI
AI总结 提出AIMO可解释性挑战,基于前沿数学语言模型内部机制区分稳健与虚假推理。利用AIMO问题等资源,提供推理问题、模型访问及鲁棒性评估,助参与者开发识别稳健模型的方法,创建新基准和基线系统,连接可解释性与泛化研究。
Comments Accepted Competition at NeurIPS 2026
OptiAgent:基于多智能体迭代精化的端到端优化建模
机构 * Instituto de Ciência e Tecnologia do Itaú(伊塔乌科技学院)
专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI
AI总结 针对运筹学问题自然语言描述转可求解数学形式与可执行代码的需求,OptiAgent采用多智能体迭代自校正与多回路验证架构,在多数优化任务基准上取得SOTA性能,建模过程可审计。
QED:一个用于生成开放问题数学证明的开源多智能体系统
专题命中 数学推理 :planning(abstract);verifier(abstract);分类 cs.AI
AI总结 提出开源多智能体系统QED,通过分解规划、生成论证和验证正确性的流水线,自动将研究问题转化为完整数学证明,并在18个研究级项目中成功生成5篇原创工作。
Adam的定律:大型语言模型中的文本频率定律
机构 * FaceMind Corporation(FaceMind公司) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL
AI总结 本文提出文本频率定律,通过优化文本频率提升LLM的提示和微调效果,并通过文本频率蒸馏和课程训练方法验证了其有效性。
Comments ACL 2026 Main Conference; The latest version
具有可验证奖励的串联强化学习
机构 * University of Toronto(多伦多大学) ; EPFL(瑞士联邦理工学院洛桑分校)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出串联强化学习(TRL),通过强弱模型交替生成推理链并共同奖励,在保持独立推理能力的同时提升模型间兼容性和可读性。
Comments 21 pages,7 figures,8 tables
打破自回归诅咒:动态认知熵编排的可擦除强化学习用于大语言模型
机构 * SenseTime(商汤科技) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
AI总结 提出动态认知熵编排的可擦除强化学习(E³RL),通过将模型内生的局部自回归交叉熵作为认知不确定性坐标,利用分段自适应动态阈值和优势分配精准切除逻辑缺陷并重用KV缓存,解决长序列推理中的自回归级联崩溃问题。
并行测试时扩展与多序列验证器
机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 提出多序列验证器(MSV),通过条件化候选集预测正确性,改善校准性,提升最佳选择准确率并实现早停策略,在数学推理任务中以不到一半延迟达到相同精度。
逃离认知陷阱:使用现成模型高效解决竞赛数学问题
机构 * Princeton University(普林斯顿大学) ; Princeton Language and Intelligence(普林斯顿语言与智能)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG
AI总结 提出一种推理流水线,利用现成模型以极低成本在IMO风格数学问题上达到最佳性能,通过猜想提取和上下文分离解决求解器-评分器流水线中的认知陷阱问题。
跨模型分歧作为无标签正确性信号
机构 * Independent Researcher(独立研究者) ; Department of Computer Science Columbia University(计算机科学系哥伦比亚大学)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 提出跨模型分歧作为无标签正确性指标,通过验证模型对生成模型答案的困惑度或熵来检测错误,无需训练或标签,在多个基准上优于模型内不确定性方法。
多智能体协作的反事实信用策略优化
机构 * Beihang University(北航) ; Peking University(北京大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 针对多智能体大语言模型协作中信用分配难题,提出CCPO框架,通过反事实信用估计和验证器锚定的自评估两种分配器,将团队奖励转化为个体学习信号,提升数学推理任务表现。
Trace2Skill: 将轨迹局部经验转化为可迁移的代理技能
机构 * ETH Zürich University of Zurich(苏黎世联邦理工学院) ; Peking University(北京大学) ; Zhejiang University(浙江大学) ; Qwen Large Model Application Team, Alibaba(阿里巴巴文心一言应用团队)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI
AI总结 本文提出Trace2Skill框架,通过归纳推理将广泛执行轨迹整合为统一的技能目录,有效提升代理技能的可迁移性和实用性,适用于多种领域。
Comments Work in Progress. May version add more experiments
T$^\star$:通过轨迹感知强化学习实现掩码扩散语言模型的渐进块缩放
机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; School of Mathematical Sciences(数学科学学院) ; Shanghai Jiao Tong University(上海交通大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL
AI总结 提出T$^\star$方法,利用基于TraceRL的训练课程,在掩码扩散语言模型中渐进增大块大小,实现高并行解码且性能损失极小。
GIFT:游戏作为通用型LLM的非正式训练
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; University of Washington(华盛顿大学) ; National University of Singapore(新加坡国立大学)
专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL
AI总结 提出将游戏作为非正式训练环境,结合协调子任务训练(CST)方法,提升LLM在抽象推理、规划、创造力等通用能力上的泛化性能。
GTBench:一个基于课程体系的基准,用于评估大语言模型作为图论数学研究助手的能力
机构 * Louisiana State University(路易斯安那州立大学) ; Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) ; Texas A&M-Central Texas(德克萨斯大学阿姆斯特朗中央分校)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文提出GTBench基准,通过三个难度递增的图论问题组(本科定义、算法推理、研究生证明)评估大语言模型的数学推理能力,发现GPT-5表现最佳,其他模型随难度下降显著,并揭示了人类与自动评估者之间的系统性分歧。
Comments 19 pages, 5 figures, 7 tables
基于动态信任感知的稀疏通信拓扑用于基于LLM的多智能体共识
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
AI总结 提出DySCo动态稀疏共识机制,通过信任感知的边选择降低通信开销并保持共识质量。
Comments 11 pages, 3 figures, 5 tables