Auditing CoT Answer-Hijack Patches: Source-Control Certificates with Type-I Guarantees
链式思维答案劫持的选择感知诊断
专题命中 数学推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract)
AI总结 针对链式思维答案劫持攻击,提出选择感知诊断方法,通过激活修补定位脆弱区域,并验证恢复依赖于同问题干净源。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
链式思维答案劫持的选择感知诊断
专题命中 数学推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract)
AI总结 针对链式思维答案劫持攻击,提出选择感知诊断方法,通过激活修补定位脆弱区域,并验证恢复依赖于同问题干净源。
创意质量对齐:通过思维链微调实现专家隐性知识迁移
专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过低数据成本和小基模型的严格工程条件,实证验证了校准惊喜中的创意质量度量,并发现数据偏差,提出创意质量对齐方法及理论解释。
通过推理空间压缩实现结构性理性提炼
机构 * University of Calgary(卡尔加里大学) ; University of Michigan(密歇根大学)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出D-RPC方法,通过压缩推理空间约束教师模型生成一致且多样化的推理路径,提升学生模型在数学和常识推理任务中的表现,优于多种基线方法。
SAGE-32B:通过迭代蒸馏实现代理推理
机构 * SAGEA ; Tribhuwan University(特里布文大学) ; Vedas College(韦达学院) ; Madan Bhandari Memorial College(马丹·班达里纪念学院) ; Fudan University(复旦大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SAGE-32B是一种专注于代理推理和长期规划的320亿参数语言模型,通过迭代蒸馏提升推理能力,在代理推理基准测试中表现出色。
Comments 23 Pages, 3 figures, 4 tables
在潜空间中思考:用于大语言模型隐式推理的自适应锚点细化
机构 * Manipal University Jaipur(马普尔大学斋普尔) ; TCS Research(塔塔咨询研究)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出AdaAnchor框架,通过自适应终止机制优化潜空间推理,提升准确率并减少计算步骤,实验表明在数学问题基准上准确率提升5%且减少48-60%的潜空间步骤。
Comments Accepted at ICLR 2026, LIT Workshop
AgentMath: 通过工具增强代理赋能大语言模型的数学推理
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 AgentMath通过整合语言模型和代码解释器,提升大语言模型在复杂数学问题上的推理能力,实现高效训练和高准确率。
Comments This paper has been accepted to ICLR 2026
将LLM推理内化:通过发现和重播潜在动作
机构 * Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学) ; Fuzhou University(福州大学)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 STIR通过动态潜在轨迹控制实现LLM推理内化,提升准确率并减少token消耗。
CoMAT:数学注释的思维链提升数学推理
机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学) ; Imperial College London(伦敦帝国学院)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 CoMAT通过符号转换和推理执行两个阶段提升数学推理能力,在多个基准测试中超越传统CoT方法。
Comments 9 pages, 12 figures
Journal ref Proc. EMNLP 2025, pp. 20245-20274
重新审视链式思维提示:零样本可以比少样本更强
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学香河人工智能学院) ; Huawei Poisson Lab(华为Poisson实验室)
专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究发现,对于强模型而言,传统CoT示例对推理性能无帮助,且模型更关注指令而非示例,揭示了ICL+CoT框架在数学推理中的局限性。
Comments EMNLP25-findings camera_ready, 19 pages,22 figures
语义软引导:无需强化学习的LLM长上下文推理
机构 * University of Maryland(马里兰大学)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出语义软引导方法,通过自我蒸馏技术无需强化学习提升LLM长上下文推理能力,实验显示在数学和编程基准测试中准确率显著提升。
机构 * University of Oxford(牛津大学) ; Tsinghua University(清华大学) ; Tencent(腾讯) ; Southern University of Science and Technology(南方科技大学) ; National University of Singapore(新加坡国立大学)
专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * KAIST(韩国科学技术院)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP 2025
机构 * Meta AI
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * University of Illinois at Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
Comments work in progress
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICLR 2025
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Codes and Data are available at https://github.com/beichenzbc/BoostStep
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
Comments To be published at ACL 2024
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 15 pages
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICLR 2023. 26 pages and 18 figures. The data and code are available at https://promptpg.github.io
机构 * Department of Artificial Intelligence(人工智能系) ; Yonsei University(延世大学) ; OneLine AI
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
Journal ref The 5th Workshop on Mathematical Reasoning and AI, NeurIPS 2025
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
Comments The state-of-the-art open-source tool-use LLMs for mathematical reasoning
精确但未耦合:评审者的精确性并不能保证在多智能体数学推理中采纳批评意见
机构 * Argonne National Laboratory(阿贡国家实验室) ; Oregon State University(俄勒冈州立大学) ; University of Chicago(芝加哥大学)
专题命中 数学推理 :reasoning(title);math reasoning(title);verifier(abstract);分类 cs.AI
AI总结 研究多智能体数学推理中评审者精确性与采纳批评意见的关系,通过对4181个问题测试发现,仅评审者精确性无法解释结果,广播式讨论有时效果更好,还探究了不同干预对结果的影响,指出以评审者为中心的评估可能高估系统质量。
Comments 48 pages, 20 figures, 25 tables. Public release website: https://huggingface.co/spaces/AgentsSci/scientific-agent-protocol-traces-site
我们是在衡量策略还是措辞?LLM数学推理中表面多样性与方法层面多样性的差距
机构 * Seoul National University(首尔国立大学) ; KAIST(韩国科学技术院)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL
AI总结 提出方法层面多样性概念,发现现有多样性指标无法反映策略差异,且多样性感知强化学习会降低方法多样性,直接优化方法多样性仍具挑战。
Comments 27 pages, 6 figures
MATH-PT:一个针对欧洲葡萄牙语和巴西葡萄牙语的数学推理基准数据集
机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学理工学院) ; Fundação Getulio Vargas(古特曼基金会) ; Instituto de Telecomunicações(电信研究所) ; Universidade de Coimbra, CISUC/LASI, DEI(科英布拉大学,CISUC/LASI,DEI) ; Basque Center for Applied Mathematics(巴斯克应用数学中心)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL
AI总结 本文提出MATH-PT数据集,包含1729个欧洲和巴西葡萄牙语数学问题,评估了当前最先进的LLM在数学推理中的表现,发现前沿模型在选择题表现优异,但在涉及图表或开放性问题时性能下降。
Comments Accepted at 17th International Conference on Computational Processing of Portuguese (PROPOR 2026). Open access to dataset repo https://huggingface.co/datasets/tiagoteixeira03/MATH-PT and model outputs https://github.com/deep-spin/math-benchmark
何时信任工具?用于工具集成数学推理的自适应工具信任校准
机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) ; Department of Foundation Model, 2012 Labs, Huawei(华为基础模型部门) ; Harbin Institute of Technology, Shenzhen (HITSZ)(哈尔滨工业大学深圳(HITSZ))
专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL
AI总结 本文提出ATTC框架,通过自适应选择信任或忽略工具结果来解决工具忽略问题,提升推理性能。