arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-01 至 2025-12-01 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 8 篇

2511.22176 2025-12-01 cs.CL cs.AI 90%

Focused Chain-of-Thought: Efficient LLM Reasoning via Structured Input Information

聚焦式链式思考:通过结构化输入信息实现高效的LLM推理

Lukas Struppek, Dominik Hintersdorf, Hannah Struppek, Daniel Neider, Kristian Kersting

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Technical University of Darmstadt(德累斯顿技术大学) University of Kassel(卡塞尔大学) TU Dortmund University(Dortmund技术大学) TU Center for Trustworthy Data Science and Security, University Alliance Ruhr(TU可信数据科学与安全中心,鲁尔大学联盟) Hessian Center for AI (Hessian.AI)(黑森人工智能中心(黑森.AI)) Centre for Cognitive Science, Technical University of Darmstadt(认知科学中心,德累斯顿技术大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出F-CoT方法,通过结构化输入减少LLM推理中的token使用和延迟,同时保持推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22570 2025-12-01 cs.AI cs.CL 86%

DeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoning

DeepSeekMath-V2:迈向自我验证的数学推理

Zhihong Shao, Yuxiang Luo, Chengda Lu, Z. Z. Ren, Jiewen Hu, Tian Ye, Zhibin Gou, Shirong Ma, Xiaokang Zhang

机构 * DeepSeek-AI

专题命中 数学推理 :reasoning(title,abstract);test-time compute(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 DeepSeekMath-V2通过自我验证机制提升数学推理能力,实现定理证明的高准确率和严谨性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14495 2025-12-01 cs.CL cs.AI cs.LG 82%

Temporal Consistency for LLM Reasoning Process Error Identification

LLM推理过程错误识别中的时序一致性

Jiacheng Guo, Yue Wu, Jiahao Qiu, Kaixuan Huang, Xinzhe Juan, Ling Yang, Mengdi Wang

机构 * Department of Electrical & Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) AI Lab, Princeton University(普林斯顿大学人工智能实验室) Department of Computer Science & Engineering, University of Michigan(密歇根大学计算机科学与工程系)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于时序一致性的LLM推理过程错误识别方法,通过迭代自我反思提升验证准确性,在多个基准测试中实现了优于基线方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02583 2025-12-01 cs.AI cs.LG 81%

CAMA: Enhancing Mathematical Reasoning in Large Language Models with Causal Knowledge

CAMA: 通过因果知识增强大语言模型的数学推理

Lei Zan, Keli Zhang, Ruichu Cai, Lujia Pan

机构 * Huawei Noah’s Ark Lab France(华为诺亚实验室(法国)) Guangdong University of Technology Peng Cheng Laboratory(广东工业大学鹏城实验室) Huawei Noah’s Ark Lab China(华为诺亚实验室(中国))

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 CAMA通过构建数学因果图并结合因果知识,提升大语言模型在数学推理任务中的性能。

Journal ref Main Track, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22173 2025-12-01 cs.CL 57%

RefineBench: Evaluating Refinement Capability of Language Models via Checklists

RefineBench: 通过检查表评估语言模型的细化能力

Young-Jun Lee, Seungone Kim, Byung-Kwan Lee, Minkyeong Moon, Yechan Hwang, Jong Myoung Kim, Graham Neubig, Sean Welleck, Ho-Jin Choi

机构 * KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) NVIDIA(英伟达) Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 RefineBench通过检查表评估语言模型的细化能力,发现指导细化能显著提升响应质量,而自我细化则需进一步突破。

Comments Project website: https://passing2961.github.io/refinebench-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21756 2025-12-01 cs.CL cs.CE 57%

Dissecting the Ledger: Locating and Suppressing "Liar Circuits" in Financial Large Language Models

拆解账本:在金融大型语言模型中定位并抑制‘骗子电路’

Soham Mirajkar

机构 * Soham Mirajkar ( November 24, 2025 )(Soham Mirajkar)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出通过因果追溯在金融LLM中定位并抑制导致算术幻觉的'骗子电路',通过实验验证了中间层和晚期层的双阶段机制,并展示了抑制特定层可显著降低幻觉输出的置信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21631 2025-12-01 cs.CV cs.AI 57%

Qwen3-VL Technical Report

Qwen3-VL 技术报告

Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhifang Guo, Qidong Huang, Jie Huang, Fei Huang, Binyuan Hui, Shutong Jiang, Zhaohai Li, Mingsheng Li, Mei Li, Kaixin Li, Zicheng Lin, Junyang Lin, Xuejing Liu, Jiawei Liu, Chenglong Liu, Yang Liu, Dayiheng Liu, Shixuan Liu, Dunjie Lu, Ruilin Luo, Chenxu Lv, Rui Men, Lingchen Meng, Xuancheng Ren, Xingzhang Ren, Sibo Song, Yuchong Sun, Jun Tang, Jianhong Tu, Jianqiang Wan, Peng Wang, Pengfei Wang, Qiuyue Wang, Yuxuan Wang, Tianbao Xie, Yiheng Xu, Haiyang Xu, Jin Xu, Zhibo Yang, Mingkun Yang, Jianxin Yang, An Yang, Bowen Yu, Fei Zhang, Hang Zhang, Xi Zhang, Bo Zheng, Humen Zhong, Jingren Zhou, Fan Zhou, Jing Zhou, Yuanzhi Zhu, Ke Zhu

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 Qwen3-VL 是一款强大的多模态模型,具备强大的纯文本理解、长上下文处理和多模态推理能力,适用于图像推理、代理决策和多模态代码智能。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00234 2025-12-01 cs.LG cs.CV cs.NA math.NA physics.comp-ph stat.ML 57%

Fast Solvers for Discrete Diffusion Models: Theory and Applications of High-Order Algorithms

离散扩散模型的快速求解器:高阶算法的理论与应用

Yinuo Ren, Haoxuan Chen, Yuchen Zhu, Wei Guo, Yongxin Chen, Grant M. Rotskoff, Molei Tao, Lexing Ying

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出高阶算法用于离散扩散模型,提升推断效率和样本质量,适用于文本、图像等生成任务。

Comments Accepted at NeurIPS 2025 as a Poster (https://openreview.net/forum?id=OuklL6Q3sO)

详情

展开后加载摘要…

URL PDF HTML 收藏