arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-10 至 2026-02-10 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 15 篇

2507.15375 2026-02-10 cs.CL eess.AS 87%

STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models

STITCH:基于分块推理的 spoken language models 的同时思考与说话

Cheng-Han Chiang, Xiaofei Wang, Linjie Li, Chung-Ching Lin, Kevin Lin, Shujie Liu, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang

机构 * National Taiwan University(国立台湾大学) Microsoft(微软)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)

AI总结 STITCH通过分块推理实现语音语言模型的同时思考与说话,提升推理效率与响应速度。

Comments ICLR 2026 camera-ready version. Project page: https://d223302.github.io/STITCH/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08332 2026-02-10 cs.CL cs.AI 86%

Latent Reasoning with Supervised Thinking States

基于监督思考状态的潜在推理

Ido Amos, Avi Caciularu, Mor Geva, Amir Globerson, Jonathan Herzig, Lior Shani, Idan Szpektor

机构 * Google Research(谷歌研究)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Thinking States方法,通过在输入处理过程中生成思考token,实现更高效的潜在推理,实验表明其在多个推理任务中表现优异,且在延迟和长序列外推方面优于CoT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07213 2026-02-10 cs.LG 85%

Adaptive Retrieval helps Reasoning in LLMs -- but mostly if it's not used

自适应检索有助于增强大语言模型的推理能力——但主要是当它不被使用时

Srijan Shakya, Anamaria-Roberta Hartl, Sepp Hochreiter, Korbinian Pöppel

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本研究发现自适应检索在某些情况下反而有助于提升大语言模型的推理能力,表明模型在无需检索时可能表现更佳。

Comments Eurips Workshop on Principles of Generative Modeling (PriGM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03950 2026-02-10 cs.AI cs.LG cs.MA 84%

Enhancing Mathematical Problem Solving in LLMs through Execution-Driven Reasoning Augmentation

通过执行驱动推理增强提升大语言模型的数学问题解决能力

Aditya Basarkar, Benyamin Tabarsi, Tiffany Barnes, Dongkuan Xu

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出IIPC方法,通过迭代优化程序推理链并结合执行反馈,提升大语言模型的数学问题解决能力。

Comments 9 pages, 7 figures, submitted to ACL ARR 2026, hyperlink to code repository provided in the abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07820 2026-02-10 cs.AI 83%

Guideline Forest: Retrieval-Augmented Reasoning with Branching Experience-Induced Guidelines

指南森林:基于检索的增强推理与分支经验引导

Jiaxiang Chen, Zhuo Wang, Mingxi Zou, Qifan Wang, Zenglin Xu

机构 * Fudan University(复旦大学) Meta SAIS SII

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 Guideline Forest通过利用经验引导多步骤推理,提升数学和编程任务的推理能力,支持多模型协作与灵活扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20647 2026-02-10 cs.CL cs.AI 81%

The Reasoning Lingua Franca: A Double-Edged Sword for Multilingual AI

推理通用语:多语言AI的双刃剑

Alan Saji, Raj Dabre, Anoop Kunchukuttan, Ratish Puduppully

机构 * Nilekani Centre at AI4Bharat(AI4Bharat人工智能中心) Indian Institute of Technology Madras(印度理工学院马德拉斯分校) Google(谷歌) Microsoft(微软) IT University of Copenhagen(丹麦技术大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了大型推理模型在多语言环境下的推理能力,发现英语推理在准确性上表现更优,但可能因翻译错误导致问题,揭示了多语言AI的双刃剑特性。

Comments 14 pages, 13 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09000 2026-02-10 cs.AI 79%

iGRPO: Self-Feedback-Driven LLM Reasoning

iGRPO:基于自我反馈的LLM推理

Ali Hatamizadeh, Shrimai Prabhumoye, Igor Gitman, Ximing Lu, Seungju Han, Wei Ping, Yejin Choi, Jan Kautz

机构 * NVIDIA(英伟达)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 iGRPO通过动态自我条件和两阶段优化,提升LLM在数学推理任务中的表现,实现更准确和一致的解决方案。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21880 2026-02-10 cs.CL cs.AI cs.LG 75%

No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping

无提示被忽视:通过熵引导的优势塑造利用零方差提示进行LLM强化学习

Thanh-Long V. Le, Myeongho Jeon, Kim Vu, Viet Lai, Eunho Yang

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过熵引导的优势塑造,RL-ZVP利用零方差提示提升LLM推理能力,显著优于GRPO及其他基线方法。

Comments ICLR 2026 camera-ready version

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08847 2026-02-10 cs.LG cs.AI 73%

Dr. MAS: Stable Reinforcement Learning for Multi-Agent LLM Systems

Dr. MAS:多智能体大语言模型系统的稳定强化学习

Lang Feng, Longtao Zheng, Shuo He, Fuxiang Zhang, Bo An

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Dr. MAS通过智能体级归一化方法稳定多智能体大语言模型的强化学习训练,提升性能并减少梯度不稳定问题。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00884 2026-02-10 cs.LG cs.CL 73%

Towards Active Synthetic Data Generation for Finetuning Language Models

面向微调语言模型的主动合成数据生成

Samuel Kessler, Menglin Xia, Daniel Madrigal Diaz, Dongge Han, Helia Heshemi, Saravan Rajmohan, Victor Ruehle, Jordan T. Ash

机构 * Microsoft(微软)

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过主动学习方法生成合成数据以提升语言模型微调效果,验证了简单筛选标准在数学和逻辑推理任务中的有效性。

Comments 14 figures, 37 pages. Website and code: https://iterative-sd.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08344 2026-02-10 cs.AI 70%

OPE: Overcoming Information Saturation in Parallel Thinking via Outline-Guided Path Exploration

OPE:通过大纲引导路径探索克服并行思维中的信息饱和

Qi Guo, Jianing Wang, Deyang Kong, Xiangyu Xi, Jianfei Zhang, Yi Lu, Jingang Wang, Wei Wang, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University, Beijing, China(软件工程国家工程研究中心,北京大学,北京,中国)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 OPE通过生成多样化的推理大纲,减少信息冗余,提升并行思维在复杂问题中的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14238 2026-02-10 cs.CL cs.AI cs.LG 67%

ABBA-Adapters: Efficient and Expressive Fine-Tuning of Foundation Models

ABBA-Adapters: 高效且表达力强的基础模型微调

Raghav Singhal, Kaustubh Ponkshe, Rohit Vartak, Praneeth Vepakomma

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫德尔·本·扎耶德人工智能大学) Duke University(杜克大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ABBA-Adapters通过引入低秩矩阵的Hadamard乘积,实现高效且表达力强的基础模型微调,显著提升适应新领域的性能。

Comments ICLR 2026. Raghav Singhal, Kaustubh Ponkshe, and Rohit Vartak contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17668 2026-02-10 cs.LG cs.CL 62%

Fast KVzip: Efficient and Accurate LLM Inference with Gated KV Eviction

快速KVzip:基于门控的KV缓存淘汰实现高效且准确的LLM推理

Jang-Hyun Kim, Dongyoon Han, Sangdoo Yun

机构 * NAVER AI Lab(NAVER AI实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 基于门控的KV缓存淘汰方法实现高效且准确的LLM推理,通过轻量级门控模块和任务无关的重建目标,实现高压缩比和低计算开销。

Comments Source code: https://github.com/Janghyun1230/FastKVzip

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05494 2026-02-10 cs.LG cs.AI 62%

A Unified Framework for Rethinking Policy Divergence Measures in GRPO

在GRPO中重新思考策略分歧度度量的统一框架

Qingyuan Wu, Yuhui Wang, Simon Sinong Zhan, Yanning Dai, Shilong Deng, Sarra Habchi, Qi Zhu, Matthias Gallé, Chao Huang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种统一的裁剪框架,通过KL3估计器改进GRPO,提升训练稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04787 2026-02-10 cs.MA cs.AI 57%

Trade in Minutes! Rationality-Driven Agentic System for Quantitative Financial Trading

一分钟内交易!基于理性驱动的量化金融交易代理系统

Zifan Song, Kaitao Song, Guosheng Hu, Ding Qi, Junyao Gao, Xiaohua Wang, Dongsheng Li, Cairong Zhao

机构 * Tongji University(同济大学) Microsoft Research Asia(微软亚洲研究院) University of Bristol(布里斯托大学) Fudan University(复旦大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 TiMi是一种基于理性驱动的多代理系统,通过解耦策略开发与分钟级部署,实现量化金融交易的高效稳定盈利。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏