arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-24 至 2026-08-24 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 7 篇

2608.21265 2026-08-24 cs.CL 新提交 90%

Memory Augmentation Unlocks Efficient Chain-of-Thought Reasoning

记忆增强解锁高效思维链推理

Simeng Zhang, Yilong Chen, Wenyuan Zhang, Zhenyu Zhang, Yao Chen, Junyuan Shang, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Baidu Inc.(百度公司) Tencent Inc.(腾讯公司)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 该研究提出无需训练的记忆增强压缩框架,构建可复用推理记忆提升思维草稿压缩效果,在多任务上获显著准确率提升并加速推理,兼容多种压缩机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20362 2026-08-24 cs.CL cs.LG 新提交 84%

Multilingual Verifier Bias in RLVR: Benchmark, Rollout Diagnosis, and the Cross-Lingual Selection Bottleneck

RLVR中的多语言验证器偏差:基准、推理诊断与跨语言选择瓶颈

Chenyu Zhou, Qiliang Jiang, Xu Zhou

机构 * School of Engineering, Institute of Science Tokyo(科学东京大学工程学院) College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程学院)

专题命中 数学推理 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究发现多语言RLVR中存在验证器偏差,引入审计协议定位到最终答案接口的机制,提出跨语言选择瓶颈,rule-GRPO可提升可信准确率。

Comments 16 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09052 2026-08-24 cs.LG cs.AI cs.CL cs.GT stat.ML 版本更新 82%

INFUSER: Influence-Guided Self-Evolution Improves Reasoning

INFUSER: 影响力引导的自我进化提升推理能力

Siyu Chen, Miao Lu, Beining Wu, Heejune Sheen, Fengzhuo Zhang, Shuangning Li, Zhiyuan Li, Jose Blanchet, Tianhao Wang, Zhuoran Yang

机构 * Yale University(耶鲁大学) Stanford University(斯坦福大学) University of Chicago(芝加哥大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) University of California, San Diego(圣地亚哥大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出INFUSER框架,通过生成器与求解器的协同进化,利用影响力分数和DuGRPO优化,从文档池中自适应生成训练数据,显著提升模型推理性能。

Comments 67 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20717 2026-08-24 cs.AI 新提交 79%

DirEAG: Dirichlet Evidence Aggregation for Calibrating Verbalized Confidence in Mathematical Reasoning

DirEAG:用于校准数学推理中口头表述置信度的Dirichlet证据聚合方法

Haorui Xu, Yuzhou Zhu, Liyuan Gao

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对大语言模型数学推理中口头表述置信度难以校准的问题,提出DirEAG方法,将置信度观测值转换为校准软证据,在多个数据集和模型上验证其校准效果优于现有方法。

Comments 16 pages, 3 figures. Code is available at this https URL (https://github.com/horacehsugithub/DirEAG). Accepted by PRICAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10903 2026-08-24 cs.CL 版本更新 79%

Beyond Gold Standards: Epistemic Ensemble of LLM Judges for Formal Mathematical Reasoning

超越黄金标准:用于形式化数学推理的LLM评判者的认知集成

Lan Zhang, Marco Valentino, Jordan Meadows, Andre Freitas

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出基于LLM评判者的认知与形式化基础集成(EFG),用于系统自动评估形式化数学推理中的语句自动形式化任务,实验证实其比粗粒度模型更具适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13517 2026-08-24 cs.CL cs.AI 版本更新 74%

DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data

DFM Mimir v1:仅使用许可的后训练数据,在10亿参数规模下实现前沿性能的开放HRM模型

Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen, Lukas Galke Poech

专题命中 数学推理 :reasoning(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究人员因大模型开发依赖非许可数据受阻,本文提出仅用许可后训练数据训练的10亿参数HRM模型Mimir v1,其在多基准测试中性能优于同规模HRM-Text 1B,可与更大前沿模型媲美,且在丹麦语任务达新SOTA,已发布于Hugging Face Hub

Comments Technical Report, 20 Pages, 1 Model, Hierarchical Reasoning Model, v2: added memorization audits

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20519 2026-08-24 physics.med-ph cs.AI 新提交 57%

An integrated diffusion-weighted imaging processing and interpretation platform for MR-guided radiotherapy

用于磁共振引导放疗的扩散加权成像处理与解释一体化平台

Yunxiang Li, Yan Dai, Yen-Peng Liao, Jie Deng, Jill B De Vis, You Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究开发了一体化网络平台,整合MR-Linac的DWI后处理与可追溯的RAG临床解释,经专家评分验证其在胶质母细胞瘤病例中具有高临床实用性。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏