arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 290 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 290 篇

2606.10369 2026-06-10 cs.CL cs.LG 新提交 62%

PADD: Path-Aligned Decompression Distillation for Non-Router Teacher to Guide MoE Student Learning

PADD: 面向非路由器教师指导MoE学生学习的路径对齐解压缩蒸馏

Xinyue Peng, Yi Qian, Jiaojiao Lin, Wenjian Shao, Yanming Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出路径对齐解压缩蒸馏(PADD)框架,通过四阶段两阶段流程将密集教师知识蒸馏到混合专家(MoE)学生中,同时学习高质量路由策略,在数学推理任务上显著优于基线。

Comments published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10296 2026-06-10 cs.CL cs.AI 新提交 62%

The Confident Liar: Diagnosing Multi-Agent Debate with Log-Probabilities and LLM-as-Judge

自信的撒谎者:利用对数概率和LLM作为评判诊断多智能体辩论

Ali Keramati, Justin Cheok, Jacob Horne, Mark Warschauer

机构 * University of California, Irvine(加州大学伊文斯分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究多智能体辩论中令牌级对数概率、LLM评判分数与任务准确性的关系,发现信心与推理质量在构造者上关联更强,且信心可检测关键推理失败。

Comments 15 pages, 7 figures, 1 table, ACL proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08346 2026-06-09 cs.CL cs.LG 新提交 62%

CATPO: Critique-Augmented Tree Policy Optimization

CATPO: 批评增强的树策略优化

Ayush Singh, Umang Goyal, Ankur Dahiya

机构 * Indian Institute of Technology Roorkee(印度理工学院罗尔基分校) Vision and Language Group(视觉与语言组)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出CATPO方法,通过树信息性评分和批评引导修复,解决树结构强化学习中低效树浪费计算的问题,在数学推理任务上提升准确率。

Comments 14 pages, 1 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20314 2026-08-21 cs.AI 新提交 57%

MidTool: Mid-training Data Synthesis for Agentic Tool Use

MidTool:面向智能体工具使用的训练中期数据合成

Fengqing Jiang, Yite Wang, Boyi Liu, Zhaoyang Wang, Canwen Xu, Zhewei Yao, Radha Poovendran, Yuxiong He

机构 * University of Washington(华盛顿大学) Snowflake(雪花公司) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出MidTool流水线,构建面向智能体工具使用的训练中期数据,在MidTool-Mix上微调Qwen3模型,可显著提升工具使用相关下游任务性能,证明通用工具使用需专门训练中期调整。

Comments Data & Model: https://hf.co/collections/MidTool/midtool-release

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19047 2026-08-20 cs.AI math.NT 新提交 57%

Eureka: Task-Conditioned Meta-Agent Orchestration for Scientific Discovery

Eureka:面向科学发现的任务条件元智能体编排框架

Alizer Wong, Heng Cui, Yi Tan, Xiongchao Zhan, Liang Lin, Yuxiang Guo, Zhaorong Dai, Zixin Zeng, Wenyuan Li

机构 * ManXis(万熙科技(ManXis)) Guangdong University of Technology(广东工业大学) South China Normal University(华南师范大学) Shanghai Jiao Tong University(上海交通大学) Duke University(杜克大学) Hokkaido University(北海道大学)

专题命中 数学推理 :planning(abstract);分类 cs.AI

AI总结 该研究提出Eureka任务条件元智能体架构,通过动态编排完成科学发现任务,在递归任务、增量处理等实验中表现优异,还实现了数学领域的理论进展,证明科学智能体能力依赖匹配任务认知结构的架构。

Comments 62 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16977 2026-08-19 cs.AI math.CO 新提交 57%

The Problem Is the Problem: Towards Scalable Mathematical Discovery

问题本身才是问题:迈向可扩展的数学发现

Zeyu Zheng, Shengtong Zhang, Jeremy Avigad, Prasad Tetali, Sean Welleck

机构 * Carnegie Mellon University(卡内基梅隆大学) Anysphere Co.(Anysphere公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出人机协作的FAR流程,从文献中筛选数学问题并聚焦成果,在组合数学试点中筛选出77个待评审成果,验证了其数学发现的有效性。

Comments Code available at https://github.com/zeyu-zheng/FAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15979 2026-08-18 cs.AI 新提交 57%

ALPS: Measuring Valid Creativity in Large Language Models with Mathematical Construction

ALPS:通过数学构造衡量大语言模型的有效创造力

Eric Xie, Wenqian Ye, Aidong Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出ALPS基准,通过要求生成可证正确的原创数学结构或证明其不存在的任务,评估大语言模型的有效创造力,测试发现现有推理模型在证明侧成功率14%、构造侧为0,多数实例未被解决并发布完整ALPS资源。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14685 2026-08-18 cs.LG stat.ML 新提交 57%

Rethinking Reverse KL as Adaptive Entropy Distillation

将反向KL重新思考为自适应熵蒸馏

Shizhen Li, Zhiyu Shen, Yuyin Lu, Yunhe Pang, Jielin Song, Yanghui Rao, Fu Lee Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Science and Technology, Hong Kong Metropolitan University(香港都会大学科技学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究针对知识蒸馏难以平衡忠实模仿与鲁棒生成的问题,提出自适应熵蒸馏(AED)方法,通过分解反向KL目标函数并利用教师熵动态校准模仿强度,在指令遵循与数学推理基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14407 2026-08-17 cs.AI 新提交 57%

The Past and Future of AI Scientists

AI科学家的过去与未来

Ross D. King

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文综述AI科学家的过去与未来,指出其核心挑战是多技术集成,现有技术已支持构建更通用系统,其有望变革科学,诺贝尔图灵挑战目标进展超前。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14212 2026-08-17 cs.AI 新提交 57%

APTER: Adaptive Post-Training with Expert-Grounded Rubrics

APTER:基于专家准则的自适应后训练

Xukai Wang, Liangqi Li, Zhiyue Xu, Jingang Zhou, Xiaoyu Shi, Jiansheng Cai, Bo Zhang, Zhe Li, Xu-Yao Zhang

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字科技)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 APTER是将结构化领域知识融入专业复杂推理评估、优化与诊断的框架,通过专家准则生成查询级准则并用于自适应后训练,在数学、医学领域三代模型上均实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13129 2026-08-14 cs.AI 新提交 57%

Numeracy in Large Language Models: Fundamental Limitations and Paths to Improvement

大型语言模型中的数字能力:基本局限与改进路径

Aoxin Ni

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对LLMs在基础数值任务中的不可靠性,提出数值基础框架(NGF)并结合三大基准评估前沿模型,给出改进数值能力的部署建议与研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10214 2026-08-12 cs.AI 新提交 57%

Decodable But Not Detachable: Training Data Granularity Determines Parametric Modularity in Large Language Models

可解码但不可分离:训练数据粒度决定大语言模型的参数模块化

Marcus Armstrong, Navid Ayoobi, Arjun Mukherjee

机构 * University of Houston(休斯顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究探讨大语言模型是否存在特定领域参数壳,通过多模型、多领域实验发现训练数据的标记级模块化是参数壳形成的关键,为大语言模型的参数模块化研究提供了核心结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09332 2026-08-11 cs.LG 新提交 57%

Hallucinations and Constraints : Regulating surgical workflow recognition beyond accuracy

幻觉与约束:超越准确率的手术工作流程识别调控

John S. H. Baxter, Pierre Jannin

机构 * Université de Rennes(雷恩大学) Inserm(法国国家健康与医学研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究针对医学图像处理中AI的幻觉问题,提出用线性时序逻辑谓词结合概率图模型调控,在机器人辅助子宫切除术阶段识别中准确率提约10%且消除多数拓扑错误。

Comments 11 pages, 1 figure, 1 table, accepted to the MICCAI 2026 Workshop on Fairness, Regulation, and Ethics (FAIMI-BRIDGE-EPIMI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09119 2026-08-11 cs.AI 新提交 57%

Motif 3: Technical Report

Motif 3:技术报告

Junghwan Lim, Joon Son Chung, Sungmin Lee, Wai Ting Cheung, Gihun Cho, Minsu Ha, Sangho Kang, Beomgyu Kim, Dongseok Kim, Jangwoong Kim, Taehyun Kim, Taewhan Kim, Jeesoo Lee, Jeongdoo Lee, Junhyeok Lee, Dongpin Oh, Hyeyeon Cho, Dahye Choi, Jaeheui Her, Hanbin Jung, Changjin Kang, Minjae Kim, Youngrok Kim, Hyukjin Kweon, Hongjoo Lee, Yeongjae Park, Bokki Ryu

机构 * Motif Technologies(Motif科技公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究推出仅解码器的MoE语言模型Motif 3,采用GDLA等技术,经万亿token预训练及多阶段后训练,在长上下文、推理等任务上性能与领先开源模型相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08888 2026-08-11 cs.AI 新提交 57%

Full-bandwidth transformer

全带宽Transformer

Xi Wang, Ziyang Cai, Zheng Zhan, Harry Dong, Ying Fan, Gustavo de Rosa, Tim Pearce, John Langford

机构 * Johns Hopkins University(约翰斯·霍普金斯大学) Princeton University(普林斯顿大学) Microsoft(微软公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出全带宽Transformer,通过潜在反馈拓宽解码步骤间的垂直反馈通道,经训练验证其在多项任务上性能提升,且解码开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05371 2026-08-07 cs.LG 新提交 57%

Quantum-Structured World Models (QSWMs) for Predictive Latent Dynamics

用于预测潜在动力学的量子结构化世界模型(QSWMs)

Hailong Jiang, Emran Hossain, Feng Yu, Jianfeng Zhu, Guilin Zhang, Wulan Guo

机构 * Youngstown State University(扬斯敦州立大学) Kent State University(肯特州立大学) George Washington University(乔治·华盛顿大学)

专题命中 数学推理 :planning(abstract);分类 cs.LG

AI总结 本文提出量子结构化世界模型(QSWMs),研究量子启发结构对世界建模的作用,在基本元胞自动机上评估其变体,发现复值QSWM局部预测潜力良好但类密度矩阵变体存在长时序预测局限。

Comments 19 pages, 5 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02942 2026-08-05 cs.CL 新提交 57%

OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models

OPTD:用于少步扩散语言模型的一致性引导自适应压缩的策略内转换蒸馏

Xiaocheng Lu, Hualei Zhang, Shuhan Guo, Jie Zhang, Xiaoyi Pang, Jian Liu, Haoxi Li, Bohai Gu, Haoxuan Che, Jingcai Guo, Song Guo

机构 * HKUST(香港科技大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 针对少步扩散语言模型现有离线策略蒸馏的轨迹不匹配问题,提出 OPTD 策略内转换蒸馏方法,在四个推理基准上改善质量效率权衡并取得最优质量约束 AUP。

Comments 9 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02181 2026-08-04 cs.LG 新提交 57%

Start Classifying: Categorical Critics for LLM Reinforcement Learning

开始分类:用于大语言模型强化学习的分类式评判器

Zhijian Zhou, Long Li, Xuan Zhang, Zongkai Liu, Yulei Qin, Ke Li, Xing Sun, Xiaoyu Tan, Chao Qu, Yuan Qi

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Tencent YoutuLab(腾讯优图实验室) Griffith University(格里菲斯大学) Shanghai Academy of Artificial Intelligence for Science(上海科学人工智能研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究提出HL-Gauss PPO,将PPO的标量评判器改为分类式预测器,在多任务及Qwen2.5、Qwen3主干上均优于PPO、DAPO基线,可改进评判器信号与优势估计。

Comments Accepted at COLM 2026. 26 pages, 9 figures. Code: https://github.com/ZhijianZhou/HL-guass-ppo

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00531 2026-08-04 cs.AI 新提交 57%

CURE: Local Uncertainty Repair for Block-Parallel Speculative Decoding

CURE:面向块并行推测解码的局部不确定性修复

Aofan Liu, Jingxiang Meng, Fangxin Liu, Yongbiao Chen

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 针对并行推测解码的长序列精度下降问题,提出预算感知动态修复树CURE,通过定位高不确定性token修复错误,在多个基准上提升平均接受长度并实现2.66-3.49倍端到端速度提升。

Comments 9 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00418 2026-08-04 cs.AI 新提交 57%

Mask-Based Priors Are More Persistent than Query-Key Initializations

基于掩码的先验比查询-键初始化更具持久性

Mingze Ma, Hemanth Saratchandran, Cameron Gordon, Simon Lucey

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对 Transformer 在布尔外推任务上的系统性错误泛化问题,提出直接初始化注意力掩码的方法,该方法可保留结构先验,在布尔推理等任务上实现优异外推效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28657 2026-08-03 cs.AI 新提交 57%

TAPR: Enhancing LLM Performance with a Task-Aware Prompt Rewriter

TAPR:利用任务感知提示重写器提升大语言模型性能

Oliver Savolainen, Emanuele Bastianelli, Hosein Azarbonyad

机构 * University of Amsterdam(阿姆斯特丹大学) Elsevier(爱思唯尔)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出TAPR模型,采用带GRPO的强化学习训练,可将用户提示优化为任务适配的提示,经微调Phi-4-mini-instruct后,在多任务基准测试中提升了大语言模型的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28582 2026-07-31 cs.LG 新提交 57%

$β$-OPSD: Deriving with Policy Optimization, Training with Self-Distillation

β-OPSD:基于策略优化推导,采用自蒸馏训练

Jiawei Xu, Minghui Liu, Juzheng Zhang, Tom Goldstein, Furong Huang

机构 * University of Maryland(马里兰大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 β-OPSD是将普通OPSD扩展为含可控正则化参数β的策略优化通用形式,通过蒸馏近似策略优化解,在数学推理基准上性能与稳定性均优于普通OPSD。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28077 2026-07-31 cs.CL 新提交 57%

LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models

LEEPS:用于大语言模型中高效RLVR的潜在引导探索-利用提示采样

Shuang Liang, Haoyang Zhou, Yifan Gong, Guowei Wang, Xiting Wang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 LEEPS是一种潜在引导探索-利用提示采样器,通过自适应分配rollout预算等方式优化提示采样,在6个数学推理基准和3个OOD通用推理基准上均取得最优性能,且训练开销较小。

Comments 15pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27994 2026-07-31 cs.AI 新提交 57%

SKIMIX: Multi-Agent Harness-Time Scaling with Skill Mixture for Dynamic Harness Engineering

SKIMIX:面向动态 harness 工程的技能混合多智能体 harness 时间缩放方法

Jia Luo

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 SKIMIX 是一种多智能体框架,结合技能检索、抗稀释路由等技术,在六个推理基准上提升开放式数学推理能力,为可扩展智能体设计提供了任务特性相关的实用指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27709 2026-07-31 cs.AI 新提交 57%

MECA: A Mechanism-Centered Agent for Constructing Well-Specified and Valuable Mathematical Conjectures

MECA:一种以机制为中心的智能体,用于构建定义明确且有价值的数学猜想

Wentao Long, Yunfei Zhang, Chenyi Li, Zaiwen Wen

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 MECA是一种以机制为中心的多智能体框架,可联合构建候选数学命题及其支撑机制,能生成定义明确且有研究价值的猜想,相关猜想对现有自动证明器仍具挑战性。

Comments 78 pages, 5 figures. Includes appendices and the full collection of 100 generated conjectures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21946 2026-07-27 cs.LG 新提交 57%

Multi-Agent Debate and Visual Information Extraction for SeePhys Pro: A 1st-Place Technical Report from ICML 2026 AI4Math Track 3 Challenge

用于SeePhys Pro的多智能体辩论与视觉信息提取:ICML 2026 AI4Math赛道3挑战赛的第一名技术报告

Jiseok Kwak, Suhyeon Jo, Taewoo Kim, Yeongmin Kim, Byeonghu Na, Il-chul Moon

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 针对回答含图像的大学物理问题的SeePhys Pro任务,提出两阶段框架,包括视觉信息提取和多智能体辩论推理阶段,提高了准确率,在挑战赛中获第一名,分析得出编排收益及图形辅助价值与问题图像占比相关的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20806 2026-07-24 cs.AI 新提交 57%

Profiling Lightweight Large Language Models

轻量级大语言模型剖析

Tomohiro Harada, Enrique Alba, Gabriel Luque

机构 * Graduate School of Science and Engineering, Saitama University(埼玉大学理工学研究科) ITIS, University of Malaga(马拉加大学信息技术与系统研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究轻量级大语言模型在资源受限环境中的情况,提出基于PTME的实验框架,通过硬件级测量联合测量精度、时间、内存和能耗,对一组模型进行测试,发现代理描述符不足,揭示非主导配置,为不同资源下选模型提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20764 2026-07-24 cs.AI 新提交 57%

ArbiGraph: Arbitrarily Scalable Verifiable Task Graphs for Evaluating Context Management

ArbiGraph:用于评估上下文管理的任意可扩展可验证任务图

Pavel Golikov, Evgenii Opryshko, Gennady Pekhimenko, Mark C. Jeffrey

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 ArbiGraph作为基准生成器,将任务表示为带Python求解器的自然语言问题,通过类型化中间状态组合任务。用多种任务类别实例化并评估智能体,发现其在孤立任务和复杂相关任务上表现不同,揭示了单任务评估无法发现的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20327 2026-07-23 cs.CL 新提交 57%

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference

PyroDash:具有成本效益的令牌级小语言模型与大语言模型协作推理

Niqi Lyu, Pengtao Shi, Wei Qiu, Jianlin Zhong, Sicong Xia, Jianyao Ma, Yicheng Ding

机构 * Pyromind Dynamics Inc.(Pyromind动力学公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对大语言模型推理成本高、小语言模型可靠性低的问题,提出PyroDash框架,通过令牌级协作推理,分三阶段训练小语言模型,在数学推理基准测试中能支持不同操作点,可减少大语言模型使用并保持推理性能。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18260 2026-07-22 cs.AI 新提交 57%

FindStatBench: Evaluating Large Language Models on Combinatorial Code Synthesis

FindStatBench:在组合代码合成上评估大语言模型

Soham Dan

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 介绍用于评估大语言模型组合代码合成能力的FindStatBench基准,涵盖多种合成任务,通过特定方式评分并评估11个系统,发现开源闭源系统准确率趋同、示例可能有害、存在输出预算问题等,揭示统计合成与映射合成的差异及相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏