arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3246 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3246 篇

2608.15979 2026-08-18 cs.AI 新提交 57%

ALPS: Measuring Valid Creativity in Large Language Models with Mathematical Construction

ALPS:通过数学构造衡量大语言模型的有效创造力

Eric Xie, Wenqian Ye, Aidong Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出ALPS基准,通过要求生成可证正确的原创数学结构或证明其不存在的任务,评估大语言模型的有效创造力,测试发现现有推理模型在证明侧成功率14%、构造侧为0,多数实例未被解决并发布完整ALPS资源。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12756 2026-08-18 cs.LG 版本更新 57%

Closing the Loop: A Control-Theoretic Framework for Provably Stable Time Series Forecasting with LLMs

闭环:基于控制理论的具有可证明稳定性的时序预测框架与大语言模型

Xingyu Zhang, Jingyao Wang, Zeen Song, Changwen Zheng, Wenwen Qiang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出F-LLM框架,通过控制理论方法解决大语言模型在时序预测中的误差累积问题,提供理论保证并实验验证其有效性。

Comments Accepted by ACM MM26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14407 2026-08-17 cs.AI 新提交 57%

The Past and Future of AI Scientists

AI科学家的过去与未来

Ross D. King

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文综述AI科学家的过去与未来,指出其核心挑战是多技术集成,现有技术已支持构建更通用系统,其有望变革科学,诺贝尔图灵挑战目标进展超前。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14212 2026-08-17 cs.AI 新提交 57%

APTER: Adaptive Post-Training with Expert-Grounded Rubrics

APTER:基于专家准则的自适应后训练

Xukai Wang, Liangqi Li, Zhiyue Xu, Jingang Zhou, Xiaoyu Shi, Jiansheng Cai, Bo Zhang, Zhe Li, Xu-Yao Zhang

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字科技)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 APTER是将结构化领域知识融入专业复杂推理评估、优化与诊断的框架,通过专家准则生成查询级准则并用于自适应后训练,在数学、医学领域三代模型上均实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13129 2026-08-14 cs.AI 新提交 57%

Numeracy in Large Language Models: Fundamental Limitations and Paths to Improvement

大型语言模型中的数字能力:基本局限与改进路径

Aoxin Ni

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对LLMs在基础数值任务中的不可靠性,提出数值基础框架(NGF)并结合三大基准评估前沿模型,给出改进数值能力的部署建议与研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08322 2026-08-14 cs.AI cs.HC math.CO 版本更新 57%

Agentic Neurosymbolic Collaboration for Mathematical Discovery: A Case Study in Combinatorial Design

代理神经符号协作用于数学发现:组合设计的一个案例研究

Hai Xia, Carla P. Gomes, Bart Selman, Stefan Szeider

机构 * Algorithms and Complexity Group, TU Wien(算法与复杂性组,维也纳技术大学) Department of Computer Science, Cornell University(计算机科学系,康奈尔大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过代理神经符号协作方法,在组合设计理论中发现了一个新的紧下界,展示了人类与AI协作在数学发现中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26690 2026-08-13 cs.LG 版本更新 57%

LoRAQuant: Mixed-Precision Quantization of LoRA to Ultra-Low Bits

LoRAQuant:将LoRA混合精度量化至超低比特

Amir Reza Mirzaei, Yuqiao Wen, Yanshuai Cao, Lili Mou

机构 * Dept. Computing Science & Alberta Machine Intelligence Institute (Amii), University of Alberta(计算科学系及阿尔伯塔人工智能研究所(Amii),阿尔伯塔大学) RBC Borealis Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 针对多LoRA适配器规模化部署的高存储成本问题,提出专为LoRA定制的混合精度后训练量化方法LoRAQuant,在LLaMA 2、Mistral模型的多任务上,以更低比特实现了相当或更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10214 2026-08-12 cs.AI 新提交 57%

Decodable But Not Detachable: Training Data Granularity Determines Parametric Modularity in Large Language Models

可解码但不可分离:训练数据粒度决定大语言模型的参数模块化

Marcus Armstrong, Navid Ayoobi, Arjun Mukherjee

机构 * University of Houston(休斯顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究探讨大语言模型是否存在特定领域参数壳,通过多模型、多领域实验发现训练数据的标记级模块化是参数壳形成的关键,为大语言模型的参数模块化研究提供了核心结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00422 2026-08-12 cs.AI 版本更新 57%

TrAC: Trace-Conditioned Answer Consistency for Efficient Uncertainty Quantification in LLMs

TrAC:用于大语言模型高效不确定性量化的轨迹条件答案一致性

Dahai Yu, Lin Jiang, Rongchao Xu, Guang Wang

机构 * Florida State University(佛罗里达州立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 针对大语言模型推理轨迹与答案不一致的问题,提出TrAC框架,结合主动与被动信号实现高效不确定性量化,在数学推理基准上提升了AUROC并降低了AURC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09332 2026-08-11 cs.LG 新提交 57%

Hallucinations and Constraints : Regulating surgical workflow recognition beyond accuracy

幻觉与约束:超越准确率的手术工作流程识别调控

John S. H. Baxter, Pierre Jannin

机构 * Université de Rennes(雷恩大学) Inserm(法国国家健康与医学研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究针对医学图像处理中AI的幻觉问题,提出用线性时序逻辑谓词结合概率图模型调控,在机器人辅助子宫切除术阶段识别中准确率提约10%且消除多数拓扑错误。

Comments 11 pages, 1 figure, 1 table, accepted to the MICCAI 2026 Workshop on Fairness, Regulation, and Ethics (FAIMI-BRIDGE-EPIMI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09119 2026-08-11 cs.AI 新提交 57%

Motif 3: Technical Report

Motif 3:技术报告

Junghwan Lim, Joon Son Chung, Sungmin Lee, Wai Ting Cheung, Gihun Cho, Minsu Ha, Sangho Kang, Beomgyu Kim, Dongseok Kim, Jangwoong Kim, Taehyun Kim, Taewhan Kim, Jeesoo Lee, Jeongdoo Lee, Junhyeok Lee, Dongpin Oh, Hyeyeon Cho, Dahye Choi, Jaeheui Her, Hanbin Jung, Changjin Kang, Minjae Kim, Youngrok Kim, Hyukjin Kweon, Hongjoo Lee, Yeongjae Park, Bokki Ryu

机构 * Motif Technologies(Motif科技公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究推出仅解码器的MoE语言模型Motif 3,采用GDLA等技术,经万亿token预训练及多阶段后训练,在长上下文、推理等任务上性能与领先开源模型相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08888 2026-08-11 cs.AI 新提交 57%

Full-bandwidth transformer

全带宽Transformer

Xi Wang, Ziyang Cai, Zheng Zhan, Harry Dong, Ying Fan, Gustavo de Rosa, Tim Pearce, John Langford

机构 * Johns Hopkins University(约翰斯·霍普金斯大学) Princeton University(普林斯顿大学) Microsoft(微软公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出全带宽Transformer,通过潜在反馈拓宽解码步骤间的垂直反馈通道,经训练验证其在多项任务上性能提升,且解码开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06296 2026-08-11 cs.LG 版本更新 57%

On-Policy Self-Distillation without Any Supervision

无任何监督的在线策略自蒸馏

Yijiang Li, Bingyang Wang, Yijun Liang, Yunjie Tian, Di Fu, Nuno Vasconcelos

机构 * UC San Diego(加州大学圣迭戈分校) Georgia Institute of Technology(佐治亚理工学院) University of Maryland, College Park(马里兰大学帕克分校) ByteDance(字节跳动)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本研究提出无监督在线策略自蒸馏(U-OPSD),仅用模型自身生成结果实现在线策略自蒸馏,在多数学基准上优于基础模型,部分场景超越OPSD、GRPO等监督方法。

Comments Project page at https://williamium3000.github.io/u-opsd/ and code at https://github.com/williamium3000/u-opsd

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06574 2026-08-11 cs.LG 版本更新 57%

Skip a Layer or Loop It? Learning Program-of-Layers in LLMs

跳过一层还是循环它?学习LLM中的层程序

Ziyue Li, Yang Li, Tianyi Zhou

机构 * Ziyue Li, Yang Li, Tianyi Zhou(李子悦、李阳、周天毅)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出PoLar方法,通过轻量级预测网络学习为每个输入动态跳过或重复预训练层,在数学推理任务上以更少层数提升准确率。

Comments Accepted at ICML 2026. Substantially extends arXiv:2507.07996. Updated DART-Math experiments by removing duplicate examples; conclusions remain unchanged. Code: https://github.com/tianyi-lab/PoLar

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05371 2026-08-07 cs.LG 新提交 57%

Quantum-Structured World Models (QSWMs) for Predictive Latent Dynamics

用于预测潜在动力学的量子结构化世界模型(QSWMs)

Hailong Jiang, Emran Hossain, Feng Yu, Jianfeng Zhu, Guilin Zhang, Wulan Guo

机构 * Youngstown State University(扬斯敦州立大学) Kent State University(肯特州立大学) George Washington University(乔治·华盛顿大学)

专题命中 数学推理 :planning(abstract);分类 cs.LG

AI总结 本文提出量子结构化世界模型(QSWMs),研究量子启发结构对世界建模的作用,在基本元胞自动机上评估其变体,发现复值QSWM局部预测潜力良好但类密度矩阵变体存在长时序预测局限。

Comments 19 pages, 5 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04721 2026-08-06 cs.AI 版本更新 57%

AI Assistance Reduces Persistence and Hurts Independent Performance

人工智能辅助降低坚持性并损害独立表现

Grace Liu, Brian Christian, Tsvetomira Dumbalska, Michiel A. Bakker, Rachit Dubey

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学) Massachusetts Institute of Technology(麻省理工学院) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究发现人工智能辅助虽短期提升表现,但降低用户坚持性并损害独立完成任务的能力,尤其在数学推理和阅读理解等任务中表现显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19058 2026-08-06 cs.CL 版本更新 57%

MathDebugger: Detecting and Diagnosing Errors in Synthetic Mathematical Data

MathDebugger:检测与诊断合成数学数据中的错误

Hao Liang, Meiyi Qiang, Yuying Li, Zefeng He, Xiaochen Ma, Ruichuan An, Yongzhen Guo, Zhengzhou Zhu, Bin Cui, Wentao Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 MathDebugger是用于评估模型检测诊断合成数学数据错误的基准,含6000个标注实例,评估发现模型在该任务上表现不足,错误类型信息可提升修正效果,为数学数据质量控制提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02942 2026-08-05 cs.CL 新提交 57%

OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models

OPTD:用于少步扩散语言模型的一致性引导自适应压缩的策略内转换蒸馏

Xiaocheng Lu, Hualei Zhang, Shuhan Guo, Jie Zhang, Xiaoyi Pang, Jian Liu, Haoxi Li, Bohai Gu, Haoxuan Che, Jingcai Guo, Song Guo

机构 * HKUST(香港科技大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 针对少步扩散语言模型现有离线策略蒸馏的轨迹不匹配问题,提出 OPTD 策略内转换蒸馏方法,在四个推理基准上改善质量效率权衡并取得最优质量约束 AUP。

Comments 9 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02181 2026-08-04 cs.LG 新提交 57%

Start Classifying: Categorical Critics for LLM Reinforcement Learning

开始分类:用于大语言模型强化学习的分类式评判器

Zhijian Zhou, Long Li, Xuan Zhang, Zongkai Liu, Yulei Qin, Ke Li, Xing Sun, Xiaoyu Tan, Chao Qu, Yuan Qi

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Tencent YoutuLab(腾讯优图实验室) Griffith University(格里菲斯大学) Shanghai Academy of Artificial Intelligence for Science(上海科学人工智能研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究提出HL-Gauss PPO,将PPO的标量评判器改为分类式预测器,在多任务及Qwen2.5、Qwen3主干上均优于PPO、DAPO基线,可改进评判器信号与优势估计。

Comments Accepted at COLM 2026. 26 pages, 9 figures. Code: https://github.com/ZhijianZhou/HL-guass-ppo

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00531 2026-08-04 cs.AI 新提交 57%

CURE: Local Uncertainty Repair for Block-Parallel Speculative Decoding

CURE:面向块并行推测解码的局部不确定性修复

Aofan Liu, Jingxiang Meng, Fangxin Liu, Yongbiao Chen

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 针对并行推测解码的长序列精度下降问题,提出预算感知动态修复树CURE,通过定位高不确定性token修复错误,在多个基准上提升平均接受长度并实现2.66-3.49倍端到端速度提升。

Comments 9 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00418 2026-08-04 cs.AI 新提交 57%

Mask-Based Priors Are More Persistent than Query-Key Initializations

基于掩码的先验比查询-键初始化更具持久性

Mingze Ma, Hemanth Saratchandran, Cameron Gordon, Simon Lucey

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对 Transformer 在布尔外推任务上的系统性错误泛化问题,提出直接初始化注意力掩码的方法,该方法可保留结构先验,在布尔推理等任务上实现优异外推效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26246 2026-08-04 cs.LG 版本更新 57%

Weak-to-Strong On-Policy Distillation

弱到强在线策略蒸馏

Fangxu Yu, Weijia Xu, Michael Xu, Tianyi Zhou, Zinan Lin

机构 * University of Maryland(马里兰大学) Microsoft Research(微软研究院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出W2S-OPD框架,从多个弱模型蒸馏提升强学生模型,在数学、代码基准测试中优于OPD,可让学生超越领域教师,监督源更弱时仍能提升性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22186 2026-08-04 cs.AI 版本更新 57%

Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning

解构离策略比率:用于异步强化学习的熵缩放信任区域

Guanqun Zhao, Zijun Xie, Binbin Zheng, Enlei Gong, Jiafeng Lu, Yehan Yang, Aoqi Hu, Zeyu Chen

机构 * Baidu(百度)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究异步强化学习中离策略数据问题,提出熵缩放信任区域(ESTR)方法,通过令牌局部熵缩放离策略偏差,无需辅助前向传递等,在多任务和基准测试中优于现有异步方法,提升训练-推理一致性与速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21994 2026-08-04 cs.LG 版本更新 57%

Prefix-Guided On-Policy Distillation: Mining Golden Trajectories from Rollouts

前缀引导的在线策略蒸馏:从轨迹中挖掘黄金轨迹

Qingfei Zhao, Huan Song, Shuyu Tian, Jiawei Shao, Xuelong Li

机构 * TeleAI Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 针对在线策略蒸馏在长程数学推理中效率低、噪声大的问题,提出前缀引导的在线策略蒸馏,通过前缀长度估计轨迹价值,仅对高重叠候选继续生成长轨迹,在多个基准上提升准确率并减少训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00198 2026-08-04 cs.GT cs.CL 57%

Fairshare Data Pricing via Data Valuation for Large Language Models

Luyang Zhang, Cathy Jiao, Beibei Li, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22069 2026-08-04 cs.PL cs.AI 57%

A Compute-Matched Re-Evaluation of TroVE on MATH

Tobias Sesterhenn, Ian Berlot-Attwell, Janis Zenkner, Christian Bartelt

机构 * Clausthal University of Technology, Clausthal, Germany(克莱斯特哈尔技术大学) Vector Institute, University of Toronto, Toronto, Canada(向量研究所)

专题命中 数学推理 :self-correction(abstract);分类 cs.AI

Journal ref 2nd AI for Math Workshop at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28657 2026-08-03 cs.AI 新提交 57%

TAPR: Enhancing LLM Performance with a Task-Aware Prompt Rewriter

TAPR:利用任务感知提示重写器提升大语言模型性能

Oliver Savolainen, Emanuele Bastianelli, Hosein Azarbonyad

机构 * University of Amsterdam(阿姆斯特丹大学) Elsevier(爱思唯尔)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出TAPR模型,采用带GRPO的强化学习训练,可将用户提示优化为任务适配的提示,经微调Phi-4-mini-instruct后,在多任务基准测试中提升了大语言模型的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23802 2026-08-03 cs.AI 版本更新 57%

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

从可验证奖励强化学习到自验证奖励强化学习:任务转换为开放式语言模型自我改进带来自验证奖励

Qinsi Wang, Jing Shi, Huazheng Wang, Kun Wan, Yiran Wu, Bo Liu, Qingyun Wu, Hai Helen Li, Yiran Chen, Handong Zhao, Wentian Zhao

机构 * Duke University(杜克大学) Adobe Inc.(奥多比公司) Oregon State University(俄勒冈州立大学) Pennsylvania State University(宾夕法尼亚州立大学) National University of Singapore(新加坡国立大学) Amazon(亚马逊)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对开放式LLM自我改进中奖励验证问题,提出基于任务转换的RLSVR方法,通过SpyRL实例化,在文本摘要等任务实验中,该方法在不可验证任务上优于现有方法,在可验证推理任务上有提升,扩展了基于RLVR的自我改进。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18622 2026-08-03 cs.CR cs.AI 版本更新 57%

CPInj: Uncovering Prompt Injection Risks in Textual Collaborative Prompt Optimization

CPInj:揭示文本协作式提示优化中的提示注入风险

Xinting Liao, Behnoosh Zamanlooy, Masoumeh Shafieinejad, David B. Emerson, Ruinan Jin, Deval Pandya, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) McMaster University(麦斯特大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究文本协作式提示优化(TCPO)中提示注入风险,提出协作式提示注入攻击CPInj,用恶意指令污染全局提示,降低下游任务性能,现有防御方法无效;还提出防御导向聚合方法APAgg,实验表明TCPO存在关键漏洞,攻击有待更强大防御。

Comments Accepted by COLM 2026 and AI4GOOD workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28582 2026-07-31 cs.LG 新提交 57%

$β$-OPSD: Deriving with Policy Optimization, Training with Self-Distillation

β-OPSD:基于策略优化推导,采用自蒸馏训练

Jiawei Xu, Minghui Liu, Juzheng Zhang, Tom Goldstein, Furong Huang

机构 * University of Maryland(马里兰大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 β-OPSD是将普通OPSD扩展为含可控正则化参数β的策略优化通用形式,通过蒸馏近似策略优化解,在数学推理基准上性能与稳定性均优于普通OPSD。

详情

展开后加载摘要…

URL PDF HTML 收藏