arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 202 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 202 篇

2604.13349 2026-07-02 cs.LG 版本更新 57%

When Less Latent Leads to Better Relay: Information-Preserving Compression for Latent Multi-Agent LLM Collaboration

少而精的潜在信息带来更好的中继:面向潜在多智能体大语言模型协作的信息保持压缩

Yiping Li, Zhiyu An, Wan Du

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of California, Merced(加州大学默塞德分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种信息保持压缩方法,通过引入正交回填机制,在减少通信开销的同时保持信息完整性,提升了多智能体大语言模型协作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16807 2026-07-01 cs.AI cs.DM math.CO 版本更新 57%

Improved Upper Bounds for Slicing the Hypercube

切割超立方体的改进上界

Duncan Soiffer, Nathaniel Itty, Christopher D. Rosin, Blake Bruell, Mason DiCicco, Gábor N. Sárközy, Ryan Offstein, Daniel Reichman

机构 * Carnegie Mellon University(卡内基梅隆大学) Worcester Polytechnic Institute(伍斯特理工学院) Constructive Codes

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究用最少超平面切割n维超立方体所有边的问题,通过构造8个超平面切割Q_{10},将上界从⌈5n/6⌉改进为⌈4n/5⌉(n为5的奇数倍时加1)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06395 2026-06-24 cs.CL 版本更新 57%

AfriqueLLM: How Data Mixing and Model Architecture Impact Continued Pre-training for African Languages

AfriqueLLM: 数据混合与模型架构如何影响非洲语言的持续预训练

Hao Yu, Tianyi Xu, Michael A. Hedderich, Wassim Hamidouche, Syed Waqas Zamir, David Ifeoluwa Adelani

机构 * McGill University(麦吉尔大学) Mila-Quebec AI Institute(魁北克AI研究所) LMU Munich & Munich Center for Machine Learning(慕尼黑大学及慕尼黑机器学习中心) Microsoft AI for Good Research Lab(微软AI for Good研究实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文通过持续预训练26B tokens,在20种非洲语言上构建了AfriqueLLM模型套件,系统研究了数据组成和模型架构对下游性能的影响,发现数据组成是主要驱动因素,且架构选择比模型规模更重要。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01316 2026-06-19 cs.AI 版本更新 57%

Science Earth: Towards A Planet-Scale Operating System for AI-Native Scientific Discovery

Science Earth: 迈向面向AI原生科学发现的行星级操作系统

Zhe Zhao, Haibin Wen, Yingcheng Wu, Jiaming Ma, Yifan Wen, Jinglin Jian, Jiacheng Ge, Xiangru Tang, Bo An, Ming Yin, Sanfeng Wu, Mengdi Wang, Le Cong

机构 * Department of Pathology, Department of Genetics, Stanford University School of Medicine(病理学系、遗传学系,斯坦福大学医学院) Princeton AI Lab, Department of Electrical & Computer Engineering, Princeton University(普林斯顿人工智能实验室、电气与计算机工程系,普林斯顿大学) Scripps Research, La Jolla, CA, USA(斯克里普斯研究机构,洛杉矶,加利福尼亚州,美国) Division of Biostatistics, Department of Population Health, New York University Grossman School of Medicine(生物统计学部、人口健康系,纽约大学格罗斯曼医学院) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) Department of Computer Science, Yale University(计算机科学系,耶鲁大学) Department of Physics, Princeton University(物理系,普林斯顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出Science Earth行星级科学运行时,通过EACN协议实现AI能力动态连接与自组织协作,在跨太平洋Kuramoto同步研究和单细胞分析中验证了分布式自校正科学推理。

Comments Withdrawn by the authors. (1) The author list and authorship roles had not been finalized and agreed upon by all listed authors prior to submission. (2) The specific contribution of the system in the K3 synchronization example (Section on Kuramoto/nonlinear physics) requires further validation before it can be reported. The authors are addressing both points and may resubmit a corrected version.

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16865 2026-06-19 cs.CL 版本更新 57%

MixSD: Mixed Contextual Self-Distillation for Knowledge Injection

MixSD: 混合上下文自蒸馏用于知识注入

Jiarui Liu, Lechen Zhang, Yongjin Yang, Yinghui He, Yingheng Wang, Weihao Xuan, Zhijing Jin, Mona Diab

机构 * Carnegie Mellon University(卡内基梅隆大学) Jinesis Lab, University of Toronto & Vector Institute(Jinesis实验室,多伦多大学及向量研究所) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Princeton University(普林斯顿大学) Cornell University(康奈尔大学) The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所AIP) Max Planck Institute for Intelligent Systems, Tübingen, Germany(德国图宾根最大计划智能系统研究所) EuroSafeAI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MixSD方法,通过混合模型自身条件下的token来实现与模型生成分布对齐的知识注入,从而在保持预训练能力的同时提升事实记忆和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07593 2026-06-19 cs.AI 版本更新 57%

Too long; didn't solve

太长;没解决

Lucía M. Cabrera, Isaac Saxton-Knight, Jocelyn D'Arcy

机构 * Instituto Balseiro(巴塞罗那研究所) Poindexter Labs(波因迪克斯实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究提示长度和解答长度与大型语言模型在数学问题上的性能关系,发现两者与模型失败率正相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09689 2026-06-19 cs.LG 版本更新 57%

Model soups need only one ingredient

模型汤只需一种成分

Alireza Abdollahpoorrostam, Nikolaos Dimitriadis, Adam Hazimeh, Pascal Frossard

机构 * EPFL(瑞士联邦理工学院) EPFL LTS4(瑞士联邦理工学院 LTS4)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 提出MonoSoup方法,利用SVD分解单检查点的层更新,通过熵有效秩自动重加权成分,实现强分布内-分布外平衡,无需多检查点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14807 2026-06-17 cs.AI 版本更新 57%

Beyond the Sampled Token: Preserving Candidate Support in RLVR

超越采样令牌:在RLVR中保留候选支持

Ruotian Peng, Yi Ren, Zhouliang Yu, Weiyang Liu, Yandong Wen

机构 * Westlake University(西湖大学) University of British Columbia(不列颠哥伦比亚大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文从候选分布角度分析RLVR中的探索崩溃,提出CaSP方法,通过保留前N个候选的概率质量,在不牺牲pass@1的情况下提升pass@K,在多个基准测试中验证了有效性。

Comments Technical report (23 pages, 16 figures, project page: https://spherelab.ai/simko/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03108 2026-06-15 cs.AI 版本更新 57%

EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning

EvoTrainer: 协同进化LLM策略与训练框架以实现自主智能体强化学习

Guhong Chen, Yingcheng Shi, Yongbin Li, Binhua Li, Xander Xu, Hu Wei, Shiwen Ni, Min Yang, Jieping Ye

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Tongyi Lab , Alibaba Group(通义实验室,阿里巴巴集团) Alibaba Group(阿里巴巴集团) SUAT(深圳大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出EvoTrainer框架,通过协同进化LLM策略和训练端框架,基于经验反馈自动诊断、修正并积累可复用技能,在数学推理、编程竞赛和仓库级软件工程任务上匹配或超越人工设计的RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06114 2026-06-09 cs.AI 版本更新 57%

Towards Healthy Evolution: Exploring the Role and Mechanisms of Human-Agent Interaction in Self-Evolving Systems

走向健康进化:探索人机交互在自我进化系统中的作用与机制

Dianxing Shi, Bowen Wang, Junqi He, Junhao Chen, Yuta Nakashima

机构 * The University of Osaka(大阪大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出ANCHOR框架,通过模拟人类监督的反馈机制,在自我进化系统中缓解能力退化与安全漂移,实验表明有限监督可显著提升安全性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15829 2026-06-09 cs.LG 版本更新 57%

Operationalising the Superficial Alignment Hypothesis via Task Complexity

通过任务复杂度操作化浅层对齐假设

Tomás Vergara-Browne, Darshan Patil, Ivan Titov, Siva Reddy, Tiago Pimentel, Marius Mosbach

机构 * University of Maryland(马里兰大学) University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of Toronto(多伦多大学) University of Edinburgh(爱丁堡大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 提出任务复杂度指标(达到目标性能的最短程序长度)来量化浅层对齐假设,实验表明预训练大幅降低任务复杂度,而微调可将复杂度降低数个数量级。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18428 2026-06-09 cs.AI 版本更新 57%

AlphaOPT: Formulating Optimization Programs with Self-Improving LLM Experience Library

AlphaOPT: 利用自改进LLM经验库构建优化问题

Minwei Kong, Ao Qu, Xiaotong Guo, Wenbin Ouyang, Chonghe Jiang, Han Zheng, Yining Ma, Dingyi Zhuang, Yuhan Tang, Junyi Li, Shenhao Wang, Haris Koutsopoulos, Hai Wang, Cathy Wu, Jinhua Zhao

机构 * Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟) Massachusetts Institute of Technology(麻省理工学院) University of Florida(佛罗里达大学) Northeastern University(东北大学) Singapore Management University(新加坡管理学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出AlphaOPT,一种自改进经验库,使LLM能从有限监督中学习优化建模知识,通过库学习和库演化两阶段循环,逐步提升性能,在多个基准上超越基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08222 2026-06-09 cs.AI 版本更新 57%

Weak-Driven Learning: How Weak Agents make Strong Agents Stronger

弱驱动学习:弱智能体如何使强智能体更强

Zehao Chen, Gongxun Li, Tianxiang Ai, Zixuan Huang, Xiaodong Liu, Yifei Li, Wang Zhou, Fuzhen Zhuang, Xianglong Liu, Jianxin Li, Deqing Wang, Yikun Ban

机构 * Beihang University(北航) China Telecom eSurfing Cloud(中国电信eSurfing云)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 针对大语言模型后训练中的饱和瓶颈,提出WMSS方法,利用模型历史弱检查点通过熵动力学识别可恢复学习差距并进行补偿学习,在数学推理和代码生成任务上实现有效性能提升且无额外推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04854 2026-08-18 cs.SE 版本更新 50%

Assessing Large Language Models for Stabilizing Numerical Expressions in Scientific Software

评估大语言模型在科学软件中稳定数值表达式的能力

Tien Nguyen, Kirshanthan Sundararajah, Muhammad Ali Gulzar

专题命中 数学推理 :reasoning(abstract)

AI总结 本文评估大语言模型在数值稳定性任务中的表现,发现其在检测和稳定不稳定的计算方面与传统方法相当,并在某些情况下表现更优,但对控制流和高精度字面量处理较弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00868 2026-08-05 cs.CV cs.HC 版本更新 50%

MIDAL: A Dataset of Math Image Descriptions for Accessible Learning

MIDAL:用于无障碍学习的数学图像描述

Rebeka Popek, Vaghawan Ojha, Young Hwan You

机构 * E.K. Solutions Pvt. Ltd.(E.K.解决方案私人有限公司)

专题命中 数学推理 :reasoning(abstract)

AI总结 该研究推出含2020张多级别数学图像的MIDAL数据集,用于训练视觉语言模型生成无障碍图像描述,还可微调语言模型提升数学推理能力,助力高等教育STEM内容无障碍性建设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18538 2026-07-31 cs.CR 版本更新 50%

CryptanalysisBench: Can LLMs do Cryptanalysis?

密码分析基准测试:大语言模型能进行密码分析吗?

Lukas Fluri, Avital Shafran, Nicholas Carlini, Matthew Jagielski, Milad Nasr, Orr Dunkelman, Eyal Ronen, Florian Tramèr

专题命中 数学推理 :reasoning(abstract)

AI总结 研究探讨大语言模型能否进行密码分析,引入包含六个密码原语家族191个任务的CryptanalysisBench基准测试,五个前沿模型在不同层级有一定破解率,不仅得出已知结果还产生新成果,发布该基准测试以追踪人工智能密码分析进展及压力测试候选方案。

Comments 46 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00491 2026-07-30 cs.NI 版本更新 50%

Smart-TCP: An Agentic AI-based Autonomous and Adaptive TCP Protocol

Smart-TCP:基于智能体AI的自主自适应TCP协议

Yule Han, Kezhi Wang, Yizhe Zhao, Kun Yang

专题命中 数学推理 :reasoning(abstract)

AI总结 提出Smart-TCP框架,利用大/小语言模型与算术逻辑单元协同决策,实现TCP控制逻辑的自适应,实验显示高精度与全生命周期成功率。

Comments Submitted for possible journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10265 2026-07-28 cs.DB 版本更新 50%

TGMS: An Agent-Native Bi-Temporal Graph Management System

TGMS:一种原生代理双时态图管理系统

Xiaofei Zhang

专题命中 数学推理 :verifier(abstract)

AI总结 研究针对时态图问题中LLM代理常失败的情况,提出双时态属性图管理系统TGMS,将13个运算符作为代理工具,LLM规划调用,系统计算,能分离有效时间与事务时间,在基准测试中表现优异,开源代码等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14008 2026-07-17 cs.CV 版本更新 50%

Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models

稀疏-LaViDa:稀疏多模态离散扩散语言模型

Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

机构 * Adobe(Adobe公司) UCLA(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(abstract)

AI总结 针对掩码离散扩散模型推理速度慢的问题,提出Sparse-LaViDa框架,通过动态截断冗余掩码令牌加速采样,引入专用寄存器令牌和注意力掩码保证质量与一致性,基于LaViDa - O构建,在多任务中实现加速且保持质量。

Comments 18 pages (12 pages for the main paper and 6 pages for the appendix), 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18030 2026-07-15 cs.HC 版本更新 50%

ParaTutor: Coordinating Parent and Child Math Tutoring through Role Separated LLM Scaffolding

ParaTutor: 通过角色分离的实时脚手架界面实现LLM介导的亲子辅导

Lan Luo, Anqi Wang, Muzhi Zhou, Junhua Zhu, Jie Cai, Ao Yu, Hui Pan

专题命中 数学推理 :reasoning(abstract)

AI总结 针对亲子辅导中角色不对称问题,提出ParaTutor系统,通过为家长提供辅导指导、为孩子提供视觉基础,在实时互动中保持家长主导和孩子参与,实验表明优于通用LLM辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26286 2026-07-03 cs.CC cs.LO 版本更新 50%

Proofdoors and Efficiency of CDCL Solvers

证明门与CDCL求解器的效率

Sunidhi Singh, Vincent Liew, Marc Vinyals, Vijay Ganesh

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出证明门参数,用于解释CDCL求解器在电路验证中的效率,证明具有小证明门的公式有短的分辨率证明,并展示某些CDCL求解器能高效生成此类证明。

Comments version 2.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06998 2026-06-11 cond-mat.other 版本更新 50%

Identifying Topological Invariants of Non-Hermitian Systems via Domain-Adaptive Multimodal Model for Mathematics

通过数学多模态模型识别非厄密系统拓扑不变量

Jiuchun Meng, Lichao Sun, Xiumei Wang, Dandan Zhu, Xingping Zhou

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出利用多模态模型识别非厄密系统拓扑不变量,通过输入哈密顿量的本征值和本征向量,结合数学大语言模型进行复杂计算和推理,有效提取拓扑信息。

详情

展开后加载摘要…

URL PDF HTML 收藏