arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3246 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3246 篇

2505.10571 2026-01-27 cs.CL cs.AI 62%

On the Failure of Latent State Persistence in Large Language Models

大型语言模型中潜在状态持续性的失效

Jen-tse Huang, Kaiser Sun, Wenxuan Wang, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) Renmin University of China(中国人民大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文揭示大型语言模型在维持持久潜在状态方面的缺陷,通过三个实验展示其在概率分配、概念漂移和变量绑定上的失败,表明LLMs更倾向于反应性求解而非主动规划。

Comments 8 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02076 2026-01-21 cs.CL cs.AI 62%

Deferred Commitment Decoding for Diffusion Language Models

延迟承诺解码用于扩散语言模型

Yingte Shu, Yuchuan Tian, Chao Xu, Yunhe Wang, Hanting Chen

机构 * Peking University(北京大学) Huawei Technologies(华为技术)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出延迟承诺解码方法,通过基于不确定性的策略提升扩散语言模型解码质量和效率,实验显示在多个模型和基准测试中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12711 2026-01-21 cs.AI cs.LG cs.SC 62%

Neurosymbolic LoRA: Why and When to Tune Weights vs. Rewrite Prompts

神经符号LoRA:为何以及何时调整权重 versus 重写提示

Kevin Wang, Neel P. Bhatt, Cong Liu, Junbo Li, Runjin Chen, Yihan Xi, Timothy Barclay, Alvaro Velasquez, Ufuk Topcu, Zhangyang Wang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 神经符号LoRA结合数值和符号更新,提升语言模型微调的适应性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23281 2026-01-16 cs.AI cs.CL 62%

MathArena: Evaluating LLMs on Uncontaminated Math Competitions

MathArena: 在无污染数学竞赛中评估大语言模型

Mislav Balunović, Jasper Dekoninck, Ivo Petrov, Nikola Jovanović, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院) INSAIT

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MathArena通过评估数学竞赛中的LLM,揭示了模型在推理和证明写作上的能力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07898 2026-01-14 cs.LG cs.AI 62%

Large Language Models and Algorithm Execution: Application to an Arithmetic Function

大语言模型与算法执行:应用于一个算术函数

Farah Ben Slama, Frédéric Armetta

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM-DAL模型,通过专门训练提升大语言模型执行算法的能力,应用于算术函数的推理与泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06022 2026-01-12 cs.CL cs.AI 62%

AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs

AdaFuse: 用于大语言模型的自适应集成解码与测试时缩放

Chengming Cui, Tianxin Wei, Ziyi Chen, Ruizhong Qiu, Zhichen Zeng, Zhining Liu, Xuying Ning, Duo Zhou, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AdaFuse通过自适应集成解码与测试时缩放,提升大语言模型在多种任务上的生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05870 2026-01-12 cs.LG cs.AI 62%

IIB-LPO: Latent Policy Optimization via Iterative Information Bottleneck

IIB-LPO: 通过迭代信息瓶颈进行潜在策略优化

Huilin Deng, Hongchen Luo, Yue Zhu, Long Li, Zhuoyue Chen, Xinghao Zhao, Ming Li, Jihai Zhang, Mengchang Wang, Yang Cao, Yu Kang

机构 * DeepSeek-AI

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 IIB-LPO通过迭代信息瓶颈方法,解决LLM推理中的探索崩溃问题,实现更多样化的推理路径和更高的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05501 2026-01-12 cs.LG cs.CL 62%

Hi-ZFO: Hierarchical Zeroth- and First-Order LLM Fine-Tuning via Importance-Guided Tensor Selection

Hi-ZFO:通过重要性引导的张量选择实现层次化零阶和一阶LLM微调

Feihu Jin, Ying Tan

机构 * School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Hi-ZFO通过结合一阶和零阶优化,提升LLM微调的精度与探索能力,有效解决训练中的局部极小值问题。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04789 2026-01-09 cs.CL cs.AI 62%

NC2C: Automated Convexification of Generic Non-Convex Optimization Problems

NC2C: 通用非凸优化问题的自动凸化

Xinyue Peng, Yanming Liu, Yihan Cang, Yuwei Zhang, Xinyi Wang, Songhang Deng, Jiannan Cao

机构 * Southeast University(东南大学) Zhejiang University(浙江大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 NC2C通过大语言模型实现通用非凸优化问题的自动凸化,提升求解效率并减少专家依赖。

Comments First version of NC2C

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03661 2026-01-08 cs.LG cs.AI 62%

AMIR-GRPO: Inducing Implicit Preference Signals into GRPO

AMIR-GRPO:将隐式偏好信号引入GRPO

Amir Hossein Yari, Fajri Koto

机构 * Department of Natural Language Processing, MBZUAI(自然语言处理系,MBZUAI)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AMIR-GRPO通过隐式对比正则化器提升GRPO性能,增强低奖励轨迹抑制,减少长度偏差,实现更密集的监督约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03320 2026-01-08 cs.LG cs.AI 62%

Ratio-Variance Regularized Policy Optimization for Efficient LLM Fine-tuning

基于比率方差正则化的策略优化用于高效的LLM微调

Yu Luo, Shuo Han, Yihan Hu, Dong Li, Jianye Hao

机构 * Department of Foundation Model, 2012 Labs, Huawei(华为2012实验室基础模型部门) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 R²VPO通过正则化策略比率的方差,提升LLM微调的稳定性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11184 2026-01-08 cs.LG cs.CL 62%

Reinforcement Learning for Tool-Integrated Interleaved Thinking towards Cross-Domain Generalization

强化学习用于工具集成的交叉领域泛化思考

Zhengyu Chen, Jinluan Yang, Teng Xiao, Ruochen Zhou, Luan Zhang, Xiangyu Xi, Xiaowei Shi, Wei Wang, Jinggang Wang

机构 * Meituan(美团) Zhejiang University(浙江大学) Allen Institute for Artificial Intelligence(人工智能算法研究所) City University of Hong Kong(香港城市大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出RITE方法,通过强化学习和交叉领域工具执行,提升LLM在跨领域推理中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22234 2026-01-07 cs.LG cs.AI 62%

DiRL: An Efficient Post-Training Framework for Diffusion Language Models

DiRL:一种高效的扩散语言模型后训练框架

Ying Zhu, Jiaxin Wan, Xiaoran Liu, Siyang He, Qiqi Wang, Xu Guo, Tianyi Liang, Zengfeng Huang, Ziwei He, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) OpenMoss Team(OpenMoss团队)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DiRL是一种高效的扩散语言模型后训练框架,通过整合FlexAttention加速的分块训练与LMDeploy优化的推理,实现了高效的两阶段后训练,提升了在复杂推理任务如数学中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01931 2026-01-06 cs.LG cs.AI 62%

DéjàQ: Open-Ended Evolution of Diverse, Learnable and Verifiable Problems

DéjàQ:开放性进化多样化、可学习且可验证的问题

Willem Röpke, Samuel Coward, Andrei Lupu, Thomas Foster, Tim Rocktäschel, Jakob Foerster

机构 * Willem Röpke AI Lab, Vrije Universiteit Brussel Belgium(维尔姆·罗普克人工智能实验室,布鲁塞尔自由大学) FLAIR, University of Oxford United Kingdom(FLAIR,牛津大学) University College London United Kingdom(伦敦大学学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DéjàQ通过大语言模型驱动的突变策略动态进化多样化数学问题,提升模型的可学习性和推理能力,开源代码支持其应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00942 2026-01-06 cs.LG cs.CL 62%

Reliability Under Randomness: An Empirical Analysis of Sparse and Dense Language Models Across Decoding Temperatures

可靠性与随机性:在解码温度下对稀疏和密集语言模型的实证分析

Kabir Grover

机构 * Kabir Grover(独立研究者)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了稀疏和密集语言模型在不同解码温度下的可靠性,发现指令微调比架构稀疏性对稳定性影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00874 2026-01-06 cs.LG cs.AI physics.comp-ph 62%

LLMize: A Framework for Large Language Model-Based Numerical Optimization

LLMize: 一种基于大语言模型的数值优化框架

M. Rizki Oktavian

机构 * Blue Wave AI Labs(蓝波人工智能实验室) School of Nuclear Engineering, Purdue University(核工程学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LLMize是一种基于大语言模型的数值优化框架,通过自然语言描述注入约束和领域知识,适用于复杂领域特定任务的优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00448 2026-01-05 cs.CL cs.AI 62%

Language as Mathematical Structure: Examining Semantic Field Theory Against Language Games

语言作为数学结构:对语义场理论与语言游戏的检验

Dimitris Vartziotis

机构 * TWT Science & Innovation(TWT科学与创新) NIKI - Digital Engineering(NIKI数字工程)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比语义场理论与语言游戏,探讨语言的数学结构与社会建构的互补性,提出新的理论指导AI架构的方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16989 2026-01-05 cs.LG cs.AI 62%

PTQTP: Post-Training Quantization to Trit-Planes for Large Language Models

PTQTP: 预训练量化到三平面用于大语言模型

He Xiao, Runming Yang, Qingyao Yang, Wendong Xu, Zhen Li, Yupeng Su, Zhengwu Liu, Hongxia Yang, Ngai Wong

机构 * The University of Hong Kong(香港大学) The Hong Kong Polytechnic University(香港理工大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 PTQTP通过分解权重矩阵为三平面实现高效大语言模型量化,提升推理速度并减少资源消耗。

Comments Ternary Quantization, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22492 2025-12-30 cs.DC cs.AI cs.LG 62%

Role-Based Fault Tolerance System for LLM RL Post-Training

基于角色的LLM强化学习后训练容错系统

Zhenqian Chen, Baoquan Zhong, Xiang Li, Qing Dai, Xinkui Zhao, Miao Ye, Ren Cheng, Lufei Zhang, Jianwei Yin

机构 * Zhejiang University(浙江大学) State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 RobustRL通过基于角色的故障隔离技术,有效提升LLM强化学习后训练的容错性能,实现训练时间比率提升80%以上。

Comments 16 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22309 2025-12-30 cs.LG cs.AI 62%

LLMBoost: Make Large Language Models Stronger with Boosting

LLMBoost: 通过提升使大型语言模型更强

Zehao Chen, Tianxiang Ai, Yifei Li, Gongxun Li, Yuyang Wei, Wang Zhou, Guanghui Li, Bin Yu, Zhijun Chen, Hailong Sun, Fuzhen Zhuang, Jianxin Li, Deqing Wang, Yikun Ban

机构 * Beihang University(北航大学) China Telecom eSurfing Cloud(中国电信云)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LLMBoost通过引入跨模型注意力机制、链式训练范式和近似并行推理范式,提升大型语言模型的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02833 2025-12-23 cs.LG cs.CL 62%

In Good GRACEs: Principled Teacher Selection for Knowledge Distillation

在良好的GRACE中:为知识蒸馏选择原则性教师

Abhishek Panigrahi, Bingbin Liu, Sadhika Malladi, Sham Kakade, Surbhi Goel

机构 * Princeton Language and Intelligence(普林斯顿语言与智能研究所) Kempner Institute, Harvard(哈佛凯普纳研究所) Microsoft Research, New York(微软研究院(纽约)) University of Pennsylvania(宾夕法尼亚大学)

专题命中 数学推理 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 GRACE通过量化教师有效性,为知识蒸馏提供原则性教师选择和蒸馏指导,提升学生模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17636 2025-12-22 cs.LG cs.AI 62%

Trust-Region Adaptive Policy Optimization

信任区域自适应策略优化

Mingyu Su, Jian Guan, Yuxian Gu, Minlie Huang, Hongning Wang

机构 * The Conversational AI (CoAI) Group, Tsinghua University(清华大学对话式人工智能(CoAI)小组)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 TRAPO通过结合SFT和RL的训练流程,提升大语言模型的推理能力,实现更稳定的训练和更高效的探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14954 2025-12-18 cs.CL cs.LG 62%

Cross-Tokenizer Likelihood Scoring Algorithms for Language Model Distillation

跨分词器似然评分算法用于语言模型蒸馏

Buu Phan, Ashish Khisti, Karen Ullrich

机构 * University of Toronto(多伦多大学) Meta AI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出跨分词器似然评分算法,通过BPE递归结构解决词汇不匹配问题,提升蒸馏效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13063 2025-12-16 cs.CL cs.AI 62%

LLM Rationalis? Measuring Bargaining Capabilities of AI Negotiators

LLM Rationalis? 测量AI谈判者的协商能力

Cheril Shah, Akshit Agarwal, Kanak Garg, Mourad Heddaya

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了AI谈判者的协商能力,发现LLMs在谈判中系统性地锚定在极端位置,缺乏策略多样性,且协商能力不随模型改进而提升。

Comments Published in the First Workshop on Multi-Turn Interactions in Large Language Models at Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07522 2025-12-09 cs.CL cs.AI 62%

LIME: Making LLM Data More Efficient with Linguistic Metadata Embeddings

LIME:通过语言元数据嵌入使LLM数据更高效

Sebastian Sztwiertnia, Felix Friedrich, Kristian Kersting, Patrick Schramowski, Björn Deiseroth

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LIME通过语言元数据嵌入提升LLM预训练效率,显著增强语言建模和生成任务表现

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06449 2025-12-09 cs.LG cs.AI 62%

FLEX: Continuous Agent Evolution via Forward Learning from Experience

FLEX: 通过经验向前学习实现连续智能体进化

Zhicheng Cai, Xinyuan Guo, Yu Pei, Jiangtao Feng, Jinsong Su, Jiangjie Chen, Ya-Qin Zhang, Wei-Ying Ma, Mingxuan Wang, Hao Zhou

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR)、清华大学) ByteDance Seed(字节跳动种子) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Informatics, Xiamen University(厦门大学信息学院) SIA-Lab of Tsinghua AIR and ByteDance Seed(清华大学AIR实验室和字节跳动种子)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 FLEX通过经验向前学习实现LLM智能体的持续进化,提升数学推理、化学逆合成和蛋白质预测性能,并揭示经验增长的扩展规律和跨智能体的经验继承现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11227 2025-12-09 cs.AI cs.LG 62%

Is PRM Necessary? Problem-Solving RL Implicitly Induces PRM Capability in LLMs

PRM是否必要?问题解决RL隐式地在LLMs中诱导PRM能力

Zhangying Feng, Qianglong Chen, Ning Lu, Yongqian Li, Siqi Cheng, Shuangmu Peng, Duyu Tang, Shengcai Liu, Zhirui Zhang

机构 * Huawei Technologies Ltd.(华为技术有限公司) Guangdong Provincial Key Laboratory of Brain-Inspired Intelligent Computation, Department of CSE, SUSTech(广东省脑启发智能计算重点实验室、信息科学部、南方科技大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现纯RL训练可提升LLMs的推理能力并隐式诱导PRM能力,挑战了PRM的必要性。

Comments Accepted by NeurIPS 2025, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06678 2025-12-09 cs.LG cs.AI 62%

GradientSpace: Unsupervised Data Clustering for Improved Instruction Tuning

GradientSpace: 无监督数据聚类以提升指令微调

Shrihari Sridharan, Deepak Ravikumar, Anand Raghunathan, Kaushik Roy

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 GradientSpace通过直接在梯度空间中聚类样本,提升指令微调效果,减少推理延迟并提高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01420 2025-12-02 cs.CL cs.AI 62%

PromptBridge: Cross-Model Prompt Transfer for Large Language Models

PromptBridge: 跨模型提示迁移用于大型语言模型

Yaxuan Wang, Quan Liu, Zhenting Wang, Zichao Li, Wei Wei, Yang Liu, Yujia Bao

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) Center for Advanced AI, Accenture(Accenture高级人工智能研究中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PromptBridge通过跨模型提示迁移技术,解决模型切换时提示效果下降的问题,提升下游任务准确性并减少迁移成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12398 2025-11-27 cs.CR cs.AI cs.CL 62%

Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position

对齐何处开始?扩散大语言模型可能需要不同的位置

Zhixin Xie, Xurui Song, Jun Luo

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MOSA方法,通过强化学习对齐dLLM中间生成与安全拒绝,提升安全性。

Comments Accepted for oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏