arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45515 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3258 篇

2410.18035 2024-10-24 cs.CL 70%

MiLoRA: Efficient Mixture of Low-Rank Adaptation for Large Language Models Fine-tuning

Jingfan Zhang, Yi Zhao, Dan Chen, Xing Tian, Huanran Zheng, Wei Zhu

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

Comments Accepted by EMNLP 2024 Findings. arXiv admin note: substantial text overlap with arXiv:2405.18203

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10348 2024-10-15 cs.CL 70%

Augmenting In-Context-Learning in LLMs via Automatic Data Labeling and Refinement

Joseph Shtok, Amit Alfassy, Foad Abo Dahood, Eliyahu Schwartz, Sivan Doveh, Assaf Arbelle

专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04751 2024-10-08 cs.CV cs.CL 70%

Intriguing Properties of Large Language and Vision Models

Young-Jun Lee, Byungsoo Ko, Han-Gyu Kim, Yechan Hwang, Ho-Jin Choi

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

Comments Code is available in https://github.com/passing2961/IP-LLVM

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02970 2024-08-07 cs.CL 70%

EC-Guide: A Comprehensive E-Commerce Guide for Instruction Tuning and Quantization

Zhaopeng Feng, Zijie Meng, Zuozhu Liu

专题命中 数学推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01779 2024-08-06 cs.CL 70%

MathLearner: A Large Language Model Agent Framework for Learning to Solve Mathematical Problems

Wenbei Xie, Donglin Liu, Haoran Yan, Wenjie Wu, Zongyang Liu

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16831 2024-07-25 cs.AI 70%

Networks of Networks: Complexity Class Principles Applied to Compound AI Systems Design

Jared Quincy Davis, Boris Hanin, Lingjiao Chen, Peter Bailis, Ion Stoica, Matei Zaharia

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.19255 2024-07-03 cs.CL 70%

GSM-Plus: A Comprehensive Benchmark for Evaluating the Robustness of LLMs as Mathematical Problem Solvers

Qintong Li, Leyang Cui, Xueliang Zhao, Lingpeng Kong, Wei Bi

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

Comments ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00390 2024-07-02 cs.CL 70%

Advancing Process Verification for Large Language Models via Tree-Based Preference Learning

Mingqian He, Yongliang Shen, Wenqi Zhang, Zeqi Tan, Weiming Lu

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03820 2024-06-24 cs.CL 70%

CantTalkAboutThis: Aligning Language Models to Stay on Topic in Dialogues

Makesh Narsimhan Sreedhar, Traian Rebedea, Shaona Ghosh, Jiaqi Zeng, Christopher Parisien

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06585 2024-04-19 cs.LG 70%

Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models

Avi Singh, John D. Co-Reyes, Rishabh Agarwal, Ankesh Anand, Piyush Patil, Xavier Garcia, Peter J. Liu, James Harrison, Jaehoon Lee, Kelvin Xu, Aaron Parisi, Abhishek Kumar, Alex Alemi, Alex Rizkowsky, Azade Nova, Ben Adlam, Bernd Bohnet, Gamaleldin Elsayed, Hanie Sedghi, Igor Mordatch, Isabelle Simpson, Izzeddin Gur, Jasper Snoek, Jeffrey Pennington, Jiri Hron, Kathleen Kenealy, Kevin Swersky, Kshiteej Mahajan, Laura Culp, Lechao Xiao, Maxwell L. Bileschi, Noah Constant, Roman Novak, Rosanne Liu, Tris Warkentin, Yundi Qian, Yamini Bansal, Ethan Dyer, Behnam Neyshabur, Jascha Sohl-Dickstein, Noah Fiedel

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

Comments Accepted to TMLR. Camera-ready version. First three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04817 2024-04-09 cs.CL 70%

FRACTAL: Fine-Grained Scoring from Aggregate Text Labels

Yukti Makhija, Priyanka Agrawal, Rishi Saket, Aravindan Raghuveer

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

Comments 22 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13064 2024-02-21 cs.CL 70%

Synthetic Data (Almost) from Scratch: Generalized Instruction Tuning for Language Models

Haoran Li, Qingxiu Dong, Zhengyang Tang, Chaojun Wang, Xingxing Zhang, Haoyang Huang, Shaohan Huang, Xiaolong Huang, Zeqiang Huang, Dongdong Zhang, Yuxian Gu, Xin Cheng, Xun Wang, Si-Qing Chen, Li Dong, Wei Lu, Zhifang Sui, Benyou Wang, Wai Lam, Furu Wei

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12851 2024-02-21 cs.CL 70%

MoELoRA: Contrastive Learning Guided Mixture of Experts on Parameter-Efficient Fine-Tuning for Large Language Models

Tongxu Luo, Jiahe Lei, Fangyu Lei, Weihao Liu, Shizhu He, Jun Zhao, Kang Liu

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05821 2023-11-13 cs.CL 70%

Let's Reinforce Step by Step

Sarah Pan, Vladislav Lialin, Sherin Muckatira, Anna Rumshisky

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

Comments NeurIPS 2023 Workshop on Instruction Tuning and Instruction Following

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07004 2023-10-24 cs.CL 70%

Not All Languages Are Created Equal in LLMs: Improving Multilingual Capability by Cross-Lingual-Thought Prompting

Haoyang Huang, Tianyi Tang, Dongdong Zhang, Wayne Xin Zhao, Ting Song, Yan Xia, Furu Wei

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

Comments Accepted by EMNLP 2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.09723 2023-01-26 cs.AI 70%

Mathematics, word problems, common sense, and artificial intelligence

Ernest Davis

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.05086 2022-02-11 cs.AI cs.DB 70%

Complexity of Arithmetic in Warded Datalog+-

Lucas Berent, Markus Nissl, Emanuel Sallinger

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1609.02584 2017-05-31 cs.AI 70%

Towards Better Response Times and Higher-Quality Queries in Interactive Knowledge Base Debugging

Patrick Rodler

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25936 2026-08-27 cs.LG cs.AI cs.CL 新提交 67%

One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation

一种症状,三个杠杆:对在线策略自蒸馏的批判性综述

Justin Robert, Raheel Qader

机构 * OVHai LLM(OVHai大模型)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本综述针对在线策略自蒸馏(OPSD)存在的推理路径崩溃问题,从信号加权、特权信息性质、指导衰减三个杠杆展开分析,以数学推理为范围,提供统一术语并区分已确定与争议内容。

Comments 30 pages, 4 figures. Survey / critical review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24949 2026-08-27 cs.LG cs.AI cs.CL 新提交 67%

Demystifying Reinforcement Learning Post-Training of Language Models

揭秘语言模型的强化学习后训练

Donovan Clay, Saket Gollapudi, Sankar Harilal, Min Jang, Jacob Morrison, Sewoong Oh, Natasha Jaques

机构 * University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究拆解语言模型的RL后训练算法,探究各因素对其结果的影响,为NLP领域人员提供RL后训练的入门指南。

Comments Link to website: https://minjang10.github.io/demystifying-rl-finetuning-web Link to code: https://github.com/sankarh-1/demystifying-rl-finetuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23566 2026-08-26 cs.LG cs.AI cs.CL 版本更新 67%

Best Practice Critic Optimization

如何稳定且高效地训练评价模型

Penghui Qi, Xiangxin Zhou, Wee Sun Lee

机构 * National University of Singapore(新加坡国立大学) Tencent Hunyuan(腾讯混元)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10694 2026-08-13 cs.LG cs.AI cs.CL cs.NE 版本更新 67%

Optimize Cheap, Deploy Strong: Cost-Aware Cross-Tier Transfer for Evolutionary Optimization

优化低成本部署强模型:面向进化优化的成本感知跨层迁移

Tal Oved, Roi Pony, Oshri Naparstek, Udi barzelay

机构 * IBM Research(IBM研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出成本感知跨层迁移方法,解耦LLM角色,在低成本层级完成大部分搜索,跨层部署提示词,在多任务多模型上实现成本大幅降低且性能不劣于同层级优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04718 2026-08-13 cs.LG cs.AI cs.CL 版本更新 67%

Superposition Without Interference? Towards Isolated Interventions via Almost Orthogonal Features in Language Models

通过语言模型中几乎正交的特征实现孤立干预

Moritz Miller, Florent Draye, Bernhard Schölkopf

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究基于机械可解释性前提,针对语言模型特征纠缠问题,受“独立因果机制”启发,提出将内部特征约束为几乎正交,通过形式化问题、界定干扰传播并关联正则化,实现对数学推理概念更孤立的干预且保留模型性能。

Comments Published as a conference paper at the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09924 2026-08-12 cs.CL cs.AI cs.LG 版本更新 67%

LLMs Encode Their Failures: Predicting Success from Pre-Generation Activations

LLMs编码其失败:从预生成激活中预测成功

William Lugoloobi, Thomas Foster, William Bankes, Chris Russell

机构 * Oxford Internet Institute, University of Oxford(牛津大学牛津互联网研究所) FLAIR, University of Oxford(牛津大学FLAIR) Department of Computer Science, University College London(伦敦大学学院计算机科学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过预生成激活预测LLM在数学和编程任务中的成功率,发现模型内部表示能有效指导更高效的推理,且在MATH任务中通过模型池路由可提升性能并降低70%的推理成本。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09805 2026-08-11 cs.LG cs.AI cs.CL 新提交 67%

Parameter Exploration for RLVR via Variational Learning

基于变分学习的RLVR参数探索

Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych

机构 * INSAIT, Sofia University “St. Kliment Ohridski”(INSAIT,圣克莱门特奥赫里德斯基索非亚大学) National Research Center for Applied Cybersecurity ATHENE(ATHENE国家应用网络安全研究中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文针对LLM强化学习的探索问题,提出参数空间探索思路,引入3PO方法,在OLMo-3-1025-7B等模型的数学推理等任务上,以相近计算成本相比GRPO提升性能,减少训练中的异常分组与轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07528 2026-08-11 cs.AI cs.CL cs.LG 新提交 67%

The Knowing-Saying Gap: When Probes See Errors that Confidence Misses

知-言差距:当探测模型发现错误而置信度未察觉时

Jyotin Goel, Ipshita Bandyopadhyay, Justin Shenk

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究发现线性探测模型能精准检测语言模型的上下文破坏,但无法可靠预测最终答案正确性,推翻了相关假设,表明基于探测模型的监控需结合模型与错误类型的路由策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01952 2026-08-11 cs.CL cs.AI cs.LG 版本更新 67%

WebChoreArena: Evaluating Web Browsing Agents on Realistic Tedious Web Tasks

WebChoreArena:在现实繁琐网页任务上评估网页浏览智能体

Atsuyuki Miyai, Zaiying Zhao, Kazuki Egashira, Atsuki Sato, Tatsumi Sunada, Shota Onohara, Hiromasa Yamanishi, Mashiro Toyooka, Kunato Nishina, Ryoma Maeda, Kiyoharu Aizawa, Toshihiko Yamasaki

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出WebChoreArena,作为WebArena的扩展,包含532个耗时300多小时开发的繁琐网页任务,从大规模记忆、计算、长期记忆三维度评估网页浏览智能体,实验显示其能清晰衡量LLM进展且难度高于WebArena。

Comments COLM2026. Project Page: https://webchorearena.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03895 2026-08-07 cs.LG cs.AI cs.CL 版本更新 67%

All-Quadrant Bounded Clipping GRPO: Closing the Unbounded Blind Spot for Stable and Generalizable Training

自适应边界裁剪GRPO:确保有界比率以实现稳定且可推广的训练

Chi Liu, Xin Chen

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ABC-GRPO通过自适应边界裁剪提升GRPO的灵活性和泛化能力,实现更稳定和可推广的训练效果。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02087 2026-08-06 cs.AI cs.CL cs.LG 版本更新 67%

Instruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned Policy

基于非对称强化学习与自蒸馏的指令条件探索

Jim Dilkes, Vahid Yazdanpanah, Sebastian Stein

机构 * University of Southampton(南安普顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对LLM强化学习中的探索挑战,提出指令条件探索(ICE)方法,结合非对称RL/SD训练目标,使Qwen3-1.7B数学推理性能提升5.0%且长上下文下仍有效。

Comments Submitted to ACL Rolling Review (ARR) May 2026 cycle. OpenReview submission record at https://openreview.net/forum?id=PV945lekMa

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02139 2026-08-05 cs.CL cs.AI cs.LG 版本更新 67%

Self-Improving Large Language Models via Progressive Experience Evolution

基于渐进式经验演化的自我改进大语言模型

Shijie Ren, Xiting Wang, Meng Li, Yujie Guo, Yunhang Yao, Ziheng Peng, Xunlong Wang, Yuetan Chen, Haoyang Zhou, Yunlong Liang, Fandong Meng

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出统一后训练框架SPEE,通过显式经验演化与隐式策略优化结合,在五种数学推理基准上提升了大语言模型的自我改进能力,优于现有基线方法。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏