arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3240 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3240 篇

2601.20861 2026-01-29 cs.LG cs.AI cs.CL 67%

Evolutionary Strategies lead to Catastrophic Forgetting in LLMs

进化策略导致大语言模型中的灾难性遗忘

Immanuel Abdi, Akshat Gupta, Micah Mok, Alexander Lu, Nicholas Lee, Gopala Anumanchipalli

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 进化策略在大语言模型训练中导致灾难性遗忘,尽管性能接近GRPO,但持续学习能力受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19611 2026-01-28 cs.LG cs.AI cs.CL 67%

Explicit Multi-head Attention for Inter-head Interaction in Large Language Models

显式多头注意力机制用于大语言模型中头间的交互

Runyu Peng, Yunhua Zhou, Demin Song, Kai Lv, Bo Wang, Qipeng Guo, Xipeng Qiu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出显式多头注意力机制,通过显式建模头间交互提升注意力性能,实现更高效的参数利用和内存压缩,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16912 2026-01-27 cs.LG cs.AI cs.CL 67%

Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward

探索与利用:通过截断、熵和虚假奖励重新思考RLVR

Peter Chen, Xiaopeng Li, Ziniu Li, Wotao Yin, Xi Chen, Tianyi Lin

机构 * Columbia(哥伦比亚大学) CUHK SZ(香港大学) DAMO, Alibaba US(阿里云实验室) NYU Stern(纽约大学 Stern 学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过截断、熵和虚假奖励机制,重新审视RLVR框架,揭示了探索与利用权衡对大语言模型推理能力提升的影响。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25204 2026-01-27 cs.LG cs.AI cs.CL 67%

Spectral Logit Sculpting: Adaptive Low-Rank Logit Transformation for Controlled Text Generation

谱logit雕刻:一种自适应低秩logit变换用于受控文本生成

Jin Li, Zhebo Wang, Tianliang Lu, Mohan Li, Wenpeng Xing, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江学院) Hangzhou Dianzi University(杭州电子科技大学) People’s Public Security University of China(中国人民公安大学) Guangzhou University(广州大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SLS通过自适应低秩logit变换优化文本生成,提升输出分布的尖锐度并保持上下文一致性。

Comments Accepted by IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14566 2026-01-22 cs.HC 67%

SCSimulator: An Exploratory Visual Analytics Framework for Partner Selection in Supply Chains through LLM-driven Multi-Agent Simulation

SCSimulator: 一种基于LLM驱动多智能体模拟的供应链伙伴选择探索性可视化分析框架

Shenghan Gao, Junye Wang, Junjie Xiong, Yun Jiang, Yun Fang, Qifan Hu, Baolong Liu, Quan Li

专题命中 数学推理 :reasoning(abstract);CoT(abstract)

AI总结 SCSimulator通过LLM驱动的多智能体模拟与人机协作,探索供应链伙伴选择的动态博弈,提供透明的决策解释和可交互的分析工具。

Comments ACM IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14175 2026-01-21 cs.LG cs.AI cs.CL hep-th 67%

A model of errors in transformers

Transformer 中的错误模型

Suvrat Raju, Praneeth Netrapalli

机构 * International Centre for Theoretical Sciences, Tata Institute of Fundamental Research, Bengaluru, India(理论科学国际研究中心,印度塔塔基础研究研究所,班加罗尔) Google Deepmind, Bengaluru, India(谷歌DeepMind,班加罗尔)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种Transformer错误模型,通过双参数关系解释任务复杂度与准确性的关系,并展示了如何通过提示减少错误率。

Comments 8+17pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04419 2026-01-21 cs.LG cs.AI cs.CL 67%

Towards a Unified View of Large Language Model Post-Training

迈向大规模语言模型后训练的统一视角

Xingtai Lv, Yuxin Zuo, Youbang Sun, Hongyi Liu, Yuntian Wei, Zhekai Chen, Xuekai Zhu, Kaiyan Zhang, Bingning Wang, Ning Ding, Bowen Zhou

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) WeChat AI Code(微信AI代码)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出混合后训练算法,通过统一的优化过程整合在线与离线数据,实现稳定探索与有效利用演示,提升大规模语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10349 2026-01-16 cs.LG cs.AI cs.CL cs.GT 67%

SuS: Strategy-aware Surprise for Intrinsic Exploration

SuS:基于策略的惊喜用于内在探索

Mark Kashirskiy, Ilya Makarov

机构 * Higher School of Economics(俄罗斯高等经济学院) AI Talent Hub(人工智能人才中心) ITMO University(ITMO大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SuS通过结合策略稳定性与策略惊喜,提升强化学习中探索的准确性和多样性,实现显著性能提升。

Comments 8 pages, 7 figures, 3 tables. Code available at https://github.com/mariklolik/sus

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09706 2026-01-15 cs.CL cs.AI cs.LG 67%

Value-Aware Numerical Representations for Transformer Language Models

具有价值意识的数值表示用于Transformer语言模型

Andreea Dutulescu, Stefan Ruseti, Mihai Dascalu

机构 * National University of Science and Technology(科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种价值意识的数值表示方法,通过在Transformer语言模型输入中加入前缀标记以显式编码数值,从而提升模型在算术任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09398 2026-01-15 cs.CL cs.AI cs.LG 67%

Ability Transfer and Recovery via Modularized Parameters Localization

通过模块化参数定位实现能力迁移与恢复

Songyao Jin, Kun Zhou, Wenqi Li, Peng Wang, Biwei Huang

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ACT通过激活差异局部化能力相关通道,实现能力迁移与恢复,提升多语言数学和科学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06911 2026-01-13 cs.CL cs.AI cs.LG 67%

Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language Models

分布清晰度:大型语言模型中RL友好性的隐藏驱动因素

Shaoning Sun, Mingzhu Cai, Huang He, Bingjin Chen, Siqi Bao, Yujiu Yang, Hua Wu, Haifeng Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Baidu Inc(百度公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示了大型语言模型中RL友好性的隐藏驱动因素——分布清晰度,通过量化Silhouette系数并提出Silhouette-aware Reweighting策略,提升了模型在数学基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14973 2025-12-30 cs.CL cs.AI cs.LG 67%

Attention Is All You Need for KV Cache in Diffusion LLMs

注意力是扩散大语言模型中KV缓存的所有需求

Quan Nguyen-Tri, Mukul Ranjan, Zhiqiang Shen

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Elastic-Cache方法,通过适应性缓存更新提升扩散LLM的解码效率和生成质量。

Comments Code at: https://github.com/VILA-Lab/Elastic-Cache

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18148 2025-12-18 cs.CL cs.AI cs.LG 67%

Hidden in the Haystack: Smaller Needles are More Difficult for LLMs to Find

haystack中隐藏的针:更小的针对LLM来说更难找到

Owen Bianchi, Mathew J. Koretsky, Maya Willey, Chelsea X. Alvarado, Tanay Nayak, Adi Asija, Nicole Kuznetsov, Mike A. Nalls, Faraz Faghri, Daniel Khashabi

机构 * Center for Alzheimer’s Disease and Related Dementias, NIA, NIH(阿尔茨海默病及相关痴呆症研究中心,国家老龄化研究所,国家卫生研究院) DataTecnica LLC(DataTecnica公司) Johns Hopkins University(约翰霍普金斯大学) Laboratory of Neurogenetics, NIA, NIH(神经遗传学实验室,国家老龄化研究所,国家卫生研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了黄金上下文大小对LLM长上下文问答性能的影响,发现较短的黄金上下文会显著降低模型性能,揭示了上下文长度对模型表现的关键作用。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07506 2025-12-04 cs.DC cs.AI cs.CL cs.LG cs.SE 67%

Astra: A Multi-Agent System for GPU Kernel Performance Optimization

Astra:一种用于GPU内核性能优化的多智能体系统

Anjiang Wei, Tianran Sun, Yogesh Seenichamy, Hang Song, Anne Ouyang, Azalia Mirhoseini, Ke Wang, Alex Aiken

机构 * Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学)

专题命中 数学推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Astra是首个基于LLM的多智能体系统,用于优化GPU内核性能,通过协作生成高效内核并实现显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02472 2025-12-03 cs.AI cs.CL cs.LG 67%

Guided Self-Evolving LLMs with Minimal Human Supervision

受最小人类监督引导的自演化大语言模型

Wenhao Yu, Zhenwen Liang, Chengsong Huang, Kishan Panaganti, Tianqing Fang, Haitao Mi, Dong Yu

机构 * Tencent AI Lab in Seattle(西雅图腾讯AI实验室) Washington University in St. Louis(斯托克维尔华盛顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 R-Few通过引入轻量级人类监督,实现稳定可控的自演化大语言模型,提升数学推理性能并减少对大量人类数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20347 2025-12-02 cs.LG cs.AI cs.CL 67%

Soft Adaptive Policy Optimization

软适应策略优化

Chang Gao, Chujie Zheng, Xiong-Hui Chen, Kai Dang, Shixuan Liu, Bowen Yu, An Yang, Shuai Bai, Jingren Zhou, Junyang Lin

机构 * Qwen Team, Alibaba Inc(阿里巴巴公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAPO通过软门替代硬剪裁,提升大语言模型强化学习的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13612 2025-11-18 cs.LG cs.AI cs.CL 67%

P1: Mastering Physics Olympiads with Reinforcement Learning

Jiacheng Chen, Qianjia Cheng, Fangchen Yu, Haiyuan Wan, Yuchen Zhang, Shenghe Zheng, Junchi Yao, Qingyang Zhang, Haonan He, Yun Luo, Yufeng Zhao, Futing Wang, Li Sheng, Chengxing Xie, Yuxin Zuo, Yizhuo Li, Wenxauan Zeng, Yulun Wu, Rui Huang, Dongzhan Zhou, Kai Chen, Yu Qiao, Lei Bai, Yu Cheng, Ning Ding, Bowen Zhou, Peng Ye, Ganqu Cui

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11225 2025-11-18 cs.CL cs.AI cs.LG 67%

HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization

Chengyu Huang, Zhengxin Zhang, Claire Cardie

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10628 2025-11-17 cs.CL cs.AI cs.LG 67%

Instella: Fully Open Language Models with Stellar Performance

Jiang Liu, Jialian Wu, Xiaodong Yu, Yusheng Su, Prakamya Mishra, Gowtham Ramesh, Sudhanshu Ranjan, Chaitanya Manem, Ximeng Sun, Ze Wang, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

机构 * AMD

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12171 2025-10-27 cs.LG cs.AI cs.CL 67%

GoRA: Gradient-driven Adaptive Low Rank Adaptation

Haonan He, Peng Ye, Yuchen Ren, Yuan Yuan, Luyang Zhou, Shucun Ju, Lei Chen

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Intelligent Machines, HFIPS, Chinese Academy of Sciences(中国科学院智能机械研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) University of Sydney(悉尼大学) Anhui Disaster Warning & Agrometeorological Information Center(安徽省灾害预警与农业气象信息中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08396 2025-10-24 cs.LG cs.AI cs.CL 67%

FlyLoRA: Boosting Task Decoupling and Parameter Efficiency via Implicit Rank-Wise Mixture-of-Experts

Heming Zou, Yunliang Zang, Wutong Xu, Yao Zhu, Xiangyang Ji

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Academy of Medical Engineering and Translational Medicine, Tianjin University(医学工程与转化医学学院,天津大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19779 2025-10-23 cs.CL cs.AI cs.LG 67%

AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders

Yuezhou Hu, Jiaxin Guo, Xinyu Feng, Tuo Zhao

机构 * University of California, Berkeley(加州大学伯克利分校) Tsinghua University(清华大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16645 2025-10-21 cs.CL cs.AI cs.LG cs.MA 67%

Unleashing Diverse Thinking Modes in LLMs through Multi-Agent Collaboration

Zhixuan He, Yue Feng

机构 * University of Birmingham, United Kingdom(英国伯明翰大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14919 2025-10-17 cs.CL cs.AI cs.LG 67%

Predicting Task Performance with Context-aware Scaling Laws

Kyle Montgomery, David Park, Jianhong Tu, Michael Bendersky, Beliz Gunel, Dawn Song, Chenguang Wang

机构 * UC Santa Cruz(加州大学圣克ruz分校) Washington University in St. Louis(华盛顿大学圣路易斯分校) Databricks(Databricks公司) Google DeepMind(谷歌DeepMind) UC Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14030 2025-10-17 cs.CL cs.AI cs.LG 67%

Think Globally, Group Locally: Evaluating LLMs Using Multi-Lingual Word Grouping Games

César Guerra-Solano, Zhuochun Li, Xiang Lorraine Li

机构 * School of Computing and Information(计算与信息学院) University of Pittsburgh(匹兹堡大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP Main 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08517 2025-10-10 cs.AI cs.CL cs.LG 67%

CaRT: Teaching LLM Agents to Know When They Know Enough

Grace Liu, Yuxiao Qu, Jeff Schneider, Aarti Singh, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18356 2025-10-09 cs.CL cs.AI cs.LG 67%

The Unreasonable Effectiveness of Model Merging for Cross-Lingual Transfer in LLMs

Lucas Bandarkar, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments MRL Workshop at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15436 2025-10-07 cs.LG cs.AI cs.CL cs.DC 67%

Fed-SB: A Silver Bullet for Extreme Communication Efficiency and Performance in (Private) Federated LoRA Fine-Tuning

Raghav Singhal, Kaustubh Ponkshe, Rohit Vartak, Lav R. Varshney, Praneeth Vepakomma

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Duke University(杜克大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Raghav Singhal and Kaustubh Ponkshe contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17746 2025-10-06 cs.LG cs.AI cs.CL 67%

Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains

Anisha Gunjal, Anthony Wang, Elaine Lau, Vaskar Nath, Yunzhong He, Bing Liu, Sean Hendryx

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01624 2025-10-03 cs.LG cs.AI cs.CL 67%

Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead

Feiyang Kang, Michael Kuchnik, Karthik Padthe, Marin Vlastelica, Ruoxi Jia, Carole-Jean Wu, Newsha Ardalani

机构 * FAIR at Meta(Meta 的 FAIR) Meta

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏