arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45335 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3246 篇

2509.06770 2025-09-16 cs.AI cs.HC 57%

Another Turn, Better Output? A Turn-Wise Analysis of Iterative LLM Prompting

Shashidhar Reddy Javaji, Bhavul Gauri, Zining Zhu

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10396 2025-09-15 cs.LG 57%

Inpainting-Guided Policy Optimization for Diffusion Large Language Models

Siyan Zhao, Mengchen Liu, Jing Huang, Miao Liu, Chenyu Wang, Bo Liu, Yuandong Tian, Guan Pang, Sean Bell, Aditya Grover, Feiyu Chen

机构 * Meta Superintelligence Labs(Meta超智能实验室) Tsinghua University, College of AI(清华大学人工智能学院) MIT(麻省理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

Comments preprint; 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07980 2025-09-15 cs.CL 57%

Parallel-R1: Towards Parallel Thinking via Reinforcement Learning

Tong Zheng, Hongming Zhang, Wenhao Yu, Xiaoyang Wang, Runpeng Dai, Rui Liu, Huiwen Bao, Chengsong Huang, Heng Huang, Dong Yu

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments Project website: https://zhengkid.github.io/Parallel_R1.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09650 2025-09-12 cs.CL 57%

All for One: LLMs Solve Mental Math at the Last Token With Information Transferred From Other Tokens

Siddarth Mamidanna, Daking Rai, Ziyu Yao, Yilun Zhou

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) George Mason University(乔治·马歇尔大学) Datadog AI Research(Datadog人工智能研究)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16531 2025-09-11 cs.LG 57%

HOFT: Householder Orthogonal Fine-tuning

Alejandro Moreno Arcas, Albert Sanchis, Jorge Civera, Alfons Juan

机构 * MLLP group, Valencian Research Institute for Artificial Intelligence(瓦伦西亚人工智能研究 institute 的 MLLP 组) Universitat Politècnica de València, Spain(瓦伦西亚理工大学,西班牙)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22828 2025-09-09 cs.CL 57%

Learning to Reason for Long-Form Story Generation

Alexander Gurung, Mirella Lapata

机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15581 2025-09-09 cs.CL 57%

Error Classification of Large Language Models on Math Word Problems: A Dynamically Adaptive Framework

Yuhong Sun, Zhangyue Yin, Xuanjing Huang, Xipeng Qiu, Hui Zhao

机构 * Software Engineering Institute, East China Normal University(东华师范大学软件工程研究院) School of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai Key Laboratory of Trustworthy Computing, Shanghai, China(上海可信计算关键实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments 28 pages, 10 figures, accepted by Findings of EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21934 2025-09-08 cs.CL 57%

Proof or Bluff? Evaluating LLMs on 2025 USA Math Olympiad

Ivo Petrov, Jasper Dekoninck, Lyuben Baltadzhiev, Maria Drencheva, Kristian Minchev, Mislav Balunović, Nikola Jovanović, Martin Vechev

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12065 2025-09-05 cs.CL cs.FL 57%

Autoformalization in the Wild: Assessing LLMs on Real-World Mathematical Definitions

Lan Zhang, Marco Valentino, Andre Freitas

机构 * Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) Idiap Research Institute(Idiap研究机构) National Biomarker Centre, CRUK Manchester Institute(国家生物标志物中心、CRUK曼彻斯特研究所)

专题命中 数学推理 :self-correction(abstract);分类 cs.CL

Comments EMNLP 2025 Camera-Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18255 2025-09-03 cs.AI 57%

Hermes 4 Technical Report

Ryan Teknium, Roger Jin, Jai Suphavadeeprasit, Dakota Mahan, Jeffrey Quesnelle, Joe Li, Chen Guang, Shannon Sands, Karan Malhotra

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00189 2025-09-03 cs.AI cs.MA 57%

HiVA: Self-organized Hierarchical Variable Agent via Goal-driven Semantic-Topological Evolution

Jinzhou Tang, Jusheng Zhang, Qinhan Lv, Sidi Liu, Jing Yang, Chengpei Tang, Keze Wang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14862 2025-08-29 cs.CL 57%

Bitune: Leveraging Bidirectional Attention to Improve Decoder-Only LLMs

Dawid J. Kopiczko, Tijmen Blankevoort, Yuki M. Asano

机构 * Fundamental AI Lab University of Technology Nuremberg(基础人工智能实验室 汉诺威技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18648 2025-08-28 cs.CL 57%

Thinking Before You Speak: A Proactive Test-time Scaling Approach

Cong Liu, Wenchang Chai, Hejun Wu, Yan Pan, Pengxu Wei, Liang Lin

机构 * Sun Yat-sen University(中山大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05481 2025-08-27 cs.LG 57%

fLSA: Learning Semantic Structures in Document Collections Using Foundation Models

Weijia Xu, Nebojsa Jojic, Nicolas Le Roux

机构 * Microsoft Research Redmond(微软研究院雷德蒙德)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

Comments EMNLP 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15487 2025-08-22 cs.CL 57%

Dream 7B: Diffusion Large Language Models

Jiacheng Ye, Zhihui Xie, Lin Zheng, Jiahui Gao, Zirui Wu, Xin Jiang, Zhenguo Li, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 数学推理 :planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07773 2025-08-21 cs.AI 57%

Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving

Xinji Mai, Haotian Xu, Zhong-Zhi Li, Xing W, Weinong Wang, Jian Hu, Yingying Zhang, Wenqiang Zhang

机构 * Fudan University(复旦大学) Xiaohongshu(小红书) East China Normal University(华东师范大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13214 2025-08-20 cs.CR cs.AI 57%

Too Easily Fooled? Prompt Injection Breaks LLMs on Frustratingly Simple Multiple-Choice Questions

Xuyang Guo, Zekai Huang, Zhao Song, Jiahao Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13023 2025-08-19 cs.AI 57%

G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance

Yongxin Guo, Wenbo Deng, Zhenglin Cheng, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, Guangdong(科学与工程学院,香港中文大学(深圳)) Alibaba Group(阿里巴巴集团) School of Engineering, Westlake University(工程学院,西湖大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12338 2025-08-19 cs.AI 57%

Wisdom of the Crowd: Reinforcement Learning from Coevolutionary Collective Feedback

Wenzhen Yuan, Shengji Tang, Weihao Lin, Jiacheng Ruan, Ganqu Cui, Bo Zhang, Tao Chen, Ting Liu, Yuzhuo Fu, Peng Ye, Lei Bai

机构 * Shanghai AI Lab(上海AI实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08053 2025-08-12 cs.AI 57%

AdaptFlow: Adaptive Workflow Optimization via Meta-Learning

Runchuan Zhu, Bowen Jiang, Lingrui Mei, Fangkai Yang, Lu Wang, Haoxiang Gao, Fengshuo Bai, Pu Zhao, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Microsoft(微软公司) Shanghai Jiaotong University(上海交通大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07805 2025-08-12 cs.CL 57%

Can You Trick the Grader? Adversarial Persuasion of LLM Judges

Yerin Hwang, Dongryeol Lee, Taegwan Kang, Yongil Kim, Kyomin Jung

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24006 2025-08-12 cs.CL math.HO 57%

Large Language Models Don't Make Sense of Word Problems. A Scoping Review from a Mathematics Education Perspective

Anselm R. Strohmaier, Wim Van Dooren, Kathrin Seßler, Brian Greer, Lieven Verschaffel

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments v2: added analyses for GPT-5, also leading to small adjustments in the text, no major new interpretations

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07912 2025-08-11 cs.LG 57%

Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining

Rosie Zhao, Alexandru Meterez, Sham Kakade, Cengiz Pehlevan, Samy Jelassi, Eran Malach

机构 * Harvard University(哈佛大学) Kempner Institute(凯普纳研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04278 2025-08-07 cs.AI 57%

Large Language Model's Multi-Capability Alignment in Biomedical Domain

Wentao Wu, Linqing Chen, Hanmeng Zhong, Weilei Wang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03533 2025-08-06 cs.CL 57%

EmbedGrad: Gradient-Based Prompt Optimization in Embedding Space for Large Language Models

Xiaoming Hou, Jiquan Zhang, Zibin Lin, DaCheng Tao, Shengli Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23407 2025-08-01 cs.CL 57%

Beyond Passive Critical Thinking: Fostering Proactive Questioning to Enhance Human-AI Collaboration

Ante Wang, Yujie Lin, Jingyao Liu, Suhang Wu, Hao Liu, Xinyan Xiao, Jinsong Su

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) Department of Digital Media Technology, Xiamen University, China(厦门大学数字媒体技术系) Baidu Inc., Beijing, China(百度公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21645 2025-07-30 cs.CL 57%

Libra: Assessing and Improving Reward Model by Learning to Think

Meng Zhou, Bei Li, Jiahao Liu, Xiaowen Shi, Yang Bai, Rongxiang Weng, Jingang Wang, Xunliang Cai

机构 * Meituan(美团)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments Work In Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21636 2025-07-30 cs.AI 57%

StaffPro: an LLM Agent for Joint Staffing and Profiling

Alessio Maritan

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20509 2025-07-29 cs.RO cs.AI cs.SY eess.SY 57%

LLMs-guided adaptive compensator: Bringing Adaptivity to Automatic Control Systems with Large Language Models

Zhongchao Zhou, Yuxi Lu, Yaonan Zhu, Yifan Zhao, Bin He, Liang He, Wenwen Yu, Yusuke Iwasawa

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19227 2025-07-28 cs.CL 57%

Jailbreaking Large Language Diffusion Models: Revealing Hidden Safety Flaws in Diffusion-Based Text Generation

Yuanhe Zhang, Fangzhou Xie, Zhenhong Zhou, Zherui Li, Hao Chen, Kun Wang, Yufei Guo

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏