arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3246 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3246 篇

2506.16406 2025-06-23 cs.LG cs.AI 62%

Drag-and-Drop LLMs: Zero-Shot Prompt-to-Weights

Zhiyuan Liang, Dongwen Tang, Yuhao Zhou, Xuanlei Zhao, Mingjia Shi, Wangbo Zhao, Zekai Li, Peihao Wang, Konstantin Schürholt, Damian Borth, Michael M. Bronstein, Yang You, Zhangyang Wang, Kai Wang

机构 * National University of Singapore(新加坡国立大学) UT Austin(德克萨斯大学奥斯汀分校) University of St. Gallen(圣加尔登大学) Oxford University(牛津大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments We propose a method that can generate LoRA parameters in seconds

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22960 2025-06-23 cs.AI cs.LG 62%

Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness

Yongjin Yang, Euiin Yi, Jongwoo Ko, Kimin Lee, Zhijing Jin, Se-Young Yun

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13811 2025-06-18 cs.MA cs.AI cs.CL 62%

Investigating the Potential of Large Language Model-Based Router Multi-Agent Architectures for Foundation Design Automation: A Task Classification and Expert Selection Study

Sompote Youwai, David Phim, Vianne Gayl Murcia, Rianne Clair Onas

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13752 2025-06-17 cs.CL cs.AI 62%

Steering LLM Thinking with Budget Guidance

Junyan Li, Wenshuo Zhao, Yang Zhang, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) Zhejiang University(浙江大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13479 2025-06-17 cs.CL cs.AI 62%

Position: Pause Recycling LoRAs and Prioritize Mechanisms to Uncover Limits and Effectiveness

Mei-Yen Chen, Thi Thu Uyen Hoang, Michael Hahn, M. Saquib Sarfraz

机构 * Saarland University(萨尔兰大学) Mercedes-Benz Tech Innovation(梅赛德斯-奔驰科技创新)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16212 2025-06-17 cs.CL cs.AI 62%

MathFusion: Enhancing Mathematical Problem-solving of LLM through Instruction Fusion

Qizhi Pei, Lijun Wu, Zhuoshi Pan, Yu Li, Honglin Lin, Chenlin Ming, Xin Gao, Conghui He, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程技术研究中心) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10627 2025-06-13 cs.CL cs.AI 62%

NeuralNexus at BEA 2025 Shared Task: Retrieval-Augmented Prompting for Mistake Identification in AI Tutors

Numaan Naeem, Sarfraz Ahmad, Momina Ahsan, Hasan Iqbal

机构 * MBZUAI(穆萨大学人工智能研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 6 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07664 2025-06-12 cs.CL cs.AI 62%

Synthesis by Design: Controlled Data Generation via Structural Guidance

Lei Xu, Sirui Chen, Yuxuan Huang, Chaochao Lu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06395 2025-06-12 cs.CL cs.LG 62%

Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models

Pengyi Li, Matvey Skripkin, Alexander Zubrey, Andrey Kuznetsov, Ivan Oseledets

机构 * AIRI, Skoltech Moscow(AIRI,斯克里普奇莫斯科学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05700 2025-06-09 cs.CL cs.AI 62%

RKEFino1: A Regulation Knowledge-Enhanced Large Language Model

Yan Wang, Yueru He, Ruoyu Xiang, Jeff Zhao

机构 * Yale University(耶鲁大学) Columbia University(哥伦比亚大学) New York University(纽约大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04920 2025-06-06 cs.CL cs.AI 62%

Simulating LLM-to-LLM Tutoring for Multilingual Math Feedback

Junior Cedric Tonga, KV Aditya Srivatsa, Kaushal Kumar Maurya, Fajri Koto, Ekaterina Kochmar

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·泽德人工智能大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Preprint, in submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23585 2025-06-05 cs.LG cs.CL 62%

On-Policy RL with Optimal Reward Baseline

Yaru Hao, Li Dong, Xun Wu, Shaohan Huang, Zewen Chi, Furu Wei

机构 * Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01679 2025-06-05 cs.LG cs.CL 62%

VinePPO: Refining Credit Assignment in RL Training of LLMs

Amirhossein Kazemnejad, Milad Aghajohari, Eva Portelance, Alessandro Sordoni, Siva Reddy, Aaron Courville, Nicolas Le Roux

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Accepted at ICML 2025; 12 pages and 22 pages Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00113 2025-06-03 cs.CL cs.AI 62%

Wait, that's not an option: LLMs Robustness with Incorrect Multiple-Choice Options

Gracjan Góral, Emilia Wiśnios, Piotr Sankowski, Paweł Budzianowski

机构 * University of Warsaw(华沙大学) Institute of Mathematics, Polish Academy of Sciences(波兰科学院数学研究所) MIM Solutions(MIM解决方案) K-Scale Labs(K-Scale实验室) IDEAS NCBR IDEAS Research Institute(IDEAS研究学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted for ACL 2025 Main Conference and NeurIPS 2024 FM-EduAssess Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17439 2025-06-02 cs.LG cs.AI 62%

LEMMA: Learning from Errors for MatheMatical Advancement in LLMs

Zhuoshi Pan, Yu Li, Honglin Lin, Qizhi Pei, Zinan Tang, Wei Wu, Chenlin Ming, H. Vicky Zhao, Conghui He, Lijun Wu

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments ACL'25 Findings, Code is available at https://github.com/pzs19/LEMMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20993 2025-05-28 cs.CL cs.AI 62%

Who Reasons in the Large Language Models?

Jie Shao, Jianxin Wu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(国家新型软件技术实验室,南京大学,中国) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17161 2025-05-27 cs.AI cs.CV cs.LG 62%

SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training

Tianzhe Chu, Yuexiang Zhai, Jihan Yang, Shengbang Tong, Saining Xie, Dale Schuurmans, Quoc V. Le, Sergey Levine, Yi Ma

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Website at https://tianzhechu.com/SFTvsRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11492 2025-05-27 cs.AI cs.CL cs.CV 62%

Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding

Kung-Hsiang Huang, Can Qin, Haoyi Qiu, Philippe Laban, Shafiq Joty, Caiming Xiong, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究院) UCLA(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Code and data are available at https://github.com/SalesforceAIResearch/CogAlign

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05704 2025-05-12 cs.CL cs.AI 62%

Assessing Robustness to Spurious Correlations in Post-Training Language Models

Julia Shuieh, Prasann Singhal, Apaar Shanker, John Heyer, George Pu, Samuel Denton

机构 * Scale AI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments ICLR '25 Workshop on Spurious Correlation and Shortcut Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01485 2025-05-06 cs.AI cs.CL 62%

CHORUS: Zero-shot Hierarchical Retrieval and Orchestration for Generating Linear Programming Code

Tasnim Ahmed, Salimur Choudhury

机构 * School of Computing, Queen’s University, Ontario, Canada(计算学院,皇后大学,安大略省,加拿大)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments This paper has been accepted for presentation at the 19th Learning and Intelligent Optimization Conference (LION 19)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12285 2025-04-28 cs.CL cs.LG 62%

BitNet b1.58 2B4T Technical Report

Shuming Ma, Hongyu Wang, Shaohan Huang, Xingxing Zhang, Ying Hu, Ting Song, Yan Xia, Furu Wei

机构 * Microsoft Research(微软研究院) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12881 2025-04-28 cs.AI cs.CL 62%

MIND: Math Informed syNthetic Dialogues for Pretraining LLMs

Syeda Nahida Akter, Shrimai Prabhumoye, John Kamalu, Sanjeev Satheesh, Eric Nyberg, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 31 pages, 5 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16677 2025-04-24 cs.CL cs.AI 62%

A Post-trainer's Guide to Multilingual Training Data: Uncovering Cross-lingual Transfer Dynamics

Luisa Shimabucoro, Ahmet Ustun, Marzieh Fadaee, Sebastian Ruder

机构 * Cohere For AI University of São Paulo(圣保罗大学) Meta

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01995 2025-04-14 cs.AI cs.LG 62%

Brains vs. Bytes: Evaluating LLM Proficiency in Olympiad Mathematics

Hamed Mahdavi, Alireza Hashemi, Majid Daliri, Pegah Mohammadipour, Alireza Farhadi, Samira Malek, Yekta Yazdanifard, Amir Khasahmadi, Vasant Honavar

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18921 2025-04-08 cs.CL cs.AI cs.LO 62%

From Blind Solvers to Logical Thinkers: Benchmarking LLMs' Logical Integrity on Faulty Mathematical Problems

A M Muntasir Rahman, Junyi Ye, Wei Yao, Sierra S. Liu, Jesse Yu, Jonathan Yu, Wenpeng Yin, Guiling Wang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03048 2025-04-07 cs.LG cs.CL 62%

LLM Library Learning Fails: A LEGO-Prover Case Study

Ian Berlot-Attwell, Frank Rudzicz, Xujie Si

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02827 2025-04-04 cs.LG cs.AI 62%

On Vanishing Variance in Transformer Length Generalization

Ruining Li, Gabrijel Boduljak, Jensen, Zhou

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Project page: https://ruiningli.com/vanishing-variance. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06816 2025-04-01 cs.AI cs.CL 62%

MAQA: Evaluating Uncertainty Quantification in LLMs Regarding Data Uncertainty

Yongjin Yang, Haneul Yoo, Hwaran Lee

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Findings of NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18394 2025-03-25 cs.LG cs.CL 62%

Solving Situation Puzzles with Large Language Model and External Reformulation

Kun Li, Xinwei Chen, Tianyou Song, Chengrui Zhou, Zhuoran Liu, Zhenyan Zhang, Jiangjian Guo, Qing Shan

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12863 2025-03-11 cs.CL cs.AI 62%

Token-Supervised Value Models for Enhancing Mathematical Problem-Solving Capabilities of Large Language Models

Jung Hyun Lee, June Yong Yang, Byeongho Heo, Dongyoon Han, Kyungsu Kim, Eunho Yang, Kang Min Yoo

专题命中 数学推理 :test-time compute(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏