arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3252 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3252 篇

2504.13187 2025-04-21 cs.CL 57%

Benchmarking Large Language Models for Calculus Problem-Solving: A Comparative Analysis

In Hak Moon

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04918 2025-04-08 cs.AI 57%

Constitution or Collapse? Exploring Constitutional AI with Llama 3-8B

Xue Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

Comments 6 pages, 2 figures. Conducted as part of research on alignment techniques for language models

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02521 2025-04-04 cs.CL 57%

UNDO: Understanding Distillation as Optimization

Kushal Jain, Piyushi Goyal, Kumar Shridhar

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22230 2025-04-03 cs.LG 57%

Exploring Data Scaling Trends and Effects in Reinforcement Learning from Human Feedback

Wei Shen, Guanlin Liu, Zheng Wu, Ruofei Zhu, Qingping Yang, Chao Xin, Yu Yue, Lin Yan

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23829 2025-04-02 cs.CL 57%

Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains

Yi Su, Dian Yu, Linfeng Song, Juntao Li, Haitao Mi, Zhaopeng Tu, Min Zhang, Dong Yu

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23913 2025-04-01 cs.CL 57%

Entropy-Based Adaptive Weighting for Self-Training

Xiaoxuan Wang, Yihe Deng, Mingyu Derek Ma, Wei Wang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23383 2025-04-01 cs.CL 57%

ToRL: Scaling Tool-Integrated RL

Xuefeng Li, Haoyang Zou, Pengfei Liu

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19612 2025-04-01 cs.LG 57%

RL-finetuning LLMs from on- and off-policy data with a single algorithm

Yunhao Tang, Taco Cohen, David W. Zhang, Michal Valko, Rémi Munos

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17703 2025-04-01 cs.CL 57%

Critique Fine-Tuning: Learning to Critique is More Effective than Learning to Imitate

Yubo Wang, Xiang Yue, Wenhu Chen

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12576 2025-03-18 cs.CL 57%

RaSA: Rank-Sharing Low-Rank Adaptation

Zhiwei He, Zhaopeng Tu, Xing Wang, Xingyu Chen, Zhijie Wang, Jiahao Xu, Tian Liang, Wenxiang Jiao, Zhuosheng Zhang, Rui Wang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09620 2025-03-18 math.OC cs.AI 57%

Exploiting Edited Large Language Models as General Scientific Optimizers

Qitan Lv, Tianyu Liu, Hong Wang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07244 2025-03-13 cs.CV cs.CL 57%

Can Vision-Language Models Evaluate Handwritten Math?

Oikantik Nath, Hanani Bathina, Mohammed Safi Ur Rahman Khan, Mitesh M. Khapra

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02012 2025-03-07 cs.AI cs.RO cs.SE 57%

Pretrained Embeddings as a Behavior Specification Mechanism

Parv Kapoor, Abigail Hammer, Ashish Kapoor, Karen Leung, Eunsuk Kang

专题命中 数学推理 :planning(abstract);分类 cs.AI

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02463 2025-03-05 cs.CL 57%

It Helps to Take a Second Opinion: Teaching Smaller LLMs to Deliberate Mutually via Selective Rationale Optimisation

Sohan Patnaik, Milan Aggarwal, Sumit Bhatia, Balaji Krishnamurthy

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments Accepted at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08435 2025-03-04 cs.AI 57%

Automated Design of Agentic Systems

Shengran Hu, Cong Lu, Jeff Clune

专题命中 数学推理 :chain-of-thought(abstract);分类 cs.AI

Comments Website: https://shengranhu.com/ADAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19981 2025-02-28 cs.CL 57%

The Lookahead Limitation: Why Multi-Operand Addition is Hard for LLMs

Tanja Baeumel, Josef van Genabith, Simon Ostermann

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14874 2025-02-28 math.HO cs.AI 57%

Is Mathematics Obsolete?

Jeremy Avigad

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14804 2025-02-27 cs.CL 57%

Can LLMs Solve longer Math Word Problems Better?

Xin Xu, Tong Xiao, Zitong Chao, Zhenya Huang, Can Yang, Yang Wang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments Accepted to ICLR 2025

Journal ref International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04347 2025-02-27 cs.CL 57%

World Models for Math Story Problems

Andreas Opedal, Niklas Stoehr, Abulhair Saparov, Mrinmaya Sachan

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments ACL Findings 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14340 2025-02-21 cs.CL 57%

Earlier Tokens Contribute More: Learning Direct Preference Optimization From Temporal Decay Perspective

Ruichen Shao, Bei Li, Gangao Liu, Yang Chen, Xiang Zhou, Jingang Wang, Xunliang Cai, Peng Li

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08130 2025-02-21 cs.CL 57%

Selective Self-to-Supervised Fine-Tuning for Generalization in Large Language Models

Sonam Gupta, Yatin Nandwani, Asaf Yehudai, Dinesh Khandelwal, Dinesh Raghu, Sachindra Joshi

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments 10 pages, Accepted to NAACL Findings 2025. arXiv admin note: text overlap with arXiv:2409.04787

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12589 2025-02-19 cs.AI 57%

RM-PoT: Reformulating Mathematical Problems and Solving via Program of Thoughts

Yu Zhang, Shujun Peng, Nengwu Wu, Xinhan Lin, Yang Hu, Jie Tang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11932 2025-02-18 cs.CL 57%

On Representational Dissociation of Language and Arithmetic in Large Language Models

Riku Kisako, Tatsuki Kuribayashi, Ryohei Sasano

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16756 2025-02-18 cs.CL 57%

How Well Do LLMs Handle Cantonese? Benchmarking Cantonese Capabilities of Large Language Models

Jiyue Jiang, Pengan Chen, Liheng Chen, Sheng Wang, Qinghang Bao, Lingpeng Kong, Yu Li, Chuan Wu

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments Accepted by NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07555 2025-02-13 cs.CL 57%

O1 Embedder: Let Retrievers Think Before Action

Ruiran Yan, Zheng Liu, Defu Lian

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08037 2025-02-13 cs.CL 57%

Franken-Adapter: Cross-Lingual Adaptation of LLMs by Embedding Surgery

Fan Jiang, Honglin Yu, Grace Chung, Trevor Cohn

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11107 2025-02-12 cs.CL 57%

Exploring Safety-Utility Trade-Offs in Personalized Language Models

Anvesh Rao Vijjini, Somnath Basu Roy Chowdhury, Snigdha Chaturvedi

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06703 2025-02-11 cs.CL 57%

Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling

Runze Liu, Junqi Gao, Jian Zhao, Kaiyan Zhang, Xiu Li, Biqing Qi, Wanli Ouyang, Bowen Zhou

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05867 2025-02-11 cs.CL 57%

Self-Training Large Language Models for Tool-Use Without Demonstrations

Ne Luo, Aryo Pradipta Gema, Xuanli He, Emile van Krieken, Pietro Lesci, Pasquale Minervini

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14723 2025-02-11 cs.CL 57%

Insights into Alignment: Evaluating DPO and its Variants Across Multiple Tasks

Amir Saeidi, Shivanshu Verma, Md Nayem Uddin, Chitta Baral

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏