arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45417 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3252 篇

2502.13442 2025-05-21 cs.CL cs.AI cs.LG 67%

TreeCut: A Synthetic Unanswerable Math Word Problem Dataset for LLM Hallucination Evaluation

Jialin Ouyang

机构 * Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15823 2025-05-15 cs.LG cs.AI cs.CL cs.FL 67%

InductionBench: LLMs Fail in the Simplest Complexity Class

Wenyue Hua, Tyler Wong, Sun Fei, Liangming Pan, Adam Jardine, William Yang Wang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 25 pages, 10 figures, more details including examples and prompts are added

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00662 2025-05-02 cs.CL cs.AI cs.LG 67%

DeepCritic: Deliberate Critique with Large Language Models

Wenkai Yang, Jingwen Chen, Yankai Lin, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in progress. Data and models are available at https://github.com/RUCBM/DeepCritic

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18252 2025-04-29 cs.LG cs.AI cs.CL 67%

Asynchronous RLHF: Faster and More Efficient Off-Policy RL for Language Models

Michael Noukhovitch, Shengyi Huang, Sophie Xhonneux, Arian Hosseini, Rishabh Agarwal, Aaron Courville

机构 * Mila Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) Allen Institute for AI(人工智能研究院) Google Deepmind(谷歌DeepMind) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments accepted at ICLR 2025, code at https://github.com/mnoukhov/async_rlhf, integrated into the open-instruct library https://github.com/allenai/open-instruct

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11426 2025-04-16 cs.CL cs.AI cs.LG 67%

A Dual-Space Framework for General Knowledge Distillation of Large Language Models

Xue Zhang, Songming Zhang, Yunlong Liang, Fandong Meng, Yufeng Chen, Jinan Xu, Jie Zhou

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 19 pages, 9 figures, 11 tables, under review. Code is available at: https://github.com/songmzhang/DSKDv2. arXiv admin note: text overlap with arXiv:2406.17328

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02807 2025-04-04 cs.CL cs.AI cs.LG 67%

MegaMath: Pushing the Limits of Open Math Corpora

Fan Zhou, Zengzhi Wang, Nikhil Ranjan, Zhoujun Cheng, Liping Tang, Guowei He, Zhengzhong Liu, Eric P. Xing

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 26 pages, 15 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18432 2025-03-25 cs.CL cs.AI cs.LG 67%

Teaching LLMs for Step-Level Automatic Math Correction via Reinforcement Learning

Junsong Li, Jie Zhou, Yutao Yang, Bihao Zhan, Qianjun Pan, Yuyang Ding, Qin Chen, Jiang Bo, Xin Lin, Liang He

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18102 2025-03-25 cs.AI cs.CL cs.LG 67%

AgentRxiv: Towards Collaborative Autonomous Research

Samuel Schmidgall, Michael Moor

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18242 2025-03-25 cs.LG cs.AI cs.CL 67%

LoRA-Pro: Are Low-Rank Adapters Properly Optimized?

Zhengbo Wang, Jian Liang, Ran He, Zilei Wang, Tieniu Tan

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Camera-Ready Version for ICLR 2025; technical corrections to previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13427 2025-03-18 cs.LG cs.AI cs.CL 67%

xLSTM 7B: A Recurrent LLM for Fast and Efficient Inference

Maximilian Beck, Korbinian Pöppel, Phillip Lippe, Richard Kurle, Patrick M. Blies, Günter Klambauer, Sebastian Böck, Sepp Hochreiter

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code available at: https://github.com/NX-AI/xlstm and https://github.com/NX-AI/xlstm-jax

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01743 2025-03-10 cs.CL cs.AI cs.LG 67%

Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs

Microsoft, :, Abdelrahman Abouelenin, Atabak Ashfaq, Adam Atkinson, Hany Awadalla, Nguyen Bach, Jianmin Bao, Alon Benhaim, Martin Cai, Vishrav Chaudhary, Congcong Chen, Dong Chen, Dongdong Chen, Junkun Chen, Weizhu Chen, Yen-Chun Chen, Yi-ling Chen, Qi Dai, Xiyang Dai, Ruchao Fan, Mei Gao, Min Gao, Amit Garg, Abhishek Goswami, Junheng Hao, Amr Hendy, Yuxuan Hu, Xin Jin, Mahmoud Khademi, Dongwoo Kim, Young Jin Kim, Gina Lee, Jinyu Li, Yunsheng Li, Chen Liang, Xihui Lin, Zeqi Lin, Mengchen Liu, Yang Liu, Gilsinia Lopez, Chong Luo, Piyush Madan, Vadim Mazalov, Arindam Mitra, Ali Mousavi, Anh Nguyen, Jing Pan, Daniel Perez-Becker, Jacob Platin, Thomas Portet, Kai Qiu, Bo Ren, Liliang Ren, Sambuddha Roy, Ning Shang, Yelong Shen, Saksham Singhal, Subhojit Som, Xia Song, Tetyana Sych, Praneetha Vaddamanu, Shuohang Wang, Yiming Wang, Zhenghao Wang, Haibin Wu, Haoran Xu, Weijian Xu, Yifan Yang, Ziyi Yang, Donghan Yu, Ishmam Zabir, Jianwen Zhang, Li Lyna Zhang, Yunan Zhang, Xiren Zhou

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11089 2025-02-28 cs.CL cs.AI cs.LG 67%

Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention

Jingyang Yuan, Huazuo Gao, Damai Dai, Junyu Luo, Liang Zhao, Zhengyan Zhang, Zhenda Xie, Y. X. Wei, Lean Wang, Zhiping Xiao, Yuqing Wang, Chong Ruan, Ming Zhang, Wenfeng Liang, Wangding Zeng

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17535 2025-02-26 cs.LG cs.AI cs.CL cs.FL 67%

The Lottery LLM Hypothesis, Rethinking What Abilities Should LLM Compression Preserve?

Zhenheng Tang, Xiang Liu, Qian Wang, Peijie Dong, Bingsheng He, Xiaowen Chu, Bo Li

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04357 2025-02-10 cs.CL cs.AI cs.LG 67%

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs

Hao Sun, Yunyi Shen, Jean-Francois Ton, Mihaela van der Schaar

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00873 2025-02-04 cs.AI cs.CL cs.LG 67%

Language Models Use Trigonometry to Do Addition

Subhash Kantamneni, Max Tegmark

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18096 2025-01-31 cs.CV cs.AI cs.CL cs.LG 67%

LLMs can see and hear without any training

Kumar Ashutosh, Yossi Gandelsman, Xinlei Chen, Ishan Misra, Rohit Girdhar

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code: https://github.com/facebookresearch/MILS

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13187 2025-01-28 cs.NE 67%

Evolutionary Optimization of Model Merging Recipes

Takuya Akiba, Makoto Shing, Yujin Tang, Qi Sun, David Ha

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract)

Comments Authors' submitted version before final edits. Published in Nature Machine Intelligence on January 27, 2025: https://www.nature.com/articles/s42256-024-00975-8

Journal ref Nat Mach Intell (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05336 2025-01-10 cs.CL cs.AI cs.LG 67%

Stream Aligner: Efficient Sentence-Level Alignment via Distribution Induction

Hantao Lou, Jiaming Ji, Kaile Wang, Yaodong Yang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments AAAI Alignment Track 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19820 2024-12-31 cs.CL cs.AI cs.LG 67%

GaLore$+$: Boosting Low-Rank Adaptation for LLMs with Cross-Head Projection

Xutao Liao, Shaohui Li, Yuhui Xu, Zhi Li, Yu Liu, You He

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15283 2024-12-23 cs.CL cs.AI cs.LG 67%

Channel Merging: Preserving Specialization for Merged Experts

Mingyang Zhang, Jing Liu, Ganggui Ding, Xinyi Yu, Linlin Ou, Bohan Zhuang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09003 2024-12-17 cs.CL cs.AI cs.LG 67%

Augmenting Math Word Problems via Iterative Question Composing

Haoxiong Liu, Yifan Zhang, Yifan Luo, Andrew Chi-Chih Yao

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09472 2024-12-11 cs.LG cs.AI cs.CL 67%

Easy-to-Hard Generalization: Scalable Alignment Beyond Human Supervision

Zhiqing Sun, Longhui Yu, Yikang Shen, Weiyang Liu, Yiming Yang, Sean Welleck, Chuang Gan

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15736 2024-12-09 cs.LG cs.AI cs.CL cs.CV 67%

Evaluating Large Vision-and-Language Models on Children's Mathematical Olympiads

Anoop Cherian, Kuan-Chuan Peng, Suhas Lohit, Joanna Matthiesen, Kevin Smith, Joshua B. Tenenbaum

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2024 (Datasets and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00332 2024-11-26 cs.CL cs.AI cs.LG 67%

A Careful Examination of Large Language Model Performance on Grade School Arithmetic

Hugh Zhang, Jeff Da, Dean Lee, Vaughn Robinson, Catherine Wu, Will Song, Tiffany Zhao, Pranav Raja, Charlotte Zhuang, Dylan Slack, Qin Lyu, Sean Hendryx, Russell Kaplan, Michele Lunati, Summer Yue

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 2024 NeurIPS Camera Ready (Datasets and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05134 2024-11-19 cs.AI cs.CL cs.LG 67%

Solving for X and Beyond: Can Large Language Models Solve Complex Math Problems with More-Than-Two Unknowns?

Kuei-Chun Kao, Ruochen Wang, Cho-Jui Hsieh

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref https://aclanthology.org/2024.findings-emnlp.980/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00119 2024-11-05 cs.LG cs.AI cs.CL 67%

3-in-1: 2D Rotary Adaptation for Efficient Finetuning, Efficient Batching and Composability

Baohao Liao, Christof Monz

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to NeurIPS 2024. Code: https://github.com/BaohaoLiao/road

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14808 2024-11-01 cs.CL cs.AI cs.CY cs.HC cs.LG 67%

Implicit Personalization in Language Models: A Systematic Study

Zhijing Jin, Nils Heil, Jiarui Liu, Shehzaad Dhuliawala, Yahang Qi, Bernhard Schölkopf, Rada Mihalcea, Mrinmaya Sachan

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17120 2024-10-30 cs.CL cs.AI cs.LG 67%

MathPile: A Billion-Token-Scale Pretraining Corpus for Math

Zengzhi Wang, Xuefeng Li, Rui Xia, Pengfei Liu

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 43 pages. Accepted by NeurIPS 2024. https://github.com/GAIR-NLP/MathPile/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09041 2024-10-29 cs.CL cs.AI cs.LG 67%

ME-Switch: A Memory-Efficient Expert Switching Framework for Large Language Models

Jing Liu, Ruihao Gong, Mingyang Zhang, Yefei He, Jianfei Cai, Bohan Zhuang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11402 2024-10-24 cs.CL cs.AI cs.CV cs.LG cs.MM 67%

NVLM: Open Frontier-Class Multimodal LLMs

Wenliang Dai, Nayeon Lee, Boxin Wang, Zhuolin Yang, Zihan Liu, Jon Barker, Tuomas Rintamaki, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Fixed the typos. For more information, please visit our project page at: https://research.nvidia.com/labs/adlr/NVLM-1

详情

展开后加载摘要…

URL PDF HTML 收藏