arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3240 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3240 篇

2410.18574 2024-10-25 cs.AI 79%

SIKeD: Self-guided Iterative Knowledge Distillation for mathematical reasoning

Shivam Adarsh, Kumar Shridhar, Caglar Gulcehre, Nicholas Monath, Mrinmaya Sachan

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08733 2024-10-10 cs.CL 79%

Is Your Model Really A Good Math Reasoner? Evaluating Mathematical Reasoning with Checklist

Zihao Zhou, Shudong Liu, Maizhen Ning, Wei Liu, Jindong Wang, Derek F. Wong, Xiaowei Huang, Qiufeng Wang, Kaizhu Huang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

Comments 43 pages,Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17294 2024-10-10 cs.CL 79%

Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models

Wenhao Shi, Zhiqiang Hu, Yi Bin, Junhua Liu, Yang Yang, See-Kiong Ng, Lidong Bing, Roy Ka-Wei Lee

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

Comments Accepted at Findings of EMNLP2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04698 2024-10-08 cs.CL 79%

MathHay: An Automated Benchmark for Long-Context Mathematical Reasoning in LLMs

Lei Wang, Shan Dong, Yuhui Xu, Hanze Dong, Yalu Wang, Amrita Saha, Ee-Peng Lim, Caiming Xiong, Doyen Sahoo

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

Comments Work-in-Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17904 2024-09-27 cs.AI 79%

Learning to Love Edge Cases in Formative Math Assessment: Using the AMMORE Dataset and Chain-of-Thought Prompting to Improve Grading Accuracy

Owen Henkel, Hannah Horne-Robinson, Maria Dyshel, Nabil Ch, Baptiste Moreau-Pernet, Ralph Abood

专题命中 数学推理 :chain-of-thought(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08640 2024-09-26 cs.CL 79%

Math-PUMA: Progressive Upward Multimodal Alignment to Enhance Mathematical Reasoning

Wenwen Zhuang, Xin Huang, Xiantao Zhang, Jin Zeng

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00157 2024-09-18 cs.CL 79%

Large Language Models for Mathematical Reasoning: Progresses and Challenges

Janice Ahn, Rishu Verma, Renze Lou, Di Liu, Rui Zhang, Wenpeng Yin

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

Comments EACL 2024 Student Research Workshop, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15565 2024-08-29 cs.CL 79%

SIaM: Self-Improving Code-Assisted Mathematical Reasoning of Large Language Models

Dian Yu, Baolin Peng, Ye Tian, Linfeng Song, Haitao Mi, Dong Yu

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08210 2024-08-16 cs.LG 79%

Does Reasoning Emerge? Examining the Probabilities of Causation in Large Language Models

Javier González, Aditya V. Nori

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07172 2024-07-23 cs.CL cs.PL 79%

VerityMath: Advancing Mathematical Reasoning by Self-Verification Through Unit Consistency

Vernon Toh Yan Han, Ratish Puduppully, Nancy F. Chen

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

Comments AI4MATH Workshop @ ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19444 2024-05-31 cs.AI 79%

MathChat: Benchmarking Mathematical Reasoning and Instruction Following in Multi-Turn Interactions

Zhenwen Liang, Dian Yu, Wenhao Yu, Wenlin Yao, Zhihan Zhang, Xiangliang Zhang, Dong Yu

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14604 2024-04-29 cs.CL 79%

Describe-then-Reason: Improving Multimodal Mathematical Reasoning through Visual Comprehension Training

Mengzhao Jia, Zhihan Zhang, Wenhao Yu, Fangkai Jiao, Meng Jiang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03864 2024-03-14 cs.CV cs.AI 79%

Are Language Models Puzzle Prodigies? Algorithmic Puzzles Unveil Serious Challenges in Multimodal Reasoning

Deepanway Ghosal, Vernon Toh Yan Han, Chia Yew Ken, Soujanya Poria

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04892 2024-01-30 cs.CL 79%

Bias Runs Deep: Implicit Reasoning Biases in Persona-Assigned LLMs

Shashank Gupta, Vaishnavi Shrivastava, Ameet Deshpande, Ashwin Kalyan, Peter Clark, Ashish Sabharwal, Tushar Khot

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

Comments Project page: https://allenai.github.io/persona-bias. Paper to appear at ICLR 2024. Added results for other LLMs in v2 (similar findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05113 2023-11-10 cs.CL 79%

Conic10K: A Challenging Math Problem Understanding and Reasoning Dataset

Haoyi Wu, Wenyang Hui, Yezeng Chen, Weiqi Wu, Kewei Tu, Yi Zhou

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

Comments Accepted to EMNLP2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13160 2023-10-11 cs.CL 79%

Can ChatGPT Defend its Belief in Truth? Evaluating LLM Reasoning via Debate

Boshi Wang, Xiang Yue, Huan Sun

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

Comments EMNLP-23 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04039 2023-10-09 cs.CL 79%

Analysis of the Reasoning with Redundant Information Provided Ability of Large Language Models

Wenbei Xie

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02896 2023-10-05 math.HO cs.AI 79%

Notes on a Path to AI Assistance in Mathematical Reasoning

Alex Kontorovich

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01825 2023-09-14 cs.CL 79%

Scaling Relationship on Learning Mathematical Reasoning with Large Language Models

Zheng Yuan, Hongyi Yuan, Chengpeng Li, Guanting Dong, Keming Lu, Chuanqi Tan, Chang Zhou, Jingren Zhou

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

Comments Working in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.15864 2023-06-21 cs.AI 79%

Peano: Learning Formal Mathematical Reasoning

Gabriel Poesia, Noah D. Goodman

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.08671 2022-11-17 cs.AI 79%

LEMMA: Bootstrapping High-Level Mathematical Reasoning with Learned Symbolic Abstractions

Zhening Li, Gabriel Poesia, Omar Costilla-Reyes, Noah Goodman, Armando Solar-Lezama

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

Comments 10 pages, 2 figures; to appear in 2nd MATH-AI Workshop at NeurIPS'22

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.12755 2022-03-22 cs.AI 79%

Abstraction, Reasoning and Deep Learning: A Study of the "Look and Say" Sequence

Wlodek W. Zadrozny

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

Comments 12 pages; 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.14474 2021-01-15 cs.AI 79%

Paraconsistent Foundations for Probabilistic Reasoning, Programming and Concept Formation

Ben Goertzel

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.04487 2020-04-10 cs.CL 79%

Injecting Numerical Reasoning Skills into Language Models

Mor Geva, Ankit Gupta, Jonathan Berant

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

Comments ACL 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.04760 2018-11-13 cs.AI quant-ph 79%

Quantum Reasoning using Lie Algebra for Everyday Life (and AI perhaps...)

Steven Gratton

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1502.05838 2015-02-23 cs.AI cs.LO 79%

Automated Reasoning for Robot Ethics

Ulrich Furbach, Claudia Schon, Frieder Stolzenburg

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

Comments arXiv admin note: substantial text overlap with arXiv:1411.4823

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10474 2026-07-14 cs.LG cs.AI cs.CE 新提交 79%

Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards

具有可验证物理的强化学习:具有连续奖励的训练后语言模型

Pengfei Cai, Utkarsh Utkarsh, Alan Edelman, Christopher Vincent Rackauckas, Rafael Gomez-Bombarelli

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究针对偏微分方程求解器代码生成,引入RLVP强化学习训练后框架,通过混合验证器解决可验证性问题,在多PDE族训练单个策略,优于基线且有零样本改进转移,训练后小LLM表现良好,策略有组合性证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05106 2026-06-04 cs.CL cs.AI cs.CY 79%

Arithmetic Pedagogy for Language Models

语言模型的算术教学法

Andhika Bernard Lumbantobing, Hokky Situngkir

机构 * Bandung Fe Institute & Adjunct Science Fellow in InaAI(巴旦格Fe研究所及InaAI兼职科学研究员) AI Research Center IT Del & Bandung Fe Institute(IT Del人工智能研究中心及巴旦格Fe研究所)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 借鉴人类数学教学法,通过将GASING方法操作化为链式思维监督训练小规模GPT-2模型,使其在算术推理上达到高准确率并展现出联想式心算能力。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04465 2026-06-04 cs.CL cs.AI 79%

SePO: Self-Evolving Prompt Agent for System Prompt Optimization

SePO: 用于系统提示优化的自我进化提示智能体

Wangcheng Tao, Han Wu, Weng-Fai Wong

机构 * National University of Singapore(新加坡国立大学) City University of Hong Kong(香港城市大学)

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出SePO方法,通过自我指涉设计让提示智能体同时优化任务智能体和自身的系统提示,采用两阶段进化训练,在多个基准上平均准确率提升4.49%。

Comments 26 pages. Code: https://github.com/taowangcheng/SePO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00915 2026-05-25 cs.LG cs.AI 79%

Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers

在不完美验证器下基于可验证但含噪声奖励的强化学习

Xin-Qiang Cai, Wei Wang, Feng Liu, Tongliang Liu, Gang Niu, Masashi Sugiyama

机构 * RIKEN AIP(日本理化学研究所AIP) The University of Tokyo(东京大学) The University of Melbourne(墨尔本大学) The University of Sydney(悉尼大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 针对不完美验证器引入的假阴性和假阳性噪声,提出后向校正(无偏奖励)和前向校正(梯度方向对齐)两种轻量级方法,在分组相对策略优化中提升数学推理性能,并设计上诉机制在线估计假阴性率。

详情

展开后加载摘要…

URL PDF HTML 收藏