arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-19 至 2026-02-19 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 5 篇

2504.00869 2026-02-19 cs.CL cs.AI 81%

m1: Unleash the Potential of Test-Time Scaling for Medical Reasoning with Large Language Models

m1:通过大语言模型的测试时缩放释放医疗推理的潜力

Xiaoke Huang, Juncheng Wu, Hui Liu, Xianfeng Tang, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克ruz分校) Amazon Research(亚马逊研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出m1方法,通过测试时缩放提升医疗推理能力,发现最佳推理预算和医学知识不足是关键瓶颈。

Comments 17 pages; 7 figures; Data, code, and models: https://github.com/UCSC-VLAA/m1 ; Accepted by ML4H'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15843 2026-02-19 cs.CL cs.AI 73%

The Perplexity Paradox: Why Code Compresses Better Than Math in LLM Prompts

困惑性悖论:为什么代码在LLM提示中比数学压缩得更好

Warren Johnson

机构 * Bona Opera Studios(博纳歌剧工作室)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文揭示代码在LLM提示中比数学压缩更有效的原因,并提出TAAC算法实现更高效的压缩。

Comments 19 pages, 5 figures, 4 tables. Second paper in TAAC research series. Code and data at https://github.com/micoverde/taac-llm-compression

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15194 2026-02-19 cs.LG cs.CL 73%

Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation

无需标签的进化语言模型:多数驱动选择,新颖性促进变异

Yujun Zhou, Zhenwen Liang, Haolin Liu, Wenhao Yu, Kishan Panaganti, Linfeng Song, Dian Yu, Xiangliang Zhang, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Notre Dame(圣母大学) University of Virginia(弗吉尼亚大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

AI总结 EVOL-RL通过结合多数稳定性与新颖性探索,实现无需标签的自我改进语言模型,提升推理能力和领域外泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16554 2026-02-19 cs.LO cs.AI cs.ET quant-ph 57%

MerLean: An Agentic Framework for Autoformalization in Quantum Computation

MerLean:一个用于量子计算自动形式化的代理框架

Yuanjie Ren, Jinzheng Li, Yidi Qi

机构 * Massachusetts Institute of Technology(麻省理工学院) Northeastern University(东北大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 MerLean通过自动化形式化框架将量子计算论文中的数学语句转化为Lean代码并回译为可读格式,实现端到端验证,为同行评审和合成数据训练提供实用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16066 2026-02-19 cs.AI 57%

Improving Interactive In-Context Learning from Natural Language Feedback

通过自然语言反馈提升交互式上下文学习

Martin Klissarov, Jonathan Cook, Diego Antognini, Hao Sun, Jingling Li, Natasha Jaques, Claudiu Musat, Edward Grefenstette

机构 * Google DeepMind(谷歌DeepMind)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出一种框架,通过自然语言反馈提升模型交互式上下文学习能力,使模型在多轮交互中表现更优,并具备自我纠正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏