arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-09 至 2026-02-09 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 7 篇

2602.06600 2026-02-09 cs.CL 85%

Echoes as Anchors: Probabilistic Costs and Attention Refocusing in LLM Reasoning

回声作为锚点:在大语言模型推理中的概率成本与注意力再聚焦

Zhuoyuan Hao, Zhuo Li, Wu Li, Fangming Liu, Min Zhang, Jing Li

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);test-time compute(abstract);分类 cs.CL

AI总结 本研究通过回声蒸馏监督微调和回声提示技术,利用大语言模型中自发的回声现象,提升推理准确性与注意力聚焦效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06795 2026-02-09 cs.CL cs.AI 81%

Generating Data-Driven Reasoning Rubrics for Domain-Adaptive Reward Modeling

生成数据驱动的推理评分标准以实现领域自适应奖励建模

Kate Sanders, Nathaniel Weir, Sapana Chaudhary, Kaj Bostrom, Huzefa Rangwala

机构 * Johns Hopkins University(约翰霍普金斯大学) Amazon Web Services(亚马逊网络服务)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出数据驱动的推理评分标准,用于提升领域自适应奖励建模的错误检测能力,实验显示其在技术领域任务准确性提升达45%

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05281 2026-02-09 cs.LG cs.CL 81%

Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities

回归基础:通过生成概率重新审视强化学习中LLM推理的探索

Pengyi Li, Elizaveta Goncharova, Andrey Kuznetsov, Ivan Oseledets

机构 * FusionBrain Lab, Russia(融合脑实验室,俄罗斯) Institute of Numerical Mathematics, Russia(数值数学研究所,俄罗斯)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 通过生成概率重新审视强化学习中LLM推理的探索,提出ARM机制平衡置信度,提升生成多样性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04010 2026-02-09 cs.LG cs.AI cs.CL cs.NE 67%

Hyperbolic Fine-Tuning for Large Language Models

双曲微调用于大语言模型

Menglin Yang, Ram Samarth B B, Aosong Feng, Bo Xiong, Jihong Liu, Irwin King, Rex Ying

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Indian Institute of Science(印度科学研究院) Yale University(耶鲁大学) Stanford University(斯坦福大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HypLoRA通过在双曲空间中进行低秩适应,提升大语言模型在算术和常识推理任务中的性能。

Comments NeurIPS 2025; https://github.com/marlin-codes/HypLoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21446 2026-02-09 cs.LG cs.AI 62%

dUltra: Ultra-Fast Diffusion Language Models via Reinforcement Learning

dUltra: 通过强化学习实现超快扩散语言模型

Shirui Chen, Jiantao Jiao, Lillian J. Ratliff, Banghua Zhu

机构 * University of Washington(华盛顿大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 dUltra通过端对端强化学习框架实现超快扩散语言模型,提升并行生成效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04620 2026-02-09 cs.LG 57%

QUATRO: Query-Adaptive Trust Region Policy Optimization for LLM Fine-tuning

QUATRO:用于LLM微调的查询自适应信任区域策略优化

Doyeon Lee, Eunyi Lyou, Hyunsoo Cho, Sookyung Kim, Joonseok Lee, Jaemoo Choi

机构 * Seoul National University(首尔国立大学) Ewha Woman University(成均馆大学) Geogia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 QUATRO通过原则性优化直接施加信任区域约束,实现稳定且可控的LLM微调,提升训练稳定性与熵控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06291 2026-02-09 cs.CL 57%

Judging What We Cannot Solve: A Consequence-Based Approach for Oracle-Free Evaluation of Research-Level Math

判断我们无法解决的内容:一种基于后果的方法用于无Oracle评估研究级数学

Guijin Son, Donghun Yang, Hitesh Laxmichand Patel, Hyunwoo Ko, Amit Agarwal, Sunghee Ahn, Kyong-Ha Lee, Youngjae Yu

机构 * snu(首尔国立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于后果的无Oracle评估方法,用于评估研究级数学问题的求解质量,通过测试候选方案在相关问题中的表现,有效提升评估准确性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏