arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-22 至 2025-12-22 共收录 2 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 2 篇

2512.17079 2025-12-22 cs.LG cs.AI 86%

Can Large Reasoning Models Improve Accuracy on Mathematical Tasks Using Flawed Thinking?

大推理模型能否通过错误推理提升数学任务的准确性?

Saraswathy Amjith, Mihika Dusad, Neha Muramalla, Shweta Shah

机构 * MIT(麻省理工学院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过训练模型处理故意错误推理轨迹,提升其在数学任务中的错误恢复能力,同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17636 2025-12-22 cs.LG cs.AI 62%

Trust-Region Adaptive Policy Optimization

信任区域自适应策略优化

Mingyu Su, Jian Guan, Yuxian Gu, Minlie Huang, Hongning Wang

机构 * The Conversational AI (CoAI) Group, Tsinghua University(清华大学对话式人工智能(CoAI)小组)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 TRAPO通过结合SFT和RL的训练流程,提升大语言模型的推理能力,实现更稳定的训练和更高效的探索。

详情

展开后加载摘要…

URL PDF HTML 收藏