arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-11 至 2026-02-11 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2508.08688 2026-02-11 cs.AI cs.CV 85%

STELAR-VISION: Self-Topology-Aware Efficient Learning for Aligned Reasoning in Vision

STELAR-VISION:基于拓扑意识的高效学习以实现对齐推理

Chen Li, Han Zhang, Zhantao Yang, Fangyi Chen, Zihan Wang, Anudeepsekhar Bolimera, Marios Savvides

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 STELAR-VISION通过拓扑意识训练框架提升视觉-语言模型的推理准确性和效率,实现更高效的多模态任务处理。

Comments This paper has been accepted at AAAI 2026. This is the author's extended version. The final version will appear in the official proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13761 2026-02-11 cs.AI cs.CL 84%

THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning

THOR:通过强化学习进行工具集成的分层优化以实现数学推理

Qikai Chang, Zhenrong Zhang, Pengfei Hu, Jun Du, Jiefeng Ma, Yicheng Pan, Jianshu Zhang, Quan Liu, Jianqing Gao

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 数学推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 THOR通过强化学习实现工具集成的分层优化,提升数学推理和代码生成能力。

Comments 22 pages, 13 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02301 2026-02-11 cs.CL cs.AI cs.LG 82%

Advancing General-Purpose Reasoning Models with Modular Gradient Surgery

通过模块化梯度手术提升通用推理模型

Min Cai, Yu Liang, Longzheng Wang, Yan Wang, Yueyang Zhang, Long Xia, Zhiyuan Sun, Xi Ye, Daiting Shi

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过模块化梯度手术提升通用推理模型,解决跨领域训练中的梯度冲突问题,提升多任务RL性能。

Comments Preprint; Code: https://github.com/StringNLPLAB/MGS Website: https://modular-gradient-surgery.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10019 2026-02-11 cs.LG cs.AI 81%

ADORA: Training Reasoning Models with Dynamic Advantage Estimation on Reinforcement Learning

ADORA: 通过强化学习中的动态优势估计训练推理模型

Qingnan Ren, Shiting Huang, Zhen Fang, Zehui Chen, Lin Chen, Lijun Li, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 ADORA通过动态优势估计提升强化学习中推理模型的训练效率与稳定性

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09173 2026-02-11 cs.LG cs.AI 62%

$n$-Musketeers: Reinforcement Learning Shapes Collaboration Among Language Models

$n$-Musketeers: 通过强化学习塑造语言模型间的协作

Ryozo Masukawa, Sanggeon Yun, Hyunwoo Oh, SuhgHeon Jeong, Raheeb Hassa, Hanning Chen, Wenjun Huang, Mahdi Imani, Pietro Mercati, Nathaniel D. Bastian, Mohsen Imani

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出软隐藏状态协作方法,通过可训练的注意力接口整合多个冻结的SLM专家,实验证明其在推理任务中与强基线竞争,并揭示了专家利用的双机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24592 2026-02-11 cs.CL 57%

ReForm: Reflective Autoformalization with Prospective Bounded Sequence Optimization

ReForm:具有前瞻性有界序列优化的反思自动形式化

Guoxin Chen, Jing Wu, Xinjie Chen, Wayne Xin Zhao, Ruihua Song, Chengxi Li, Kai Fan, Dayiheng Liu, Minpeng Liao

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Zhejiang University(浙江大学) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大模型与智能治理重点实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 ReForm通过整合语义一致性评估和前瞻性有界序列优化,提升自动形式化任务的准确性和语义保真度,实验表明其在四个基准上的性能提升了22.6个百分点。

Comments Camera Ready version for ICLR 2026. Code: https://github.com/Chen-GX/ReForm

详情

展开后加载摘要…

URL PDF HTML 收藏