arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-13 至 2026-01-13 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 6 篇

2601.07238 2026-01-13 cs.AI 83%

Group Pattern Selection Optimization: Let LRMs Pick the Right Pattern for Reasoning

分组模式选择优化:让大推理模型选择正确的推理模式

Hanbin Wang, Jingwei Song, Jinpeng Li, Fei Mi, Lifeng Shang

机构 * Peking University(北京大学) The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 GPSO通过强化学习框架优化大推理模型的推理模式选择,提升其在不同问题上的推理性能。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06423 2026-01-13 cs.AI 79%

Does Inference Scaling Improve Reasoning Faithfulness? A Multi-Model Analysis of Self-Consistency Tradeoffs

推理扩展是否能提升推理的可靠性?对多模型自一致性权衡的分析

Deep Mehta

机构 * Adobe Inc(Adobe公司)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 研究探讨推理扩展对推理可靠性的影响,发现不同模型表现各异,自一致性并非普遍有效,需根据具体模型进行测试。

Comments 24 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23027 2026-01-13 cs.LG cs.CL 62%

Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts

面向混合专家架构的稳定且有效的强化学习

Di Zhang, Xun Wu, Shaohan Huang, Lingjie Jiang, Yaru Hao, Li Dong, Zewen Chi, Zhifang Sui, Furu Wei

机构 * Microsoft Research(微软研究院) Peking University(北京大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种路由感知方法,通过优化重要性采样权重提升混合专家架构的强化学习稳定性与性能。

Comments Added additional experiments, improved analysis, and fixed minor issues

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06122 2026-01-13 cs.CV cs.AI cs.LG 62%

COVR:Collaborative Optimization of VLMs and RL Agent for Visual-Based Control

COVR:视觉控制中视觉语言模型与强化学习代理的协同优化

Canming Xia, Peixi Peng, Guang Tan, Zhan Su, Haoran Xu, Zhenxian Liu, Luntong Li

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 COVR通过协同优化视觉语言模型与强化学习代理,利用RL生成数据提升VLM语义推理能力,并通过动作先验引导策略学习,实现视觉控制任务中的高效优化。

Comments The paper was accepted by the Fortieth AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02212 2026-01-13 cs.LG cs.AI 62%

DiFFPO: Training Diffusion LLMs to Reason Fast and Furious via Reinforcement Learning

DiFFPO:通过强化学习训练扩散大语言模型以快速且高效地推理

Hanyang Zhao, Dawen Liang, Wenpin Tang, David Yao, Nathan Kallus

机构 * Columbia University(哥伦比亚大学) Netflix

专题命中 测试时计算 :planning(abstract);分类 cs.AI、cs.LG

AI总结 DiFFPO通过强化学习训练扩散大语言模型,使其在推理速度和准确性上取得平衡,提升推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12704 2026-01-13 cs.CL cs.AI 62%

Flexible Realignment of Language Models

语言模型的灵活重校准

Wenhong Zhu, Ruobing Xie, Weinan Zhang, Rui Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Large Language Department, Tencent(腾讯大语言部门)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出灵活的重校准框架,通过训练和推理时的可控对齐方法,提升语言模型的性能和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏