arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-04 至 2026-02-04 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 12 篇

2505.17813 2026-02-04 cs.CL cs.AI 84%

Don't Overthink it. Preferring Shorter Thinking Chains for Improved LLM Reasoning

不要过度思考。为改进大语言模型推理而偏好更短的思考链

Michael Hassid, Gabriel Synnaeve, Yossi Adi, Roy Schwartz

机构 * FAIR Team, Meta(Meta FAIR团队) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出short-m@k方法,通过并行生成较短的思考链提高大语言模型推理效率,实验表明其在低计算环境下表现优于传统多数投票。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02828 2026-02-04 cs.LG 83%

A Single Revision Step Improves Token-Efficient LLM Reasoning

一步修订提升令牌高效大语言模型推理

Yingchuan Zhang, Terry Ma, Wenxuan Zhong, Ping Ma

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Georgia(佐治亚大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.LG

AI总结 PACER通过轨迹间互相审查提升令牌高效大语言模型推理准确性,显著优于传统投票方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21494 2026-02-04 cs.AI cs.CL 81%

The Path of Least Resistance: Guiding LLM Reasoning Trajectories with Prefix Consensus

最小阻力路径:利用前缀一致性引导大语言模型推理轨迹

Ishan Jindal, Sai Prashanth Akuthota, Jayant Taneja, Sachin Dev Sharma

机构 * Fujitsu Research India(富士通印度研究实验室) SRID Samsung R&D Institute India-Delhi(三星印度德里研发研究所)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 PoLR通过利用前缀一致性在推理过程中提高计算效率,减少令牌使用和延迟,同时保持自我一致性方法的准确性。

Comments Accepted at ICLR 2026. https://openreview.net/forum?id=hrnSqERgPn

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02863 2026-02-04 cs.AI cs.LG 81%

"I May Not Have Articulated Myself Clearly": Diagnosing Dynamic Instability in LLM Reasoning at Inference Time

我可能没有表达清楚:在推理时间诊断LLM推理中的动态不稳定性

Jinkun Chen, Fengxiang Cheng, Sijia Han, Vlado Keselj

机构 * Dalhousie University(达尔豪斯大学) University of Amsterdam(阿姆斯特丹大学) Tsinghua University(清华大学) Meta

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析LLM推理过程中的动态不稳定性,发现早期不稳定性可能预示后续正确答案,而晚期不稳定性更易导致失败,提出基于分布偏移和熵的诊断方法。

Comments 21 pages, 12 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18795 2026-02-04 cs.LG cs.AI cs.CL 67%

Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes

重用FLOPs:通过条件化非常离策略前缀来扩展RL在困难问题上的应用

Amrith Setlur, Zijian Wang, Andrew Cohen, Paria Rashidinejad, Sang Michael Xie

机构 * Meta Carnegie Mellon University(卡内基梅隆大学) University of Southern California(南加州大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过条件化离策略前缀提升RL在困难问题上的学习效率,实现更快的训练奖励和更高的最终奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03143 2026-02-04 cs.LG cs.AI cs.CL stat.ML 67%

Self-Hinting Language Models Enhance Reinforcement Learning

自我提示语言模型增强强化学习

Baohao Liao, Hanze Dong, Xinxing Xu, Christof Monz, Jiang Bian

机构 * Microsoft Research(微软研究院) Language Technology Lab, University of Amsterdam(语言技术实验室,阿姆斯特丹大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAGE通过注入自我提示提升GRPO在稀疏奖励下的表现,有效增强大语言模型的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10398 2026-02-04 cs.CL cs.AI cs.LG cs.SE 67%

Confucius Code Agent: Scalable Agent Scaffolding for Real-World Codebases

孔子代码代理:面向真实世界代码库的可扩展代理构建

Sherman Wong, Zhenting Qi, Zhaodong Wang, Nathan Hu, Samuel Lin, Jun Ge, Erwin Gao, Wenlin Chen, Yilun Du, Minlan Yu, Ying Zhang

机构 * Meta

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 孔子代码代理通过可扩展的代理构建框架,在真实世界软件工程任务中实现高性能,超越现有研究和商业成果。

Comments The latest version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03053 2026-02-04 cs.AI cs.CL cs.MA 62%

MAS-ProVe: Understanding the Process Verification of Multi-Agent Systems

MAS-ProVe: 理解多智能体系统的进程验证

Vishal Venkataramani, Haizhou Shi, Zixuan Ke, Austin Xu, Xiaoxiao He, Yingbo Zhou, Semih Yavuz, Hao Wang, Shafiq Joty

机构 * Rutgers University(罗杰斯大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MAS-ProVe研究多智能体系统进程验证的有效性,发现LLM作为法官表现优于奖励方法,但验证过程仍面临上下文长度与性能的权衡问题。

Comments Preprint; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07182 2026-02-04 cs.LG cs.AI 62%

PRPO: Aligning Process Reward with Outcome Reward in Policy Optimization

PRPO:在策略优化中对过程奖励与结果奖励的对齐

Ruiyi Ding, Yongxuan Lv, Xianhui Meng, Jiahe Song, Chao Wang, Chen Jiang, Yuan Cheng

机构 * Shanghai University(上海大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Artificial Intelligence Incubation and Innovation Institute, Fudan University(复旦大学人工智能孵化与创新研究院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 PRPO通过结合结果可靠性与过程级指导,在无批评者框架中提升策略优化效率,实现对过程奖励与结果奖励的对齐,从而提高模型在多步推理任务中的性能。

Comments 8 pages, 2 figures Code is available at: https://github.com/SchumiDing/srpocode

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18793 2026-02-04 cs.AI cs.LG 62%

NEZHA: A Zero-sacrifice and Hyperspeed Decoding Architecture for Generative Recommendations

NEZHA:一种零牺牲和超高速解码架构用于生成推荐

Yejing Wang, Shengyu Zhou, Jinyu Lu, Ziwei Liu, Langming Liu, Maolin Wang, Wenlin Zhang, Feng Li, Wenbo Su, Pengjie Wang, Jian Xu, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 NEZHA 提出了一种无需牺牲推荐质量的超高速解码架构,通过集成灵活的自回归草稿头和高效验证器,提升生成推荐系统的性能和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00611 2026-02-04 cs.AI 57%

Structured Self-Consistency:A Multi-Task Evaluation of LLMs on VirtualHome

结构自一致性:基于虚拟家庭的多任务评估

Jiaqi Xu, Tao Huang, Kai Zhang

专题命中 测试时计算 :planning(abstract);分类 cs.AI

AI总结 本文提出结构自一致性方法,评估两种大型语言模型在虚拟家庭任务中的表现,发现不同模型在不同任务中各有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03589 2026-02-04 cs.CV 50%

SlowFocus: Enhancing Fine-grained Temporal Understanding in Video LLM

SlowFocus: 提升视频大语言模型中的细粒度时间理解

Ming Nie, Dan Ding, Chunwei Wang, Yuanfan Guo, Jianhua Han, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Noah’s Ark Lab, Huawei(华为诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿万象智能科技有限公司)

专题命中 测试时计算 :reasoning(abstract)

AI总结 SlowFocus通过提升等效采样频率和引入多频率混合注意力模块,提升视频大语言模型对细粒度时间理解的能力。

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏