arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-10 至 2026-02-10 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 10 篇

2602.08948 2026-02-10 cs.AI cs.CL 86%

CoRefine: Confidence-Guided Self-Refinement for Adaptive Test-Time Compute

CoRefine: 基于置信度的自修正以适应测试时计算

Chen Jin, Ryutaro Tanno, Tom Diethe, Philip Teare

专题命中 测试时计算 :test-time compute(title);reasoning(abstract);verifier(abstract);self-correction(abstract)

AI总结 CoRefine通过置信度引导的自修正方法,在减少计算开销的同时提升推理准确性,适用于需要适应性测试时计算的场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07032 2026-02-10 cs.AI cs.AR cs.CL 84%

LLM-FSM: Scaling Large Language Models for Finite-State Reasoning in RTL Code Generation

LLM-FSM: 通过大规模语言模型扩展有限状态推理用于RTL代码生成

Yuheng Wu, Berk Gokmen, Zhouhua Xie, Peijing Li, Caroline Trippel, Priyanka Raina, Thierry Tambe

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 LLM-FSM通过大规模语言模型评估有限状态机在RTL代码生成中的表现,展示了模型在复杂性增加时的准确性下降及训练和测试扩展的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08489 2026-02-10 cs.LG cs.CL 81%

Beyond Correctness: Learning Robust Reasoning via Transfer

超越正确性:通过迁移学习实现鲁棒推理

Hyunseok Lee, Soheil Abbasloo, Jihoon Tack, Jinwoo Shin

机构 * Microsoft Research(微软研究院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 通过迁移奖励的强化学习方法,提升大语言模型推理的鲁棒性和效率,实现更稳定和可推广的推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00075 2026-02-10 cs.LG cs.AI 81%

Theoretical Modeling of Large Language Model Self-Improvement Training Dynamics Through Solver-Verifier Gap

大语言模型自我改进训练动态的理论建模:通过求解器-验证器间隙

Yifan Sun, Yushan Liang, Zhen Zhang, Xin Liu, Jiaye Teng

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过求解器-验证器间隙理论,建模大语言模型自我改进的训练动态,并验证了该框架在不同模型和数据集上的有效性,同时探讨了外部数据对动态的影响。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00760 2026-02-10 cs.CL 79%

APR: Penalizing Structural Redundancy in Large Reasoning Models via Anchor-based Process Rewards

APR:通过基于锚点的过程奖励惩罚大型推理模型中的结构冗余

Kaiyan Chang, Chenwei Zhu, Yingfeng Luo, Yifu Huo, Chenglong Wang, Xiaoqian Liu, Qiaozhi He, Tong Xiao, Zhengtao Yu, Jingbo Zhu

机构 * NiuTrans Research(尼utoff研究)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 APR通过基于锚点的过程奖励方法,有效惩罚大型推理模型中的结构冗余,提升推理效率与性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08346 2026-02-10 cs.CV 78%

What, Whether and How? Unveiling Process Reward Models for Thinking with Images Reasoning

什么是、是否以及如何?揭示图像推理中的过程奖励模型

Yujin Zhou, Pengcheng Wen, Jiale Chen, Boqin Yin, Han Zhu, Jiaming Ji, Juntao Dai, Chi-Min Chan, Sirui Han

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 本研究提出首个图像推理范式下的PRMs综合基准,定义7种细粒度错误类型,揭示当前LVLMs在视觉推理评估中的不足,为改进PRMs提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00380 2026-02-10 cs.CL 70%

Clause-Internal or Clause-External? Testing Turkish Reflexive Binding in Adapted versus Chain of Thought Large Language Models

内部短语还是外部短语?测试土耳其反身代词在适应型与思维链大型语言模型中的绑定

Sercan Karakaş

机构 * University of Chicago(芝加哥大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究通过对比两种大型语言模型,探讨土耳其反身代词在不同模型中的绑定行为差异,揭示模型架构和训练数据对指代依赖表示的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11731 2026-02-10 cs.LG cs.AI cs.CL 69%

Dist2ill: Distributional Distillation for One-Pass Uncertainty Estimation in Large Language Models

Dist2ill: 基于分布的蒸馏用于大语言模型中单次传递的不确定性估计

Yicong Zhao, King Yeung Tsang, Harshil Vejendla, Haizhou Shi, Zhuohang Li, Zhigang Hua, Qi Xu, Tunyu Zhang, Yi Wang, Ligong Han, Bradley A. Malin, Hao Wang

机构 * Rutgers University(罗格斯大学) Vanderbilt University(范德比尔特大学) Meta

专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.CL、cs.AI、cs.LG

AI总结 Dist2ill通过在单次推断中生成多个多样化的推理路径,利用轻量级模块近似置信度分数,实现大语言模型中更准确的不确定性估计。

Comments Preprint; work in progress. Update Log: 05/2025 (v1&v2): Introduced Dist2ill (previously named EUD) for efficient uncertainty estimation, focusing on discriminative reasoning tasks. 02/2026 (v3): Extended Dist2ill to a unified framework supporting both discriminative and generative reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07276 2026-02-10 cs.AI cs.CL cs.LG 67%

Steer2Adapt: Dynamically Composing Steering Vectors Elicits Efficient Adaptation of LLMs

Steer2Adapt:动态组合转向向量引发LLM高效适应

Pengrui Han, Xueqiang Xu, Keyang Xuan, Peiyang Song, Siru Ouyang, Runchu Tian, Yuqing Jiang, Cheng Qian, Pengcheng Jiang, Jiashuo Sun, Junxia Cui, Ming Zhong, Ge Liu, Jiawei Han, Jiaxuan You

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 STEER2ADAPT通过动态组合转向向量实现LLM高效适应,适用于需要多协调能力的复杂任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08630 2026-02-10 cs.AI cs.CC 57%

Debate is efficient with your time

与时间高效地进行辩论

Jonah Brown-Cohen, Geoffrey Irving, Simon C. Marshall, Ilan Newman, Georgios Piliouras, Mario Szegedy

机构 * Google DeepMind(谷歌DeepMind) UK AI Security Institute(英国人工智能安全研究所) University of Haifa(海法大学) Rutgers University(罗格斯大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 通过辩论实现人工智能安全,证明辩论查询复杂度与电路复杂性密切相关。

Comments 11 Pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏