arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-02 至 2026-02-02 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 11 篇

2601.23184 2026-02-02 cs.CL 89%

ReGuLaR: Variational Latent Reasoning Guided by Rendered Chain-of-Thought

ReGuLaR: 基于渲染思维链的变分潜在推理

Fanmeng Wang, Haotian Liu, Guojiang Zhao, Hongteng Xu, Zhifeng Gao

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 Gallagher人工智能学院) Beijing Key Laboratory of Research on Large Models(北京大型模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索工程研究中心)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

AI总结 ReGuLaR通过渲染思维链图像并利用视觉-语义表示正则化后验分布,实现高效的潜在推理,优于现有方法并在多模态推理中超越CoT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22484 2026-02-02 cs.LG 85%

Mitigating Cognitive Inertia in Large Reasoning Models via Latent Spike Steering

通过潜在尖峰引导缓解大推理模型中的认知惯性

Seojin Lee, ByeongJeong Kim, Hwanhee Lee

机构 * Department of Artificial Intelligence, Chung-Ang University, Seoul, Korea(人工智能系, Chung-Ang 大学,首尔,韩国)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);self-correction(abstract);分类 cs.LG

AI总结 STARS通过监测潜在动态,实时引导大推理模型缓解认知惯性问题,提升推理准确性和效率。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17652 2026-02-02 cs.LG cs.AI 81%

Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective

重新思考强化学习中用于大语言模型推理的采样标准:一种能力-难度对齐视角

Deyang Kong, Qi Guo, Xiangyu Xi, Wei Wang, Jingang Wang, Xunliang Cai, Shikun Zhang, Wei Ye

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CDAS方法,通过能力-难度对齐提升大语言模型推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22803 2026-02-02 cs.AI cs.SE 74%

CVeDRL: An Efficient Code Verifier via Difficulty-aware Reinforcement Learning

CVeDRL: 一种通过难度感知强化学习实现的高效代码验证器

Ji Shi, Peiming Guo, Meishan Zhang, Miao Zhang, Xuebo Liu, Min Zhang, Weili Guan

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 测试时计算 :verifier(title);分类 cs.AI

AI总结 CVeDRL通过难度感知强化学习提升代码验证效率,实现更高通过率和分支覆盖,参数更少,推理更快。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16648 2026-02-02 cs.AI cs.CL cs.LG 67%

FESTA: Functionally Equivalent Sampling for Trust Assessment of Multimodal LLMs

FESTA:用于多模态大语言模型信任评估的功能等效采样

Debarpan Bhattacharya, Apoorva Kulkarni, Sriram Ganapathy

机构 * Indian Institute of Science(印度科学研究院) University of Maryland College Park(马里兰大学学院公园分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FESTA通过功能等效采样技术提升多模态大语言模型的预测选择性性能,实现33.3%和29.6%的改进。

Comments Accepted in the Findings of EMNLP, 2025

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00219 2026-02-02 cs.LG cs.AI cs.CL cs.NE 67%

Thoughtbubbles: an Unsupervised Method for Parallel Thinking in Latent Space

Thoughtbubbles: 一种用于潜在空间中并行思维的无监督方法

Houjun Liu, Shikhar Murty, Christopher D. Manning, Róbert Csordás

机构 * Department of Computer Science, Stanford University, Stanford, CA, United States(计算机科学系,斯坦福大学,斯坦福,CA,美国)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Thoughtbubbles是一种通过预训练学习并行自适应计算的转换器变体,能够在潜在空间中实现更高效的计算,提升模型的推理性能和零样本评估表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17768 2026-02-02 cs.LG cs.AI cs.DC 62%

LLM-42: Enabling Determinism in LLM Inference with Verified Speculation

LLM-42: 通过验证推测实现LLM推理的确定性

Raja Gond, Aditya K Kamath, Ramachandran Ramjee, Ashish Panwar

机构 * Microsoft Research(微软研究院) University of Washington(华盛顿大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 LLM-42通过验证推测方法,在LLM推理中实现确定性,利用形状一致的减少和轻量级验证-回滚循环,减少确定性需求的开销。

Comments https://github.com/microsoft/llm-42

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26374 2026-02-02 cs.AI 57%

BOTS: A Unified Framework for Bayesian Online Task Selection in LLM Reinforcement Finetuning

BOTS:一种用于LLM强化微调中贝叶斯在线任务选择的统一框架

Qianli Shen, Daoyuan Chen, Yilun Huang, Zhenqing Ling, Yaliang Li, Bolin Ding, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 BOTS通过贝叶斯推断和汤普森采样,提高LLM强化微调中任务选择的效率和性能。

Comments Accepted as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22249 2026-02-02 cs.LG cs.SE 57%

FunPRM: Function-as-Step Process Reward Model with Meta Reward Correction for Code Generation

FunPRM:基于元奖励校正的函数作为步骤过程奖励模型用于代码生成

Ruiyi Zhang, Peijia Qin, Qi Cao, Eric Xue, Pengtao Xie

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 FunPRM通过元学习的奖励校正机制提升代码生成性能,实现更高质量的代码输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22230 2026-02-02 cs.LG 57%

DAJ: Data-Reweighted LLM Judge for Test-Time Scaling in Code Generation

DAJ:用于代码生成测试时缩放的数据重加权LLM评判器

Peijia Qin, Ruiyi Zhang, Qi Cao, Pengtao Xie

机构 * ucsd(加州大学圣地亚哥分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 DAJ通过双层数据重加权学习框架,提升LLM评判器在代码生成测试时缩放中的性能,实现对困难问题和轨迹一致数据的自动强调,取得最佳效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02767 2026-02-02 cs.CV 50%

Dynamic Reflections: Probing Video Representations with Text Alignment

动态反射:通过文本对齐探测视频表示

Tyler Zhu, Tengda Han, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov

机构 * Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 测试时计算 :reasoning(abstract)

AI总结 本研究通过视频-文本表示对齐探索现代视频和语言编码器的能力,揭示了跨模态对齐与数据丰富性、语义对齐与性能相关性以及时间推理与对齐的关系。

Comments To appear at ICLR 2026. 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏