arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-06 至 2026-02-06 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 6 篇

2602.05805 2026-02-06 cs.AI 83%

NEX: Neuron Explore-Exploit Scoring for Label-Free Chain-of-Thought Selection and Model Ranking

NEX: 无标签的神经元探索-利用评分用于无标签的思维链选择和模型排名

Kang Chen, Zhuoka Feng, Sihan Zhao, Kai Xiong, Junjie Nian, Yaoning Wang, Changyi Xiao, Yixin Cao

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 NEX通过神经元活动信号实现无标签的思维链选择和模型排名,通过探索与利用的交替阶段提升预测准确性。

Comments 21 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05539 2026-02-06 cs.LG cs.AI cs.CL 82%

Steering Large Reasoning Models towards Concise Reasoning via Flow Matching

通过流匹配引导大型推理模型实现紧凑推理

Yawei Li, Benjamin Bergner, Yinghan Zhao, Vihang Prakash Patil, Bei Chen, Cheng Wang

机构 * LMU Munich(慕尼黑莱茵河大学) Amazon(亚马逊)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过流匹配引导大型推理模型实现紧凑推理,提出非线性引导方法提升推理效率和任务性能。

Comments This paper has been accepted to Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13342 2026-02-06 cs.AI cs.CL cs.LG 75%

Verifying the Verifiers: Unveiling Pitfalls and Potentials in Fact Verifiers

验证验证者:揭示事实验证器中的陷阱与潜力

Wooseok Seo, Seungju Han, Jaehun Jung, Benjamin Newman, Seungwon Lim, Seungbeen Lee, Ximing Lu, Yejin Choi, Youngjae Yu

机构 * Yonsei University(延世大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Seoul National University(首尔国立大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究评估了多种大语言模型和事实验证器,揭示了数据标注问题、前沿模型性能及小型验证器的改进潜力。

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05570 2026-02-06 cs.AI 70%

TangramSR: Can Vision-Language Models Reason in Continuous Geometric Space?

TangramSR: 视觉-语言模型能否在连续几何空间中推理?

Yikun Zong, Cheston Tan

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 TangramSR通过测试时自我改进框架,结合上下文学习和奖励循环,提升视觉-语言模型在连续几何空间中的推理能力。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20295 2026-02-06 cs.CL cs.AI cs.LG stat.ML 67%

SelfReflect: Can LLMs Communicate Their Internal Answer Distribution?

SelfReflect: LLMs能否传达其内部答案分布?

Michael Kirchhof, Luca Füger, Adam Goliński, Eeshan Gunesh Dhekane, Arno Blaas, Seong Joon Oh, Sinead Williamson

机构 * Apple(苹果公司) Independent Researcher(独立研究者) Tübingen AI Center(图宾根人工智能中心)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SelfReflect通过评估LLM内部信念分布与总结之间的信息论距离,发现现代LLM无法有效传达其不确定性,但通过多输出采样可生成忠实的不确定性总结。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22129 2026-02-06 cs.SE cs.AI cs.LG 62%

SWE-Replay: Efficient Test-Time Scaling for Software Engineering Agents

SWE-Replay:面向软件工程代理的高效测试时间扩展

Yifeng Ding, Lingming Zhang

机构 * Siebel School of Computing(计算科学系) Data Science, University of Illinois Urbana-Champaign, USA(数据科学,伊利诺伊大学厄巴纳-香槟分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SWE-Replay通过重用历史轨迹和动态选择探索或利用策略,实现了高效且可推广的软件工程代理测试时间扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏