arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-08 至 2025-12-08 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 4 篇

2512.05325 2025-12-08 cs.CL cs.AI cs.LG 85%

LYNX: Learning Dynamic Exits for Confidence-Controlled Reasoning

LYNX: 为置信度控制推理学习动态退出

Ömer Faruk Akgül, Yusuf Hakan Kalaycı, Rajgopal Kannan, Willie Neiswanger, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM ARL(美国陆军战争研究所)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LYNX通过利用模型自身隐藏状态实现置信度控制的提前退出,提升推理效率和准确性,适用于多种任务和基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04996 2025-12-08 cs.LG cs.AI cs.CL stat.ML 67%

Reinforce-Ada: An Adaptive Sampling Framework under Non-linear RL Objectives

Reinforce-Ada: 非线性强化学习目标下的自适应采样框架

Wei Xiong, Chenlu Ye, Baohao Liao, Hanze Dong, Xinxing Xu, Christof Monz, Jiang Bian, Nan Jiang, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院) University of Amsterdam(阿姆斯特丹大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Reinforce-Ada通过自适应采样框架提升大语言模型在非线性强化学习目标下的推理性能,有效恢复丢失信号并加速收敛。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05542 2025-12-08 cs.LG cs.AI 66%

RoBoN: Routed Online Best-of-n for Test-Time Scaling with Multiple LLMs

RoBoN: 基于路由的在线最佳-n方法用于多LLM测试时间扩展

Jonathan Geuter, Gregor Kornhardt

机构 * Kempner Institute for the Study of Natural & Artificial Intelligence(自然与人工智能研究 institute)

专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.AI、cs.LG

AI总结 RoBoN通过在线路由多LLM生成过程,提高测试时间扩展性能,无需额外训练,有效提升准确率。

Comments 20 pages, 3 figures. 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Foundations of Reasoning in Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05546 2025-12-08 cs.CV cs.AI 57%

Conscious Gaze: Adaptive Attention Mechanisms for Hallucination Mitigation in Vision-Language Models

有意识的注视:用于视觉-语言模型中幻觉抑制的自适应注意力机制

Weijue Bu, Guan Yuan, Guixian Zhang

机构 * School of Computer Science and Technology/School of Artificial Intelligence(计算机科学与技术学院/人工智能学院) China University of Mining and Technology(中国矿业大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 CG-VLM通过认知需求传感器和聚焦共识诱导模块,在推理时精准干预视觉-语言模型的注意力,有效抑制幻觉并提升性能。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏