arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-23 至 2025-12-23 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 6 篇

2512.18215 2025-12-23 cs.LG cs.AI cs.CL cs.CV 82%

Stable and Efficient Single-Rollout RL for Multimodal Reasoning

稳定且高效的多模态推理单次迭代强化学习

Rui Liu, Dian Yu, Lei Ke, Haolin Liu, Yujun Zhou, Zhenwen Liang, Haitao Mi, Pratap Tokekar, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Maryland(马里兰大学) University of Virginia(弗吉尼亚大学) University of Notre Dame(诺特大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MSSR通过熵基优势塑造机制,实现多模态推理中的稳定高效单次迭代强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18311 2025-12-23 cs.AI cs.SE 81%

Monitoring Monitorability

监控可监控性

Melody Y. Guan, Miles Wang, Micah Carroll, Zehao Dou, Annie Y. Wei, Marcus Williams, Benjamin Arnav, Joost Huizinga, Ian Kivlichan, Mia Glaese, Jakub Pachocki, Bowen Baker

机构 * OpenAI

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);test-time compute(abstract)

AI总结 研究提出评估框架和指标,探讨了不同因素对AI系统可监控性的影响,发现更长的思维链和优化方法能提升监控效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18462 2025-12-23 cs.CL cs.AI cs.LG 67%

Mitigating Spurious Correlations in NLI via LLM-Synthesized Counterfactuals and Dynamic Balanced Sampling

通过LLM合成的反事实和动态平衡采样缓解NLI中的虚假相关性

Christopher Román Jaimes

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种自动化流程,通过LLM合成反事实和动态平衡采样缓解NLI中的虚假相关性,提升了模型性能和领域内准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24511 2025-12-23 cs.LG cs.AI 62%

Can Slow-thinking LLMs Reason Over Time? Empirical Studies in Time Series Forecasting

慢思考LLM能否在时间上进行推理?时间序列预测的实证研究

Mingyue Cheng, Jiahao Wang, Daoyu Wang, Xiaoyu Tao, Qi Liu, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨慢思考LLM能否在时间序列预测中进行推理,通过实验证明其零样本预测能力,揭示LLM在时间动态上的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19585 2025-12-23 cs.CL 57%

Increasing the Thinking Budget is Not All You Need

增加思考预算并不足以提升性能

Ignacio Iacobacci, Zhaozhi Qian, Faroq AL-Tam, Muhammad AL-Qurishi, Riad Souissi

机构 * Elm Company(埃尔姆公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了思考预算对模型性能的影响,发现增加预算并非最优策略,而自一致性和反思等配置能更有效提升推理准确性。

Comments 4 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05387 2025-12-23 cs.CL 57%

Learning from Self Critique and Refinement for Faithful LLM Summarization

从自我批评与完善学习以实现忠实的大语言模型摘要

Ting-Yao Hu, Hema Swetha Koppula, Hadi Pouransari, Cem Koc, Oncel Tuzel, Raviteja Vemulapalli

机构 * Apple(苹果公司)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL

AI总结 本文提出SCRPO方法,通过自监督训练框架提升大语言模型摘要的忠实度,实验表明其在忠实度和整体质量上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏