arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-09 至 2026-01-09 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 4 篇

2601.04973 2026-01-09 cs.AI cs.CL 90%

ConMax: Confidence-Maximizing Compression for Efficient Chain-of-Thought Reasoning

ConMax:用于高效思维链推理的置信度最大化压缩

Minda Hu, Zexuan Qiu, Zenan Xu, Kun Li, Bo Zhou, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) LLM Department, Tencent(腾讯机器学习部门)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 ConMax通过强化学习框架在保持推理模式的同时,高效压缩推理轨迹,提升大规模推理模型的效率与性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04254 2026-01-09 cs.AI cs.LG 81%

Scaling Trends for Multi-Hop Contextual Reasoning in Mid-Scale Language Models

中等规模语言模型中多跳上下文推理的扩展趋势

Brady Steele, Micah Katz

机构 * Georgia Institute of Technology(佐治亚理工学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过对比不同模型的多跳推理能力,发现多代理系统在推理任务中表现优于规则方法,且模型基础能力影响放大效果。

Comments 18 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04411 2026-01-09 cs.LG cs.AI cs.CL 75%

Rate or Fate? RLV$^\varepsilon$R: Reinforcement Learning with Verifiable Noisy Rewards

速率还是命运?RLV$^\varepsilon$R:具有可验证噪声奖励的强化学习

Ali Rad, Khashayar Filom, Darioush Keivan, Peyman Mohajerin Esfahani, Ehsan Kamalinejad

机构 * Cognichip AI University of Toronto(多伦多大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RLV$^\varepsilon$R框架,通过分析验证噪声对强化学习的影响,揭示了噪声如何影响学习速率与命运,并通过实验验证了在不同Youden指数下动态变化的相变特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04674 2026-01-09 cs.IR 50%

PROMISE: Process Reward Models Unlock Test-Time Scaling Laws in Generative Recommendations

PROMISE: 过程奖励模型解锁生成推荐的测试时扩展定律

Chengcheng Guo, Kuo Cai, Yu Zhou, Qiang Luo, Ruiming Tang, Han Li, Kun Gai, Guorui Zhou

专题命中 测试时计算 :reasoning(abstract)

AI总结 PROMISE通过整合密集逐步验证和PRM引导的束搜索策略,解决生成推荐中的语义漂移问题,提升推荐准确性并实现高效部署。

详情

展开后加载摘要…

URL PDF HTML 收藏