arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-12 至 2026-01-12 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 4 篇

2601.05593 2026-01-12 cs.LG 88%

PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning

PaCoRe: 通过并行协调推理学习扩展测试时间计算

Jingcheng Hu, Yinmin Zhang, Shijie Shang, Xiaobo Yang, Yue Peng, Zhewei Huang, Hebin Zhou, Xin Wu, Jie Cheng, Fanqi Wan, Xiangwen Kong, Chengyuan Yao, Kaiwen Yan, Ailin Huang, Hongyu Zhou, Qi Han, Zheng Ge, Daxin Jiang, Xiangyu Zhang, Heung-Yeung Shum

机构 * StepFun Tsinghua University(清华大学) Peking University(北京大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title,abstract);分类 cs.LG

AI总结 PaCoRe通过并行协调推理框架,实现大规模测试时间计算扩展,提升数学推理能力至94.5%

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11847 2026-01-12 cs.LG cs.AI 84%

Tiny Recursive Models on ARC-AGI-1: Inductive Biases, Identity Conditioning, and Test-Time Compute

在ARC-AGI-1上使用小型递归模型:归纳偏差、身份条件和测试时计算

Antonio Roye-Azar, Santiago Vargas-Naranjo, Dhruv Ghai, Nithin Balamurugan, Rayan Amir

机构 * Western University(西部大学) Varonova Tech Inc.(Varonova科技公司)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究分析了TRM在ARC-AGI-1上的表现,发现其性能源于效率、任务特定条件和测试时计算的相互作用,而非深度推理。

Comments 13 pages, 0 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21825 2026-01-12 cs.LG cs.AI cs.CL 82%

Let Me Think! A Long Chain-of-Thought Can Be Worth Exponentially Many Short Ones

让我思考!一个长的推理链可能比许多短的链多出指数倍

Parsa Mirtaheri, Ezra Edelman, Samy Jelassi, Eran Malach, Enric Boix-Adsera

机构 * UC San Diego(UC圣地亚哥大学) University of Pennsylvania(宾夕法尼亚大学) Harvard University(哈佛大学)

专题命中 测试时计算 :chain-of-thought(title);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了推理链扩展策略,证明在特定图连通性问题中顺序扩展比并行扩展更有效。

Comments Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08098 2026-01-12 cs.CL cs.AI 81%

The Price of Thought: A Multilingual Analysis of Reasoning, Performance, and Cost of Negotiation in Large Language Models

思考的成本:多语言下大型语言模型谈判能力、表现与成本的分析

Sherzod Hakimov, Roland Bernard, Tim Leiber, Karl Osswald, Kristina Richert, Ruilin Yang, Raffaella Bernardi, David Schlangen

机构 * Computational Linguistics, Department of Linguistics University of Potsdam(波恩-博兹恩大学语言学系) German Research Center for Artificial Intelligence (DFKI), Berlin(德国人工智能研究中心(DFKI)) Free University of Bozen-Bolzano(博兹恩-博尔扎诺自由大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究分析了多语言环境下大型语言模型谈判能力的表现与成本,发现启用推理能提升谈判效果但增加计算成本,且开源模型在多语言谈判中倾向于使用英语推理。

Comments Accepted at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏