arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-01 至 2026-01-01 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 7 篇

2504.10481 2026-01-01 cs.CL 88%

xVerify: Efficient Answer Verifier for Reasoning Model Evaluations

xVerify:用于推理模型评估的高效答案验证器

Ding Chen, Qingchen Yu, Pengyuan Wang, Mengting Hu, Wentao Zhang, Zhengren Wang, Bo Tang, Feiyu Xiong, Xinchi Li, Chao Wang, Minchuan Yang, Zhiyu Li

机构 * China Telecom Research Institute(中国电信研究院) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)技术有限公司) College of Software, Nankai University(南开大学软件学院) Center for Data Science, Peking University(北京大学数据科学中心) Peking University(北京大学) Data Development Center of China Telecom(中国电信数据开发中心)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL

AI总结 xVerify是一种高效答案验证器,通过VAR数据集训练,能够准确评估推理模型的等价性判断和最终答案提取,实验表明其在多个任务中表现优异。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06415 2026-01-01 cs.CL cs.LG 81%

PERK: Long-Context Reasoning as Parameter-Efficient Test-Time Learning

PERK:长上下文推理作为参数高效测试时学习

Zeming Chen, Angelika Romanou, Gail Weiss, Antoine Bosselut

机构 * EPFL(瑞士联邦理工学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 PERK通过参数高效测试时学习方法,实现对长上下文的高效推理,显著提升模型性能。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23765 2026-01-01 cs.CL cs.AI 81%

Entropy-Aware Speculative Decoding Toward Improved LLM Reasoning

基于熵的推测解码:改进大语言模型推理

Tiancheng Su, Meicong Zhang, Guoxiu He

机构 * School of Economics and Management(经济管理学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 基于熵的推测解码通过动态熵惩罚提升大语言模型推理性能,实验表明其在多数情况下优于目标模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25014 2026-01-01 cs.LG cs.CC 70%

Diffusion Language Models are Provably Optimal Parallel Samplers

扩散语言模型是可证明最优的并行采样器

Haozhe Jiang, Nika Haghtalab, Lijie Chen

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文证明了通过链式思维和修订,扩散语言模型能够以最优步骤和空间复杂度模拟并行采样算法,从而提升其作为高效并行采样器的理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23852 2026-01-01 cs.LG cs.CL 62%

Trellis: Learning to Compress Key-Value Memory in Attention Models

Trellis: 在注意力模型中学习压缩键值记忆

Mahdi Karami, Ali Behrouz, Praneeth Kacham, Vahab Mirrokni

机构 * Google Research(谷歌研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Trellis通过动态压缩键值内存提升注意力模型的效率与长上下文处理能力

Comments In Second Conference on Language Modeling (COLM) (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23760 2026-01-01 cs.CR cs.AI 57%

Audited Skill-Graph Self-Improvement for Agentic LLMs via Verifiable Rewards, Experience Synthesis, and Continual Memory

通过可验证奖励、经验合成和持续记忆对代理LLM进行审计化技能图自改进

Ken Huang, Jerry Huang

机构 * OWASP Fairfax, VA, USA Kleiner Perkins

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出ASG-SI框架,通过可验证奖励、经验合成和持续记忆实现代理LLM的审计化技能图自改进,以提升安全性和可追溯性。

Comments 11 pages, 4 figures. Includes a complete runnable reference implementation and audit logging framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22693 2026-01-01 cs.CV 50%

VADTree: Explainable Training-Free Video Anomaly Detection via Hierarchical Granularity-Aware Tree

VADTree: 通过分层粒度感知树实现可解释的无训练视频异常检测

Wenlong Li, Yifei Xu, Yuan Rao, Zhenhua Wang, Shuiguang Deng

机构 * School of Software, Xi’an Jiaotong University(西安交通大学软件学院) China Railway Xi’an Group(中国铁路西安集团) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 测试时计算 :reasoning(abstract)

AI总结 VADTree通过分层粒度感知树结构实现无训练视频异常检测,利用预训练模型知识和多维先验提升异常感知与推理能力。

Comments NeurIPS 2025 poster

详情

展开后加载摘要…

URL PDF HTML 收藏