arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-03 至 2026-03-03 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 10 篇

2603.00296 2026-03-03 cs.CL cs.AI cs.LG 89%

Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning

逐步惩罚以实现高效推理链

Xintong Li, Sha Li, Rongmei Lin, Hongye Jin, Linwei Li, Hejie Cui, Sarah Zhang, Chia-Yuan Chang, Kewei Cheng, Besnik Fetahu, Priyanka Nigam, Jingbo Shang, Bing Yin

机构 * University of California, San Diego(加州大学圣地亚哥分校) Amazon(亚马逊)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SWAP通过逐步自适应惩罚减少推理链长度并提升准确性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18672 2026-03-03 cs.LG cs.AI cs.CL 85%

Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks

混合专家语言模型在推理任务中的最优稀疏性

Taishi Nakamura, Satoki Ishikawa, Masaki Kawamura, Takumi Okamoto, Daisuke Nohara, Jun Suzuki, Rio Yokota

机构 * Institute of Science Tokyo(东京科学研究院) NII LLMC(国家信息研究所语言模型中心) Tohoku University(东北大学) RIKEN(日本研究机构)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过分析MoE模型的稀疏性对记忆和推理任务的影响,发现推理任务需在活跃FLOPs和TPP之间找到最优平衡。

Comments Accepted as an oral at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00405 2026-03-03 cs.LG cs.AI 81%

UME-R1: Exploring Reasoning-Driven Generative Multimodal Embeddings

UME-R1: 探索基于推理的生成多模态嵌入

Zhibin Lan, Liqiang Niu, Fandong Meng, Jie Zhou, Jinsong Su

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) WeChat AI, Tencent Inc, China(腾讯公司微信AI部门) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 UME-R1通过生成嵌入和强化学习提升多模态嵌入性能,实现判别与生成嵌入的互补,展现生成嵌入在推理和下游任务中的优势。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08427 2026-03-03 cs.CL cs.LG 81%

Silence the Judge: Reinforcement Learning with Self-Verifier via Latent Geometric Clustering

沉默法官:通过潜在几何聚类的自我验证强化学习

Nonghai Zhang, Weitao Ma, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Jingwen Xu

机构 * Meituan(美团) Peking University(北京大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 测试时计算 :verifier(title);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Latent-GRPO框架,通过潜在空间几何聚类生成内在奖励,提升大语言模型推理性能并加速训练过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05132 2026-03-03 cs.CL cs.AI cs.LG 80%

Training Large Language Models To Reason In Parallel With Global Forking Tokens

训练大型语言模型以并行推理与全局分叉标记

Sheng Jia, Xiao Wang, Shiva Prasad Kasiviswanathan

机构 * University of Toronto(多伦多大学) Amazon(亚马逊) Vector Institute(向量研究所)

专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SSFT和GFPO方法,通过集合基于的损失和双射匹配,提升大型语言模型在并行推理中的多样性和准确性,从而在数学推理和代码生成任务中取得优于传统SFT的性能。

Comments Accepted at ICLR 2026

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026), https://openreview.net/forum?id=xBQvvkg4Wc

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01143 2026-03-03 cs.CV cs.AI 79%

TC-SSA: Token Compression via Semantic Slot Aggregation for Gigapixel Pathology Reasoning

基于语义槽聚合的token压缩:用于十亿像素病理推理

Zhuo Chen, Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) University of Nottingham NingBo(诺丁汉大学宁波学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 TC-SSA通过语义槽聚合实现token压缩,提升十亿像素病理推理的效率与诊断性能

Comments 8 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00381 2026-03-03 cs.CR cs.AI cs.SY eess.SY 79%

Verifier-Bound Communication for LLM Agents: Certified Bounds on Covert Signaling

用于LLM代理的验证器绑定通信:对隐蔽信号的认证界限

Om Tailor

机构 * umd(马里兰大学)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 本文提出CLBC协议,通过验证器绑定通信限制LLM代理的隐蔽信号,确保安全性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03605 2026-03-03 cs.AI cs.LG stat.ML 73%

Understanding the Role of Training Data in Test-Time Scaling

理解训练数据在测试时扩展中的作用

Adel Javanmard, Baharan Mirzasoleiman, Vahab Mirrokni

机构 * University of Southern California(南加州大学) Google Research(谷歌研究) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了训练数据对测试时扩展性能的影响,发现增加计算量可减少上下文长度并提升模型表现,但若训练数据缺乏必要技能则可能损害性能。

Comments 25 pages, 5 figures, accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01494 2026-03-03 cs.SE cs.AI cs.CR cs.LG 62%

Inference-Time Safety For Code LLMs Via Retrieval-Augmented Revision

通过检索增强的修订实现代码LLM的推理时安全性

Manisha Mukherjee, Vincent J. Hellendoorn

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过检索增强的修订机制提升代码LLM的推理时安全性,提高生成代码的安全性并减少漏洞。

Comments Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI: Interpretability, Robustness, and Safety Across Modalities

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24302 2026-03-03 cs.CL 57%

Lookahead Tree-Based Rollouts for Enhanced Trajectory-Level Exploration in Reinforcement Learning with Verifiable Rewards

基于前瞻树的rollouts用于增强强化学习中轨迹层面的探索

Shangyu Xing, Siyuan Wang, Chenyuan Yang, Xinyu Dai, Xiang Ren

机构 * Nanjing University(南京大学) University of Southern California(南加州大学) Fudan University(复旦大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 基于前瞻树的rollouts通过促进轨迹多样性提升强化学习中策略学习效率

详情

展开后加载摘要…

URL PDF HTML 收藏