arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-07 至 2026-01-07 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 4 篇

2601.02972 2026-01-07 cs.CL cs.AI 86%

Correct, Concise and Complete: Multi-stage Training For Adaptive Reasoning

正确、简洁且完整:多阶段训练用于自适应推理

Nathanaël Carraz Rakotonirina, Ren Pang, Neha Anna John, Michael Bohlke-Schneider, Momchil Hardalov

机构 * Universitat Pompeu Fabra(庞培法布拉大学) AWS AI Labs(AWS人工智能实验室) Amazon AGI(亚马逊人工智能实验室)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多阶段训练方法,通过结合监督微调与强化学习,有效减少推理响应长度并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22322 2026-01-07 cs.CL cs.AI cs.CV cs.LG cs.MA 67%

SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents

SmartSnap: 为自主代理的主动证据寻求

Shaofei Cai, Yulei Qin, Haojia Lin, Zihan Xu, Gang Li, Yuchen Shi, Zongyi Li, Yong Mao, Siqi Cai, Xiaoyu Tan, Yitao Liang, Ke Li, Xing Sun

机构 * Tencent(腾讯)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SmartSnap通过主动证据寻求机制,使自主代理在复杂任务中实现高效自我验证,提升性能并增强可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17417 2026-01-07 cs.LG 61%

Aha Moment Revisited: Are VLMs Truly Capable of Self Verification in Inference-time Scaling?

顿悟时刻再审视:VLMs在推理时间缩放中真的能自我验证吗?

Mingyuan Wu, Meitang Li, Jingcheng Yang, Jize Jiang, Kaizhuo Yan, Zhaoheng Li, Hanchao Yu, Minjia Zhang, Klara Nahrstedt

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Meta

专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.LG

AI总结 本研究发现VLMs在推理时间缩放中自我验证效果有限,生成能力优于验证策略,且视觉信息整合不足。

Comments Neurips 2025 Multimodal Algorithmic Reasoning Workshop Oral. In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02736 2026-01-07 cs.SE cs.AI 57%

Hypothesize-Then-Verify: Speculative Root Cause Analysis for Microservices with Pathwise Parallelism

假设-验证:基于路径并行的微服务推测根本原因分析

Lingzhe Zhang, Tong Jia, Yunpeng Zhai, Leyi Pan, Chiming Duan, Minghua He, Pei Xiao, Ying Li

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 SpecRCA通过假设-验证范式提升微服务系统根本原因分析的准确性和效率。

Comments accepted by ICSE-NIER'26

详情

展开后加载摘要…

URL PDF HTML 收藏