arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-09-01 至 2026-09-01 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 6 篇

2608.28771 2026-09-01 cs.LG 新提交 87%

ERR+: Sequential Entropy Resolution for Efficient and Decisive LLM Reasoning

ERR+: 用于高效且果断的LLM推理的顺序熵分辨率

Xin Jiang, Minhao Wang, Wen Wu, Zhentao Xie, Shangheng Du, Jinxin Shi, Jiabao Zhao

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) ByteDance(字节跳动)

专题命中 代码与定理证明 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.LG

AI总结 该研究针对RLVR方法对推理过程质量指导不足的问题,提出两阶段RLVR框架ERR+,通过顺序优化熵缓解奖励与稳健相对效率奖励,在五个数据集上实现了LLM推理准确率与简洁性的提升。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09538 2026-09-01 cs.CL cs.AI 版本更新 62%

TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability

TCS-BENCH:评估最先进生成式AI理论计算机科学研究能力的基准

Vincent Cohen-Addad, Dimitris Paparas, Ernest van Wijland, Max Springer, Julien Canitrot-Paradis, Honghao Lin, David Woodruff, Adarsh Kumarappan, Rajesh Jayaram, Rudrajit Das, Lalit Jain, Ola Svensson, Silvio Lattanzi, Mislav Balunovic, Theophane Weber, Vahab Mirrokni

机构 * Google Research(谷歌研究院) CNRS(法国国家科学研究中心) IRIF(法国信息学研究所) Université Paris-Cité(巴黎城市大学) Princeton University(普林斯顿大学) Université Paris-Saclay(巴黎萨克雷大学) CEA(法国原子能和替代能源委员会) California Institute of Technology(加州理工学院) Google DeepMind(谷歌DeepMind)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 研究人员推出TCS-Bench基准,基于STOC、FOCS、SODA论文的定理证明任务评估LLMs,结合验证智能体,参考验证器在专家标注集准确率超90%,为评估生成式AI的TCS研究能力提供工具

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30543 2026-09-01 cs.AI cs.SE 新提交 57%

Designing an Auditable LLM-Supported Workflow for Qualitative Thematic Analysis

设计一种可审计的、由大语言模型(LLM)支持的定性主题分析工作流程

Nadia Jul Jeldtoft, Tariq Yousef

机构 * University of Southern Denmark(南丹麦大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种可审计的LLM支持的定性主题分析工作流程,推导五项设计原则,构建两阶段工作流程,经半结构化丹麦访谈记录评估,其编码覆盖与人工相当,主题更紧凑,可扩展适配不同LLM与领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13387 2026-09-01 cs.CL cs.GT 版本更新 57%

Make an Offer They Can't Refuse: Grounding Bayesian Persuasion in Real-World Dialogues without Pre-Commitment

提出无法拒绝的方案:在无预承诺的真实对话中建立贝叶斯说服

Buwei He, Yang Liu, Zhaowei Zhang, Zixia Jia, Yang Yu, Huijia Wu, Zhaofeng He, Zilong Zheng, Yipeng Kang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Peking University(北京大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对LLM策略性说服的不足,提出无预承诺的贝叶斯说服机制,实现两种变体并经多LLM与人类评估,验证其性能提升源于贝叶斯推理,且微调可缩小模型性能差距。

Comments Accepted as EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30803 2026-09-01 cs.LO cs.SE 新提交 50%

Schwarz: Solver-Aware Agentic Program Verification

Schwarz:感知求解器的智能体程序验证工具

Jingyu Ke (Shanghai Jiao Tong University), Ling-I Wu (Shanghai Jiao Tong University), Guoqiang Li (Shanghai Jiao Tong University)

专题命中 代码与定理证明 :verifier(abstract)

AI总结 本文提出感知求解器的智能体程序验证工具Schwarz,通过本地化修复任务等方法,在两类基准任务上分别实现95.2%、91.5%的解决率,验证了其有效性与可扩展性。

Comments 12 pages, 4 figures, 4 tables; preprint prepared in IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30635 2026-09-01 cs.GT 新提交 50%

Test-time Reinforcement Learning in Imperfect Information Games

非完美信息博弈中的测试时强化学习

Ondrej Kubicek, Viliam Lisy, Tuomas Sandholm

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本研究针对两人零和非完美信息博弈,提出将小工具博弈扩展至强化学习场景的策略梯度算法,通过隐式表示消除子博弈规模限制,经实验验证可提升策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏