arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

TCS-BENCH:评估最先进生成式AI理论计算机科学研究能力的基准

TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability

Vincent Cohen-Addad, Dimitris Paparas, Ernest van Wijland, Max Springer, Julien Canitrot-Paradis, Honghao Lin, David Woodruff, Adarsh Kumarappan, Rajesh Jayaram, Rudrajit Das, Lalit Jain, Ola Svensson, Silvio Lattanzi, Mislav Balunovic, Theophane Weber, Vahab Mirrokni

arXiv 2608.09538首次发表:更新:

发表机构

Google Research; CNRS; IRIF; Université Paris-Cité; Princeton University; Université Paris-Saclay; CEA; California Institute of Technology; Google DeepMind(谷歌研究院; 法国国家科学研究中心; 法国信息学研究所; 巴黎城市大学; 普林斯顿大学; 巴黎萨克雷大学; 法国原子能和替代能源委员会; 加州理工学院; 谷歌DeepMind)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

研究人员推出TCS-Bench基准,基于STOC、FOCS、SODA论文的定理证明任务评估LLMs,结合验证智能体,参考验证器在专家标注集准确率超90%,为评估生成式AI的TCS研究能力提供工具

AI 中文摘要

我们推出TCS-Bench,这是一个用于评估大型语言模型(LLMs)在研究级理论计算机科学(TCS)证明生成方面能力的基准。TCS-Bench包含来自顶级理论计算机科学会议(STOC、FOCS和SODA)发表论文中的定理证明任务,每个任务都提供了推导目标结果自包含证明所需的必要上下文。我们在该基准上评估最先进的模型,通过验证智能体验证生成证明的正确性,并进一步针对一组目标陈述与生成证明对,将验证器与人类专家的证明判断进行基准测试。我们的参考验证器在专家标注集上实现了超过90%的准确率。

英文摘要

We introduce TCS-Bench, a benchmark for evaluating Large Language Models (LLMs) on research-level Theoretical Computer Science (TCS) proof generation. TCS-Bench consists of theorem-proving tasks from papers published at top theoretical computer science venues (STOC, FOCS, and SODA). Each task provides the necessary context to derive a self-contained proof for a target result. We evaluate state-of-the-art models on this benchmark. We verify the correctness of generated proofs via a verification agent, and further benchmark the verifier against human-expert proof judgements on a set of target statements and generated proofs pairs. Our reference verifier achieves over 90% accuracy on the expert labeled set.

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑