CommentsWithdrawn by the authors. The authors identified substantive errors that affect the interpretation of the results and the support for the main conclusions. The current version should not be relied upon
机构
*
Department of Data Science and Artificial Intelligence, Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学)
;
Department of Applied Mathematics, Hong Kong Polytechnic University(应用数学系,香港理工大学)
ClawEnvKit: Automatic Environment Generation for Claw-Like Agents
ClawEnvKit:爪型智能体的自动环境生成
Xirui Li, Ming Li, Ion Stoica, Cho-Jui Hsieh, Tianyi Zhou
机构
*
University of Maryland(马里兰大学)
;
Arena
;
University of California, Berkley(伯克利大学)
;
University of California, Los Angeles(洛杉矶大学)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
IMProofBench: Benchmarking AI on Research-Level Mathematical Proof Generation
IMProofBench:在研究级数学证明生成上对人工智能进行基准测试
Johannes Schmitt, Gergely Bérczi, Jasper Dekoninck, Jeremy Feusi, Tim Gehrunger, Raphael Appenzeller, Pieter Belmans, Alessio Bottini, Jim Bryan, João Camarneiro, Ana Cannas da Silva, Niklas Canova, Ana-Maria Castravet, Timo de Wolff, Claudio Fontanari, Filippo Gaia, Baran Hashemi, Daniel Holmes, David Holmes, Aitor Iribar Lopez, Victor Jaeck, Martina Jørgensen, Steven Kelk, Martijn Kool, Stefan Kuhlmann, Adam Kurpisz, Johannes Lengler, Chiara Meroni, Ingmar Metzler, Martin Möller, Samuel Muñoz-Echániz, David Muñoz-Lahoz, Robert Nowak, Georg Oberdieck, Daniel Platt, Dylan Possamaï, Gabriel Ribeiro, Aluna Rizzoli, Daria Sakhanda, Raúl Sánchez Galán, Zheming Sun, Diaaeldin Taha, Josef Teichmann, Richard P. Thomas, Henk van der Pol, Michel van Garrel, Charles Vial, Ignacio Barros, Benjamin Doerr, Peter Grünwald, Henry Liu, David Martins, Aleksandar Mijatović, Sergej Monavari, Marc Roth, Patrick Schnider, Yannik Schuler, Pim Spelier, Yuuji Tanaka, Ronald van Luijk
机构
*
ETH Zurich(苏黎世联邦理工学院)
;
Aarhus University(奥胡斯大学)
Commentsv2: benchmark expanded from 39 to 77 problems; evaluation extended to 14 models including GPT-5.4, Gemini 3.1 Pro, and Claude Opus 4.6; new analyses (IRT-based score aggregation, inter-rater reliability, tool/token usage, non-agentic ablation); contributor author list updated
When Contextual Inference Fails: Cancelability in Interactive Instruction Following
当情境推理失效时:交互指令跟随中的可取消性
Natalia Bila, Kata Naszádi, Alexandra Mayn, Christof Monz
机构
*
Language Technology Lab, University of Amsterdam(阿姆斯特丹大学语言技术实验室)
;
Department of Language Science and Technology, Saarland University(萨尔兰大学语言科学与技术系)
The Bidding Games: Reinforcement Learning for MEV Extraction on Polygon Blockchain
竞拍博弈:Polygon区块链上用于MEV提取的强化学习
Andrei Seoev, Leonid Gremyachikh, Anastasiia Smirnova, Yash Madhwal, Alisa Kalacheva, Dmitry Belousov, Ilia Zubov, Aleksei Smirnov, Denis Fedyanin, Vladimir Gorgadze, Yury Yanovich
机构
*
Independent Researcher(独立研究者)
;
Moscow Institute of Physics and Technology(莫斯科物理技术学院)
;
Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)
;
HSE University(俄罗斯伏尔加格勒国立高等经济大学)
Commentsv2: two-judge reanalysis of the decomposition-RAG ablation (groundedness advantage +1.15 to +0.15); H3a adjudicated; one registered-plan deviation disclosed; artifact deposit at osf.io/j37b8; title corrected