Comments15 pages, 3 figures. Reliability protocol and library (cua_reliability), completion verifier, and leakage-free held-out plus bootstrap evaluation harness are open-source
GrowthHacker: Automated Off-Policy Evaluation Optimization Using Code-Modifying LLM Agents
GrowthHacker: 使用代码修改型LLM代理的自动离线策略评估优化
Jie JW Wu, Ayanda Patrick Herlihy, Ahmad Saleem Mirza, Ali Afoud, Fatemeh Fard
机构
*
Michigan Technological University, Houghton(密歇根技术大学)
;
Birmingham City University(伯明翰城市大学)
;
University of British Columbia, Kelowna(不列颠哥伦比亚大学, 肯洛纳)
机构
*
University of Pennsylvania(宾夕法尼亚大学)
;
New York University(纽约大学)
;
Indiana University, Bloomington(印第安纳大学,布卢明顿)
;
Northeastern University(东北大学)
;
University College London(伦敦大学学院)
Beyond Self-Play and Scale: A Behavior Benchmark for Generalization in Autonomous Driving
超越自我博弈与规模:面向自动驾驶泛化的行为基准
Aron Distelzweig, Faris Janjoš, Andreas Look, Anna Rothenhäusler, Daniel Jost, Oliver Scheel, Raghu Rajan, Daphne Cornelisse, Eugene Vinitsky, Joschka Boedecker
机构
*
University of Freiburg(弗赖堡大学)
;
Bosch Center for Artificial Intelligence(博世人工智能中心)
;
Coburg University of Applied Sciences(科堡应用科学大学)
;
New York University(纽约大学)
AgentCollabBench: Diagnosing When Good Agents Make Bad Collaborators
AgentCollabBench: 评估好代理为何会成为差合作者
Aritra Mazumder, Shubhashis Roy Dipta, Nusrat Jahan Lia, Tanzila Khan, Kainat Raisa Hossain, Nehaa Shri, Shubhrangshu Debsarkar, Humayra Tasnim, Gour Gupal Talukder Shawon, Debjoty Mitra, Sumaiya Ahmed Rani, Al Jami Islam Anik, Al Nafeu Khan
机构
*
University of Utah(犹他大学)
;
University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)
;
University of Dhaka(达卡大学)
;
Vellore Institute of Technology(韦洛雷理工学院)
;
University of Virginia(弗吉尼亚大学)
;
Rajshahi University of Engineering and Technology(拉贾加赫尔工程与技术大学)
;
Shahjalal University of Science and Technology(沙赫jalal科学与技术大学)
;
BRAC University(BRAC大学)
;
Islamic University of Technology(伊斯兰技术大学)
;
Comilla University(科摩拉大学)
LABBench2: An Improved Benchmark for AI Systems Performing Biology Research
LABBench2:一种改进的AI系统进行生物研究的基准测试
Jon M Laurent, Albert Bou, Michael Pieler, Conor Igoe, Alex Andonian, Siddharth Narayanan, James Braza, Alexandros Sanchez Vassopoulos, Jacob L Steenwyk, Blake Lash, Andrew D White, Samuel G Rodriques
机构
*
Broad Institute, Cambridge, MA, USA(博德研究所,美国马萨诸塞州剑桥市)
Combee: Scaling Prompt Learning for Self-Improving Language Model Agents
Combee:用于自我改进语言模型代理的提示学习扩展
Hanchen Li, Runyuan He, Qizheng Zhang, Changxiu Ji, Qiuyang Mang, Xiaokun Chen, Lakshya A Agrawal, Wei-Liang Liao, Eric Yang, Alvin Cheung, James Zou, Kunle Olukotun, Ion Stoica, Joseph E. Gonzalez
机构
*
Vals AI
;
École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院)
;
Moscow Institute of Physics and Technology(莫斯科物理技术学院)
;
Indiana University, Bloomington(印第安纳大学布卢明顿分校)
;
Independent Researcher(独立研究员)
CommentsAccepted at ICLR 2026 Workshop: VerifAI-2: The Second Workshop on AI Verification in the Wild. Live leaderboard hosted here: https://www.vals.ai/benchmarks/proof_bench