机构
*
Beijing Academy of Artificial Intelligence (BAAI), China(北京人工智能研究院)
;
Institute of Information Engineering, Chinese Academy of Sciences, China(信息工程研究所)
;
Beijing University of Technology, China(北京理工大学)
ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models
ZeroBench:当代大型多模态模型的一个不可能的视觉基准测试
Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Florian Langer, Vyas Raina, Vatsal Raina, Hanyi Xiong, Vishaal Udandarao, Jingyi Lu, Shiyang Chen, Sam Purkis, Tianshuo Yan, Wenye Lin, Gyungin Shin, Qiaochu Yang, Anh Totti Nguyen, David I. Atkinson, Aaditya Baranwal, Alexandru Coca, Mikah Dang, Sebastian Dziadzio, Jakob D. Kunz, Kaiqu Liang, Alexander Lo, Brian Pulfer, Steven Walton, Charig Yang, Kai Han, Samuel Albanie
机构
*
University of Cambridge(剑桥大学)
;
University of Alberta(阿尔伯塔大学)
;
The University of Hong Kong(香港大学)
;
University of Oxford(牛津大学)
;
Northeastern University(东北大学)
;
Astadeus
;
College of Southern Maryland(马里兰州南部学院)
;
University of Geneva(日内瓦大学)
;
University of Oregon(俄勒冈大学)
CoopEval: Benchmarking Cooperation-Sustaining Mechanisms and LLM Agents in Social Dilemmas
CoopEval:社会困境中合作维持机制与LLM代理的基准测试
Emanuel Tewolde, Xiao Zhang, David Guzman Piedrahita, Vincent Conitzer, Zhijing Jin
机构
*
Carnegie Mellon University
;
Foundations of Cooperative AI Lab (FOCAL)
;
Jinesis Lab, University of Toronto \& Vector Institute
;
ETH Z\" u rich
;
Max Planck Institute for Intelligent Systems, T\" u bingen, Germany
CommentsAccepted to ICML 2026. This version updates the ICML submission with an optimized model checkpoint. Project page: https://omni-diffusion.github.io