Changling Li, Terry Jingchen Zhang, Jie Zhang, Zhijing Jin, Sahar Abdelnabi, Maksym Andriushchenko
机构
*
ETH Zürich(苏黎世联邦理工学院)
;
ELLIS Institute Tübingen(图宾根ELLIS研究所)
;
Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究院)
;
Tübingen AI Center(图宾根人工智能中心)
;
University of Toronto & Vector Institute(多伦多大学及向量研究所)
;
EuroSafeAI(欧洲安全人工智能)
SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting
SCOPE: 信号校准的在线策略蒸馏增强与双路径自适应加权
Binbin Zheng, Xing Ma, Yiheng Liang, Jingqing Ruan, Xiaoliang Fu, Kepeng Lin, Benchang Zhu, Ke Zeng, Xunliang Cai
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Meituan LongCat Interaction Team(美团 LongCat 交互团队)
;
Nanjing University(南京大学)
;
Fudan University(复旦大学)
;
Huazhong University of Science and Technology(华中科技大学)
When Single Answer Is Not Enough: Rethinking Single-Step Retrosynthesis Benchmarks for LLMs
当单一答案不够时:重新思考面向大语言模型的单步逆合成基准
Bogdan Zagribelnyy, Ivan Ilin, Maksim Kuznetsov, Nikita Bondarev, Mathieu Reymond, Roman Schutski, Thomas MacDougall, Rim Shayakhmetov, Zulfat Miftakhutdinov, Mikolaj Mizera, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov
机构
*
University of Pennsylvania(宾夕法尼亚大学)
;
New York University(纽约大学)
;
Indiana University, Bloomington(印第安纳大学,布卢明顿)
;
Northeastern University(东北大学)
;
University College London(伦敦大学学院)
DDX-TRACE: A Benchmark for Medical Diagnostic Trajectories in VLMs
DDX-TRACE: 视觉语言模型中医学诊断轨迹的基准
Jiazhen Pan, Weixiang Shen, Jun Li, Julian Canisius, Felix Bitzer, Paula Roßmüller, Jiancheng Yang, Virginie Kreutzinger, Daniel Rueckert, Benedikt Wiestler
机构
*
Technical University of Munich(慕尼黑技术大学)
;
TUM University Hospital(TUM大学医院)
;
Munich Center for Machine Learning(慕尼黑机器学习中心)
;
LMU Munich(慕尼黑大学)
;
Aalto University(阿尔托大学)
;
Imperial College London(伦敦帝国学院)
WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform
WorldArena 2.0: 扩展模态、功能和平台的具身世界模型基准测试
Yu Shang, Yinzhou Tang, Yiding Ma, Zhuohang Li, Lei Jin, Weikang Su, Xin Jin, Zhaolu Wang, Ziyou Wang, Xin Zhang, Haisheng Su, Weizhen He, Wei Wu, Haoyi Duan, Gordon Wetzstein, Xihui Liu, Dhruv Shah, Zhaoxiang Zhang, Zhibo Chen, Jun Zhu, Yonghong Tian, Tat-Seng Chua, Wenwu Zhu, Chen Gao, Yong Li
机构
*
Tsinghua University(清华大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Zhejiang University(浙江大学)
;
Stanford University(斯坦福大学)
;
The University of Hong Kong(香港大学)
;
Princeton University(普林斯顿大学)
;
Chinese Academy of Sciences(中国科学院)
;
University of Science and Technology of China(中国科学技术大学)
;
Peking University(北京大学)
;
National University of Singapore(新加坡国立大学)
SVAG-Bench: A Large-Scale Benchmark for Multi-Instance Spatio-temporal Video Action Grounding
SVAG-Bench:多实例时空视频动作定位的大规模基准
Tanveer Hannan, Shuaicong Wu, Mark Weber, Suprosanna Shit, Jindong Gu, Rajat Koner, Aljoša Ošep, Laura Leal-Taixé, Thomas Seidl
机构
*
LMU Munich(慕尼黑大学)
;
MCML
;
Technical University of Munich(慕尼黑技术大学)
;
University of Zurich(苏黎世大学)
;
University of Oxford(牛津大学)
;
Amazon(亚马逊)
;
NVIDIA(英伟达)
RealICU: Do LLM Agents Understand Long-Context ICU Data? A Benchmark Beyond Behavior Imitation
RealICU: 大语言模型能否理解长期上下文ICU数据?一个超越行为模仿的基准测试
Chengzhi Shen, Weixiang Shen, Tobias Susetzky, Chen, Chen, Jun Li, Yuyuan Liu, Xuepeng Zhang, Zhenyu Gong, Daniel Rueckert, Jiazhen Pan
机构
*
Technical University of Munich(慕尼黑技术大学)
;
TUM University Hospital(TUM大学医院)
;
LMU Munich(慕尼黑大学)
;
University of Sheffield(谢菲尔德大学)
;
University of Oxford(牛津大学)
;
Zhongshan Hospital Fudan University(复旦大学中山医院)
;
Sun Yat-sen University Cancer Center(中山大学肿瘤中心)
;
Imperial College London(伦敦帝国学院)
;
Munich Center for Machine Learning(慕尼黑机器学习中心)
;
relAI – Konrad Zuse School of Excellence in Reliable AI(relAI – 卡诺夫茨卓越可靠人工智能学校)