BAITBENCH: Measuring Agent Reward Hacking with Optional Shortcuts Planted in ML Tasks
BAITBENCH:通过植入ML任务中的可选捷径测量智能体的奖励黑客行为
Pradyumna Shyama Prasad, Meiri Anto, Leon Eshuijs, Julian Moncarz, Kaustubh Kislay, Juan J. Vazquez
机构
*
National University of Singapore(新加坡国立大学)
;
MIT(麻省理工学院)
;
Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)
;
University of Toronto(多伦多大学)
;
University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
;
Arb Research(Arb研究机构)
机构
*
Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Helmholtz-Zentrum Dresden-Rossendorf(德累斯顿-罗森多夫亥姆霍兹中心)
AutoREC: A reinforcement learning platform for equivalent circuit model generation
AutoREC:一种用于从电化学阻抗谱数据开发强化学习代理以生成等效电路模型的软件平台
Ali Jaberi, Yonatan Kurniawan, Robert Black, Shayan Mousavi M., Kabir Verma, Zoya Sadighi, Santiago Miret, Jason Hattrick-Simpers
机构
*
Clean Energy Innovation Research Center, National Research Council Canada(清洁能源创新研究中心,加拿大国家研究委员会)
;
Department of Material Science and Engineering, University of Toronto(材料科学与工程系,多伦多大学)
;
Cheriton School of Computer Science, University of Waterloo(计算机科学学院,滑铁卢大学)
机构
*
Ashoka University(阿肖克大学)
;
Mphasis AI and Applied Tech Lab(美斐西斯人工智能与应用技术实验室)
;
Koita Centre for Digital Health, Ashoka University(阿肖克大学科伊塔数字健康中心)
;
Institute for Future Health, UC Irvine(加州大学欧文分校未来健康研究所)
MURANO: Design, Run, and Reproduce Mechanistic Interpretability Experiments as Composable Pipelines
MURANO:将机械可解释性实验设计、运行与复现作为可组合流水线
Alireza Bayat Makou, Emirhan Böge, Phu Gia Hoang, Federico Tiblias, Jingcheng Niu, Subhabrata Dutta, Richard Eckart de Castilho, Iryna Gurevych
机构
*
Technical University of Darmstadt(达姆施塔特工业大学)
;
Cluster of Excellence “Reasonable Artificial Intelligence” (RAI)(“合理人工智能”卓越集群)
;
National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心ATHENE)
;
Zuse School ELIZA(楚思学校ELIZA)
;
Ubiquitous Knowledge Processing (UKP) Lab(普适知识处理实验室)