The Horcrux: Mechanistically Interpretable Task Decomposition for Detecting and Mitigating Reward Hacking in Embodied AI Systems
霍克鲁斯:用于检测和缓解具身AI系统中奖励黑客行为的可解释任务分解
Subramanyam Sahoo, Jared Junkin
机构
*
Berkeley AI Safety Initiative (BASIS) UC Berkeley(伯克利人工智能安全计划(BASIS)伯克利大学)
;
Department of Electrical and Computer Engineering Johns Hopkins University(电气与计算机工程系约翰霍普金斯大学)
Learning to Upscale 3D Segmentations in Neuroimaging
在神经影像中学习提升3D分割
Xiaoling Hu, Peirong Liu, Dina Zemlyanker, Jonathan Williams Ramirez, Oula Puonti, Juan Eugenio Iglesias
机构
*
Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院)
;
Department of ECE, Johns Hopkins University(约翰霍普金斯大学电子工程系)
;
Danish Research Centre for Magnetic Resonance, Copenhagen University Hospital(丹麦磁共振研究所以及哥本哈根大学医院)
;
Hawkes Institute, University College London(霍克斯研究所和伦敦大学学院)
;
Computer Science and AI Laboratory, Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室)