Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety
思维链可监控性:AI安全的新且脆弱的机会
Tomek Korbak, Mikita Balesni, Elizabeth Barnes, Yoshua Bengio, Joe Benton, Joseph Bloom, Mark Chen, Alan Cooney, Allan Dafoe, Anca Dragan, Scott Emmons, Owain Evans, David Farhi, Ryan Greenblatt, Dan Hendrycks, Marius Hobbhahn, Evan Hubinger, Geoffrey Irving, Erik Jenner, Daniel Kokotajlo, Victoria Krakovna, Shane Legg, David Lindner, David Luan, Aleksander Mądry, Julian Michael, Neel Nanda, Dave Orr, Jakub Pachocki, Ethan Perez, Mary Phuong, Fabien Roger, Joshua Saxe, Buck Shlegeris, Martín Soto, Eric Steinberger, Jasmine Wang, Wojciech Zaremba, Bowen Baker, Rohin Shah, Vlad Mikulik
机构
*
UK AI Security Institute(英国人工智能安全研究所)
;
Apollo Research(阿波罗研究)
;
METR
;
University of Montreal(蒙特利尔大学)
;
Mila
;
Anthropic
;
OpenAI(开放人工智能研究所)
;
Google DeepMind(谷歌DeepMind)
;
Truthful AI
;
UC Berkeley(伯克利大学)
;
Center for AI Safety(人工智能安全中心)
;
AI Futures Project(人工智能未来项目)
;
Amazon(亚马逊)
;
Scale AI
;
Magic
;
Meta
;
Redwood Research(红木研究)