arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Transactions on Machine Learning Research · 期刊 · Machine Learning

2025-07-28 至 2025-07-28 共收录 1
2502.05209 2025-07-28 cs.CR cs.AI

Model Tampering Attacks Enable More Rigorous Evaluations of LLM Capabilities

Zora Che, Stephen Casper, Robert Kirk, Anirudh Satheesh, Stewart Slocum, Lev E McKinney, Rohit Gandikota, Aidan Ewart, Domenic Rosati, Zichu Wu, Zikui Cai, Bilal Chughtai, Yarin Gal, Furong Huang, Dylan Hadfield-Menell

机构 * University of Maryland(马里兰大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) UK AI Security Institute(英国人工智能安全研究所) University of Toronto(多伦多大学) Northeastern University(东北大学) Haize Labs(Haize实验室) Dalhousie University(达尔豪斯大学) University of Waterloo(滑铁卢大学) University of Oxford(牛津大学) MIT(麻省理工学院)

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏