Make Mechanistic Interpretability Auditable: A Call to Develop Guidelines via Continuous Collaborative Reviewing
使机制可解释性可审计:呼吁通过持续协作评审制定指南
机构 * University of Delaware(德克萨斯大学) ; University of Oxford(牛津大学) ; ThoughtWorks
AI总结 针对机制可解释性(MI)实验缺乏标准化审计系统的问题,提出通过持续协作评审平台、专家验证指南和基于来源的审计系统来建立可审计框架,以提升其在AI安全等高风险领域的可信度。
Comments Accepted at ACL 2026 main conference