Interpretability as Alignment: Making Internal Understanding a Design Principle
可解释性作为对齐:使内部理解成为设计原则
机构 * Lexsi Labs(Lexsi实验室)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出将可解释性作为设计原则,通过机理可解释性构建私营AI治理的基础设施,实现技术可靠性与制度问责的结合。
Comments Accepted at the first EurIPS Workshop on Private AI Governance