Building Interpretable Models for Moral Decision-Making
构建道德决策的可解释模型
机构 * Lossfunk ; Ashoka University(阿什oka大学)
AI总结 本文提出了一种定制的Transformer模型,用于研究神经网络在道德决策中的表现,并通过可解释性技术揭示了道德推理的分布特性。
Comments 8 pages, 4 figures, accepted to AAAI'26 Machine Ethics Workshop