Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability
大语言模型中的道德敏感性:通过行为剖析和机制可解释性对上下文偏见进行分层评估
Yash Aggarwal, Atmika Gorti, Vinija Jain, Aman Chadha, Krishnaprasad Thirunarayan, Manas Gaur
机构
*
University of Maryland, College Park(马里兰大学学院公园分校)
;
Purdue University(普渡大学)
;
Meta
;
Apple(苹果公司)
;
Wright State University(怀特州立大学)
;
University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)
Journal refProceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea