机构
*
Nantong University(南通大学)
;
Chongqing University of Post and Telecommunications(重庆邮电大学)
;
China Southern Power Grid Company Limited(中国南方电网有限责任公司)
;
Meituan(美团)
Entropy Sentinel: Probing Entropy Traces for LLM Monitoring
熵哨兵:基于STEM解码熵迹的连续LLM准确性监控
Pedro Memoli Buffa, Luciano Del Corro
机构
*
Departamento de Matematica, FCEyN Universidad de Buenos Aires(数学系,布宜诺斯艾利斯大学)
;
ELIAS Lab, Departamento de Ingeniería Universidad de San Andres(ELIAS实验室,圣安德烈斯大学)
Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs
通过内部归因图对大语言模型越狱进行机制性可解释性研究
Anupam Wagle, Ifrat Ikhtear Uddin, Chaowei Zhang, Longwei Wang
机构
*
Department of Computer Science, University of South Dakota(南达科他大学计算机科学系)
;
School of Information and Artificial Intelligence, Yangzhou University(扬州大学信息与人工智能学院)
专题命中
知识编辑与模型理解
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI