Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework
Safe-SAIL: 通过稀疏自编码解释框架构建大语言模型的细粒度安全景观
Jiaqi Weng, Han Zheng, Hanyu Zhang, Ej Zhou, Qinqin He, Jialing Tao, Hui Xue, Zhixuan Chu, Xiting Wang
机构
*
Alibaba Group(阿里巴巴集团)
;
The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室)
;
Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)
;
Renmin University of China(中国人民大学)
Are Heterogeneous Graph Neural Networks Truly Effective for Node Classification? A Causal Perspective
异构图神经网络在节点分类中真的有效吗?因果视角
Xiao Yang, Xuejiao Zhao, Zhiqi Shen
机构
*
College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
;
Joint NTU-UBC Research Centre of Excellence in Active Living for the Elderly (LILY), Nanyang Technological University(老年人积极生活卓越研究中心(LILY),南洋理工大学)
;
Alibaba-NTU Singapore Joint Research Institute (ANGEL), Nanyang Technological University(阿里巴巴-南洋理工大学新加坡联合研究机构(ANGEL),南洋理工大学)