MiLe Loss: a New Entropy-Weighed Loss for Mitigating the Bias of Learning Difficulties in Large Language Models
MiLe Loss:一种新的熵加权损失,用于减轻大语言模型在学习困难方面的偏差
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) ; Kuaishou Technology(快手科技) ; Tsinghua University(清华大学)
AI总结 MiLe Loss通过熵加权机制减轻大语言模型在学习困难方面的偏差,提升模型对难学标记的关注度,从而在下游任务中取得更好的表现。
Comments This paper has been accepted by NAACL 2024