TrainSDC: Characterizing and Mitigating Silent Data Corruption in Large Language Model Training
TrainSDC:大型语言模型训练中静默数据损坏的特征表征与缓解
机构 * Zhejiang University(浙江大学) ; Huawei(华为)
AI总结 研究针对LLM训练的SDC问题,系统表征其在Transformer训练中的脆弱性,提出TrainSDC框架,经实验验证可有效缓解SDC且运行时开销较低。
Comments 12 pages, 5 figures, and 6 tables. Includes an appendix with additional experiments