Perplexity Can Miss SAE Feature Damage Under Quantization
量化如何改变可解释特征:语言模型的稀疏自编码器分析
机构 * University of Michigan(密歇根大学)
AI总结 通过稀疏自编码器分析,发现量化导致语言模型中的可解释特征逐渐退化,且任务指标无法完全反映这种损伤,量化与幅度剪枝共享相似的损伤模式。
Comments 12 Pages of Content, Submitted to TMLR
期刊&会议
Transactions on Machine Learning Research · 期刊 · Machine Learning
量化如何改变可解释特征:语言模型的稀疏自编码器分析
机构 * University of Michigan(密歇根大学)
AI总结 通过稀疏自编码器分析,发现量化导致语言模型中的可解释特征逐渐退化,且任务指标无法完全反映这种损伤,量化与幅度剪枝共享相似的损伤模式。
Comments 12 Pages of Content, Submitted to TMLR
Twin: 无需验证的深度同质分类器学习率和权重衰减调优
机构 * ARTORG Center, University of Bern(伯恩大学ARTORG中心)
AI总结 提出Twin方法,利用同质网络的边界最大化动态和训练-测试损失间的经验缩放定律,实现无需验证集的学习率和权重衰减调优,在37个图像分类配置上达到与Oracle基线1.28%的平均绝对误差。
Comments Accepted at TMLR