Learning how to Forget: Fine-tuning for Long-Context Sparse Attention
学习如何遗忘:面向长上下文稀疏注意力的微调
机构 * Amazon Web Services(亚马逊网络服务) ; University of Amsterdam(阿姆斯特丹大学) ; Amazon(亚马逊) ; Technical University Berlin(柏林工业大学)
AI总结 本文提出一种适配任意KV缓存策略的稀疏注意力模型微调方法,仅需中等硬件预算,性能优于精确注意力训练模型,还提供H2O稀疏注意力高效实现及开源库KeysAndValues支持。
Comments 39 pages, no figures