arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Amazon(亚马逊)

2026-08-21 至 2026-08-21 共收录 2
2608.19920 2026-08-21 cs.CL 新提交

Learning how to Forget: Fine-tuning for Long-Context Sparse Attention

学习如何遗忘:面向长上下文稀疏注意力的微调

Matthias Seeger, Zeyu Zhang, Vihang Patil, Konstantinos Benidis, Sebastian Schelter

机构 * Amazon Web Services(亚马逊网络服务) University of Amsterdam(阿姆斯特丹大学) Amazon(亚马逊) Technical University Berlin(柏林工业大学)

AI总结 本文提出一种适配任意KV缓存策略的稀疏注意力模型微调方法,仅需中等硬件预算,性能优于精确注意力训练模型,还提供H2O稀疏注意力高效实现及开源库KeysAndValues支持。

Comments 39 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19351 2026-08-21 cs.LG 新提交

Uncovering the Limits of Proof Sharing for Neural Networks

揭示神经网络证明共享的局限性

Kanak Das, Shubham Ugare, Bor-Yuh Evan Chang, Sasa Misailovic, Gagandeep Singh, Manu Sridharan

机构 * University of California, Riverside(加州大学河滨分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Colorado Boulder(科罗拉多大学博尔德分校) Amazon(亚马逊公司)

AI总结 本研究系统探究神经网络证明共享的局限性,提出联合稳定神经元指标解释模板包含率差异,研发FastCert技术,在$L_0$-验证任务中较现有模板复用技术实现平均1.13倍加速。

Comments To appear at the 33rd Static Analysis Symposium (SAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏