Flux Attention: Context-Aware Hybrid Attention for Efficient LLMs Inference
流注意机制:一种面向高效大语言模型推理的上下文感知混合注意机制
机构 * Baidu Inc(百度公司)
AI总结 本文提出流注意机制,通过动态层级路由优化注意力计算,提升大语言模型在长上下文场景下的推理效率,实验显示在预填和解码阶段速度提升达2.8倍和2.0倍。
大厂专区
流注意机制:一种面向高效大语言模型推理的上下文感知混合注意机制
机构 * Baidu Inc(百度公司)
AI总结 本文提出流注意机制,通过动态层级路由优化注意力计算,提升大语言模型在长上下文场景下的推理效率,实验显示在预填和解码阶段速度提升达2.8倍和2.0倍。