Double-P: Hierarchical Top-P Sparse Attention for Long-Context LLMs
Double-P: 分层Top-P稀疏注意力机制用于长上下文LLM
机构 * ucsd(加州大学圣迭戈分校) ; umich(密歇根大学) ; qualcomm(高通AI研究) ; nvidia
AI总结 Double-P通过分层Top-P稀疏注意力机制,优化长上下文LLM的解码效率,实现更高的准确性和更快的处理速度。
高校专区
Double-P: 分层Top-P稀疏注意力机制用于长上下文LLM
机构 * ucsd(加州大学圣迭戈分校) ; umich(密歇根大学) ; qualcomm(高通AI研究) ; nvidia
AI总结 Double-P通过分层Top-P稀疏注意力机制,优化长上下文LLM的解码效率,实现更高的准确性和更快的处理速度。