Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding
通过稀疏自推测解码加速大规模推理模型推理
专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG
AI总结 SparseSpec通过自推测解码框架和稀疏注意力机制,显著提升了大规模推理模型的推理效率和内存利用率。