xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding
xPress:推测解码中扩散草稿模型的并行优化
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; IBM(国际商业机器公司(IBM))
AI总结 xPress是恢复扩散草稿模型因果依赖的并行优化方法,在Qwen3-8B的7个基准上,可提升推测解码的接受长度与端到端吞吐量。
大厂专区
xPress:推测解码中扩散草稿模型的并行优化
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; IBM(国际商业机器公司(IBM))
AI总结 xPress是恢复扩散草稿模型因果依赖的并行优化方法,在Qwen3-8B的7个基准上,可提升推测解码的接受长度与端到端吞吐量。
结构化递归混合器用于大规模并行序列生成
机构 * IBM
AI总结 本文提出了一种结构化递归混合器架构,能够在训练时实现序列并行表示与推理时的递归表示之间的代数转换,从而在不依赖专用内核或设备特定内存管理的情况下提高训练效率、输入信息容量和推理吞吐量。