Self-Speculation for Faster Reasoning Models
用于更快推理模型的自推测技术
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 该研究针对LLM推理延迟问题,提出无需训练的SSR自推测解码方法,结合思维链与后缀解码,在Qwen3.5、Gemma-4等模型上实现总生成延迟最高24.1%的相对提升。
高校专区
用于更快推理模型的自推测技术
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 该研究针对LLM推理延迟问题,提出无需训练的SSR自推测解码方法,结合思维链与后缀解码,在Qwen3.5、Gemma-4等模型上实现总生成延迟最高24.1%的相对提升。