Pushing the Envelope of LLM Inference with Ultra-Low-Bit Quantized Models
推动AI-PC和英特尔GPU上LLM推理的边界
机构 * Intel Corporation(英特尔公司)
AI总结 本文通过优化CPU和GPU上的低比特推理框架,实现了在AI-PC和英特尔Xe GPU上更高效的LLM推理,提升了端到端延迟和GEMM性能。
大厂专区
推动AI-PC和英特尔GPU上LLM推理的边界
机构 * Intel Corporation(英特尔公司)
AI总结 本文通过优化CPU和GPU上的低比特推理框架,实现了在AI-PC和英特尔Xe GPU上更高效的LLM推理,提升了端到端延迟和GEMM性能。
ReLATE:通过安全高效学习稀疏编码加速张量分解
机构 * Intel Corporation(英特尔公司) ; University of Erlangen-Nürnberg(埃尔兰根-纽伦堡大学) ; University of Oregon(俄勒冈大学)
AI总结 ReLATE是一种学习增强框架,通过混合强化学习算法发现安全高效的稀疏编码,可在低开销下加速张量分解,在真实稀疏张量上较专家设计格式最高提速2倍。
Comments Accepted to SC 2026