EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding
EdgeXpert:一种基于混合专家与推测解码的内存高效型大语言模型推理边缘设备
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 EdgeXpert是一款软硬件协同设计的LLM加速器,通过优化预填充与解码阶段的专家处理,解决推测解码与MoE的兼容性问题,在降低延迟与能耗的同时维持精度,适用于边缘设备的LLM推理。
Comments Accepted at the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)