Collaborative Large Language Model Inference via Resource-Aware Parallel Speculative Decoding
通过资源感知的并行推测解码实现协作式大语言模型推理
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG
AI总结 本文提出一种统一框架,通过多智能体深度强化学习优化用户关联和资源分配,实现高效的并行推测解码,减少端到端延迟28%以上,提升移动边缘计算中大语言模型服务的性能。