Characterization of Request and Token Energy Costs for LLM Inference Workloads on GPU Platforms
GPU平台上大语言模型(LLM)推理工作负载的请求与令牌能耗特征
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 该研究构建LLM推理分解能耗模型,在NVIDIA H100、H200 GPU上评估密集与MoE模型的能耗特征,发现需同时优化请求与令牌能耗,而非仅降低单位令牌能耗。
Comments Accepted at the 2026 IEEE International Symposium on Workload Characterization (IISWC 2026). 13 pages, 6 figures, 9 tables