Towards Pareto Optimal Throughput in Small Language Model Serving
机构 * Barcelona Supercomputing Center(巴塞罗那超级计算中心) ; IBM Research(IBM研究院)
专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)
Comments Revised version of the paper published at EuroMLSys'24, fix figure 6 and 7