BaseRT: Best-in-Class LLM Inference on Apple Silicon via Native Metal
BaseRT: 通过原生Metal在Apple Silicon上实现最佳LLM推理
机构 * Base Compute, Melbourne, Australia(Base Compute,墨尔本,澳大利亚)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出基于原生Metal的推理运行时BaseRT,通过芯片特定内核融合、统一内存感知优化和自定义调度逻辑,在Apple Silicon上实现最高推理吞吐量,相比现有框架提升高达1.56倍解码吞吐量。