LLM4LLM:通过闭环智能体优化弥合内核基准与实际部署之间的差距
LLM4LLM: Bridging Kernel Benchmarks and Real Deployment via Closed-Loop Agentic Optimization
浏览论文内容
中文总结 AI 辅助
研究人员提出LLM4LLM部署感知闭环优化框架,解决内核基准与实际部署的性能差距,在A100、H100的10个语言模型推理工作负载及KernelBench Level 2上实现显著加速。
中文摘要 AI 辅助
大型语言模型已成为针对低级代码和内核优化的日益强大的智能体,但孤立的内核基准仅能作为语言模型推理中重要的部署行为的代理。我们发现了基准到部署的差距:在独立测试中看似正确且快速的候选内核,在集成到实际推理工作负载后,可能表现出不同的性能、安全性或阶段行为。我们引入LLM4LLM,这是一个感知部署的闭环优化框架,它从目标推理脚本开始,提取感知阶段的优化任务,通过经验引导的情节智能体进行搜索,并通过模型内验证接受补丁。在A100和H100 GPU上的10个语言模型推理工作负载中,LLM4LLM为每个评估模型都提高了端到端延迟,在A100和H100上分别实现了3.91×/6.98×的几何平均加速;作为支持的内核级证据,它在KernelBench Level 2上也达到了高达2.745×的几何平均加速。
英文摘要
Large language models have become increasingly capable agents for low-level code and kernel optimization, but isolated kernel benchmarks provide only a proxy for the deployment behavior that matters in language-model inference. We identify a benchmark-to-deployment gap: candidate kernels that appear correct and fast in standalone harnesses can exhibit different performance, safety, or phase behavior after integration into a real inference workload. We introduce LLM4LLM, a deployment-aware closed-loop optimization framework that starts from a target inference script, extracts phase-aware optimization tasks, searches with an experience-guided episodic agent, and accepts patches through in-model validation. Across ten language-model inference workloads on A100 and H100 GPUs, LLM4LLM improves end-to-end latency for every evaluated model, achieving 3.91$\times$/6.98$\times$ geometric-mean speedups on A100/H100; as supporting kernel-level evidence, it also attains up to 2.745$\times$ GeoMean speedup on KernelBench Level 2.
发表机构
- National Key Laboratory of Advanced Communication Networks(先进通信网络国家重点实验室)
- Xidian University(西安电子科技大学)
- Zhongguancun Academy(中关村学院)
- Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)
机构由 AI 辅助整理,请以论文原文为准。