Semantic Caching for Low-Cost LLM Serving: From Offline Learning to Online Adaptation
语义缓存用于低成本LLM服务:从离线学习到在线适应
机构 * University of Washington(华盛顿大学) ; Carnegie Mellon University(卡内基梅隆大学) ; The Chinese University of Hong Kong(香港中文大学) ; City University of Hong Kong(香港城市大学) ; Microsoft Research(微软研究院)
AI总结 本文提出了一种基于学习的语义缓存框架,解决LLM服务中的缓存淘汰问题,通过离线优化和在线学习方法,在未知查询和成本分布下实现高效缓存管理。
Comments Accepted to INFOCOM 2026