Trinity: Disaggregating Vector Search from Prefill-Decode Disaggregation in LLM Serving
Trinity: 从LLM服务中解耦向量搜索与预填解码解耦
专题命中 向量检索 :vector search(title,abstract);RAG(abstract);分类 cs.DB
AI总结 Trinity通过整合向量搜索到单一GPU池,优化PD解耦LLM服务的检索效率,减少尾部延迟。
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
Trinity: 从LLM服务中解耦向量搜索与预填解码解耦
专题命中 向量检索 :vector search(title,abstract);RAG(abstract);分类 cs.DB
AI总结 Trinity通过整合向量搜索到单一GPU池,优化PD解耦LLM服务的检索效率,减少尾部延迟。
Fantasy: 在GPU集群上高效进行大规模向量搜索
专题命中 向量检索 :vector search(title,abstract)
AI总结 Fantasy通过在GPU集群中流水线向量搜索与数据传输,利用GPUDirect Async技术提高大规模向量搜索的效率和吞吐量。