Reducing Latency of LLM Search Agent via Speculation-based Algorithm-System Co-Design
通过基于猜测的算法-系统联合设计降低LLM搜索代理的延迟
机构 * Tsinghua University(清华大学) ; Infinigence ; Lenovo(联想) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 SPAgent通过基于猜测的算法-系统联合设计框架,减少LLM搜索代理的延迟,实现端到端加速并保持高准确性。