PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG
Comments Preprint
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG
Comments Preprint
机构 * University of Illinois Urbana-Champaign ; Google ; Google \& University of Washington
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG
机构 * Bradley Department of Electrical and Computer Engineering(电气与计算机工程系)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG
Comments Accepted at IEEE GLOBECOM 2025
机构 * Fidelity Investments(fidelity投资公司)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
Comments 26 pages, 4 figures
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Meta Platforms, Inc(Meta平台公司)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
机构 * UC Berkeley(伯克利大学) ; UCLA(洛杉矶大学) ; Rice University(里奇大学) ; UC Davis(戴维斯大学) ; Intel(英特尔公司)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
机构 * MiniCPM Team(MiniCPM团队)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
Comments MiniCPM4 Technical Report
机构 * New York University(纽约大学) ; MIT(麻省理工学院)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP 2025
机构 * FAIR at Meta(Meta的FAIR)
专题命中 效率与部署 :language model(title,abstract);分类 cs.LG
专题命中 效率与部署 :LLM(title,abstract)
机构 * Department of Computer Science and Engineering, Sungkyunkwan University(计算机科学与工程系,顺天大学)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
Journal ref Forty-second International Conference on Machine Learning, 2025
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG
Comments Accepted at IEEE COMPSAC 2025
Journal ref 2025 IEEE 49th Annual Computers, Software, and Applications Conference (COMPSAC)
机构 * University of Siegen(施皮格恩大学) ; Honda Research Institute Europe GmbH(本田欧洲研究院) ; Dedan Kimathi University of Technology(德丹·基马蒂技术大学)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)
Journal ref 2025 International Conference on Social Robotics (ICSR)
机构 * Neo4j
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG
机构 * Neo4j
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG
机构 * Politecnico di Torino(托斯尼亚理工学院)
专题命中 效率与部署 :large language model(abstract);language model(abstract)
Comments Accepted at ICIAP 2025
机构 * Sprinklr
专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI
Comments Sprinklr OCR provides a fast and compute light way of performing OCR
机构 * TOELT LLC AI lab(TOELT LLC人工智能实验室)
专题命中 效率与部署 :foundation model(abstract);分类 cs.AI
专题命中 效率与部署 :language model(abstract)