Dissecting the Runtime Performance of the Training, Fine-tuning, and Inference of Large Language Models
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG
Comments ASPLOS 2024
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
Comments Published at NeurIPS 2023. Camera-ready version
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
Comments EMNLP 2023 Demo - ACL Empirical Methods in Natural Language Processing
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
Comments preprint
专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
Comments preprint
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI
Comments arXiv admin note: text overlap with arXiv:2304.08177, arXiv:2303.16199 by other authors
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
Comments Published in Transactions in Machine Learning Research (TMLR) (08/2023). Main paper: 17 pages, References: 3 pages, Appendix: 7 pages. Figures: 5 main, 3 appendix. Tables: 3 main
Journal ref Transactions in Machine Learning Research (08/2023)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);small language model(abstract);分类 cs.CL、cs.AI
Comments 15 pages, 4 figures
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
Comments Paper to be published at the Association for Computational Linguistics in the Industry Track 2023
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI、cs.LG
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
Comments 9 pages
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG
Comments Accepted to IEEE ICASSP 2023
大语言模型推理服务系统的比较分析:vLLM和HuggingFace TGI的性能研究
机构 * Baltimore, MD, USA(美国马里兰州巴尔的摩)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.LG
AI总结 本文比较了vLLM和HuggingFace TGI在大语言模型推理服务中的性能,发现vLLM在高并发场景下吞吐量更高,而TGI在交互式应用中延迟更低。
Comments 10 pages, benchmarking study of LLM inference systems
机构 * Independent Researcher(独立研究者)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.AI
Comments 33 pages, 3 figures, 6 tables. Keywords: LLM security; defense-in-depth; prompt injection; activation steering; multimodal sandbox; threat modeling
机构 * Shanghai Jiao Tong University(上海交通大学) ; SII(上海创新研究院) ; Infinigence-AI
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.LG
Comments Collect and update results in recent half year. 54 pages. Github link: https://github.com/Kimho666/LLM_Hardware_Survey
专题命中 效率与部署 :language model(title,abstract);large language model(title,abstract);LLM(abstract);分类 cs.CL
Comments Accepted at Conference on Language Modeling (COLM), 2024
MileGPO:面向长 horizon LLM 智能体的基于图策略优化的里程碑推理
机构 * Beijing Jiaotong University(北京交通大学)
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 针对长 horizon LLM 智能体强化学习的信用分配难题,提出 MileGPO 方法,通过里程碑发现、RCS、PCC 三项设计提升性能,在 ALFWorld 和 WebShop 上达 SOTA 且分布差距小。
FlashAccel:利用高带宽闪存实现高吞吐量语言模型推理
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 针对LLM推理受HBM容量限制问题,提出FlashAccel系统,将HBF集成到基于HBM的GPU中,通过架构支持、特殊数据布局及引入新管理层和编程模型,在100ms延迟约束下,提升了每GPU吞吐量和能源效率。
重新审视LLM剪枝对测试时缩放的有效性
机构 * Bellini College of AI, Cybersecurity, and Computing(人工智能、网络安全与计算学院)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究非结构化剪枝对推理型大语言模型测试时缩放性能的影响,发现其优于结构化剪枝甚至有时超过未剪枝模型,并探讨了层间稀疏分配策略的作用。
Comments Accepted to EMNLP 2026 (Findings)
TokenCake: 一种面向基于LLM的多智能体应用的KV缓存中心化服务框架
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出TokenCake,一种面向基于LLM的多智能体应用的KV缓存中心化服务框架,通过智能体感知设计共同优化调度和内存管理,以解决KV缓存中的空间竞争和时间利用率问题,实验表明其显著降低了端到端延迟并提高了GPU内存利用率。
Comments 14 pages, 17 figures, 3 tables, 2 algorithms. Accepted at EuroSys '27