A Systematic Characterization of LLM Inference on GPUs
对GPU上LLM推理的系统性表征
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文通过系统性分析,揭示了GPU上LLM推理的四维框架,包括异质性观察、微架构分析、系统扩展原则和新兴范式边界,为LLM推理提供了新的优化方向和理论基础。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
对GPU上LLM推理的系统性表征
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文通过系统性分析,揭示了GPU上LLM推理的四维框架,包括异质性观察、微架构分析、系统扩展原则和新兴范式边界,为LLM推理提供了新的优化方向和理论基础。
高效内核映射与LLM加速在CGLA上的综合系统评估
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出了一种非AI专用的CGLA加速器,通过高效内核映射和综合系统评估,展示了其在LLM推断中的高能效和性能-能耗折中优势。
Comments This paper is published at IEEE Access
Journal ref IEEE Access, 2025
基于RAG的LLM驱动的开放6G RAN动态无线电资源管理
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出基于RAG的LLM驱动的O-RAN动态资源管理框架,通过双代理机制实现网络切片的自适应控制,提升计算效率和SLA合规性。
Comments Submitted to possible IEEE conferences
面向LLM工作流的统计独立性感知缓存
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 Mnimi通过封装统计约束在LLM引用类型中,提升代码修复工作流的可重复性、调试效率和统计正确性。
注意力跨度混合:通过异质滑动窗口长度优化LLM推理效率
机构 * Tsinghua University(清华大学) ; Infinigence-AI ; Stanford University(斯坦福大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MoA通过异质滑动窗口长度优化LLM推理效率,提升上下文长度和检索准确率,减少内存消耗并提高吞吐量。
Comments Published at CoLM'25
EAGER: 边缘对齐的LLM防御方法用于鲁棒、高效且准确的网络安全问答
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 EAGER通过参数高效量化与领域偏好对齐,提升网络安全问答的鲁棒性、效率和准确性,降低对抗攻击成功率并优化响应延迟。
Skypilot: 通过物理现实 grounding 提升 LLM 在 AAV 覆盖搜索中的微调
机构 * College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学) ; College of Automation Engineering, Nanjing University of Aeronautics and Astronautics(自动化工程学院,南京航空航天大学) ; China Academy of Launch Vehicle Technology(中国运载火箭技术研究院)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 Skypilot通过结合MCTS和物理感知奖励函数,提升LLM在AAV覆盖搜索中的微调效果,实现高效且高质量的决策与路径规划。
混合LLM路由用于高效应用反馈分类
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出混合LLM路由策略,通过轻量模型处理低复杂度反馈,高容量LLM处理模糊情况,提升应用反馈分类的准确性和效率。
一种基于LLM的高效进化推荐方法:定位-遗忘-更新范式
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 EvoRec通过定位-遗忘-更新范式高效处理LLM推荐系统中用户偏好的演变,减少计算资源消耗并保持推荐性能。
KVTuner: 一种面向层间敏感性的混合精度KV缓存量化方法,用于高效且接近无损的LLM推理
机构 * Huawei Noah's Ark Lab(华为诺亚实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Huawei Computing Product Line(华为计算产品线)
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 KVTuner通过多目标优化实现高效且接近无损的LLM推理,适用于不同模型和约束条件。
Comments Accepted by ICML25. Code: https://github.com/cmd2001/KVTuner
训练短音频,推断长音频:Speech-LLM实现长音频零样本联合语音识别与说话人识别
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 Speech-LLM通过短音频训练实现长音频零样本联合语音识别与说话人识别,优于现有基线方法。
Comments Submitted to ICASSP2026
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
Comments This is a preprint version, full paper has been accepted in IEEE CASCON 2025 and will appear on lEEE Xplore
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
Comments The paper has been withdrawn to align with the internal publication policies of the affiliated organization. We plan to resubmit after obtaining the necessary approvals
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
Comments This work has been submitted to the IEEE for possible publication. This version is temporarily hosted anonymously for double-blind review
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
Comments accpeted paper by Design, Automation and Test in Europe Conference (DATE'26). 8 pages in total with 6 figures and 2 tables
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
Comments 25 pages, 16 figures, 2 tables. The workload traces, our simulator harness and the SageServe scheduler are available at https://github.com/shashwatj07/SageServe
Journal ref Proceedings of the ACM on Measurement and Analysis of Computing Systems, Vol. 9, No. 3, Article 61. December 2025
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
Comments Accepted by regular paper in the IEEE Transactions on Audio, Speech and Language Processing (TASLP)
机构 * Thumbtack(Thumbtack公司)
专题命中 效率与部署 :prompting(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * IBM -- Financial Services Market(IBM金融服务市场)
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 11 pages, 5 figures. To appear in AI4F @ ACM ICAIF '25, November 15-18, 2025, Singapore
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract)
Comments AAAI 2026 (Oral presentation)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
Comments 12 pages, 10 figures, 1 tables
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
Comments require revision, update later
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
Comments Accepted in the Seventeenth International Conference on Wireless Communications and Signal Processing Oct. 23-25, 2025