OServe: Accelerating LLM Serving via Spatial-Temporal Workload Orchestration
OServe: 通过空间-时间工作负载编排加速大语言模型服务
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 OServe通过空间-时间工作负载编排优化大语言模型服务,提升性能2倍
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
OServe: 通过空间-时间工作负载编排加速大语言模型服务
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 OServe通过空间-时间工作负载编排优化大语言模型服务,提升性能2倍
PAM:跨内存层次处理的高效键值中心LLM服务系统
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 PAM通过跨内存层次处理,优化键值中心LLM服务系统的带宽与容量,提升效率和可扩展性。
Comments 15 pages, 13 figures
BOute: 通过多目标贝叶斯优化实现高效的LLM服务
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 BOute通过多目标贝叶斯优化实现高效LLM服务,优化路由和部署策略以提升成本效率。
Comments MLSys 2026
更多令牌是否理性?语言模型推理时的扩展作为适应性资源理性
机构 * Georgia Tech(佐治亚理工学院)
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过变量归因任务探讨语言模型在推理时扩展对资源理性的影响,发现模型能根据任务复杂性调整策略,即使无显式成本奖励。
嵌入式扩展优于专家扩展在语言模型中
机构 * Meituan LongCat Team(美团LongCat团队)
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究提出通过嵌入式扩展而非专家扩展来提升语言模型的稀疏性,展示了LongCat-Flash-Lite在推理速度上的显著提升。
Flare:用于千级规模GPU集群中发散式LLM训练的异常诊断
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 Flare是一种用于千级规模GPU集群中大规模分布式LLM训练的异常诊断框架,通过轻量级跟踪守护进程和自动诊断引擎提升异常检测与性能退化分析能力。
重新思考视觉-语言模型的实用且高效的量化校准
机构 * Northwestern Polytechnical University, Xi'an, China(西北工业大学,西安,中国) ; Nanjing University of Science and Technology, Nanjing, China(南京理工大学,南京,中国)
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);post-training(abstract)
AI总结 TLQ通过标记级重要性整合和多GPU层级校准,提升视觉-语言模型的量化稳定性与效率。
面向高吞吐量LLM服务的预填解码多路复用
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 MuxWise通过引入GPU内预填解码多路复用范式,实现了LLM服务在满足SLO要求的同时提升吞吐量。
MiniRec: 用于基于大语言模型推荐系统的高效强化学习
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 MiniRec通过奖励对齐和轨迹导向的数据选择方法,有效降低基于LLM的推荐系统训练成本,同时保持高性能。
Cortex: 通过语义感知的知识缓存实现低延迟、低成本的远程数据访问用于大语言模型
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 Cortex通过语义感知的知识缓存架构,实现LLM代理在远程数据访问中的低延迟和低成本,提升吞吐量和准确性。
RankSteer: 激活引导用于点wise LLM 排序
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 RankSteer 通过激活引导框架提升零样本点wise LLM 排序性能,利用三个解耦方向校准排序行为,无需修改模型权重。
高效LLM推理与混合缓存激活检查点
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 HybridServe通过激活检查点和混合缓存方案,实现高效LLM推理,提升吞吐量2.19倍。
Comments 14 pages, 15 figures
Journal ref The 43rd IEEE International Conference on Computer Design, 2025
超越基本规范?基于LLM的规范生成中逻辑构造的系统研究
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文研究了基于LLM的规范生成中逻辑构造的应用,通过实验证明LLMs能生成有效逻辑构造,并提升验证能力与鲁棒性。
面向LLM推荐的高效稳定强化学习
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出RISER框架,通过强化学习提升LLM推荐的效率和稳定性,有效解决样本效率低和训练不稳定问题。
竞争性非clairvoyant KV缓存调度用于LLM推理
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出非clairvoyant的几何切片算法(GSA)和clairvoyant的几何批处理算法(GBA),在LLM推理中实现首个常数竞争比,显著提升性能界。
对边界的理解:LLM生成的边界测试解释
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文研究LLM生成的边界解释在软件测试中的有效性,通过调查和访谈发现,清晰结构、权威来源引用和可操作示例能提升解释质量,提出七项要求的检查表以指导未来工具设计。
Comments This is the author's accepted manuscript of a paper accepted for publication at AST 2026. The final version will appear in the ACM Digital Library
LLM-ForcedAligner: 一种非自回归且准确的基于大语言模型的强制对齐器,适用于多语言和长文本语音
机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 LLM-ForcedAligner通过非自回归方法实现多语言和长文本语音的准确强制对齐,显著减少时间偏移。
ProfInfer: 基于eBPF的细粒度LLM推理分析器
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 ProfInfer基于eBPF技术,为LLM推理引擎提供细粒度性能分析,通过动态探针实现非侵入式监控,帮助优化调度和资源管理。
Comments Accepted in the 9th Annual Conference on Machine Learning and Systems (MLSys 2026)
SPADE:结构剪枝与自适应知识蒸馏用于高效的LLM-TTS
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) ; dot Inc.(42dot公司)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 SPADE通过结构剪枝和自适应知识蒸馏,实现高效LLM-TTS模型,减半Transformer深度并提升实时生成速度,同时保持高质量语音输出。
Comments ICASSP 2026
ENERGY STAR LLM赋能的软件工程工具
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文研究LLM赋能的软件工程工具的能效,通过结合RAG与PETs提升代码生成的质量和效率,验证核心理念并提供未来分析的证明。
Comments CAIN 2026 - 5th International Conference on AI Engineering - Software Engineering for AI
面向设备端个性化:云-设备协同数据增强用于高效设备端语言模型
专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)
AI总结 提出CDCDA-PLM框架,通过云-设备协同数据增强实现高效设备端个性化语言模型部署,解决数据稀缺和网络依赖问题。
Shift Parallelism:低延迟、高吞吐量的LLM推理用于动态工作负载
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 Shift Parallelism通过结合张量并行和序列并行,实现动态工作负载下的低延迟和高吞吐量LLM推理。
Comments Revised
dLLM-ASR:一种更高效的基于扩散大语言模型的语音识别框架
机构 * Northwestern Polytechnical University(西北工业大学)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 dLLM-ASR通过将扩散大语言模型的解码过程转化为先验引导的去噪流程,实现高效的语音识别,达到与自回归模型相当的准确率并提升4.44倍推理速度。
ViTCoP: 通过视觉和文本语义协同剪枝加速大型视觉-语言模型
专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)
AI总结 ViTCoP通过结合视觉和文本语义协同剪枝,有效降低大型视觉-语言模型的计算成本,提升推理效率和内存利用率。
为中小企业保障LLM即服务的安全性:一个分布式聊天机器人部署平台的行业案例研究
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出一个开源多租户平台,帮助中小企业低成本安全部署定制LLM聊天机器人,通过分布式集群和加密网络实现资源池化与隔离,同时集成防提示注入攻击机制。
Comments Accepted by AISC 2026
Journal ref Australasian Information Security Conference 2026
竞争性音频-语言模型:基于公共数据的高效单阶段训练
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Falcon3-Audio基于少量公共数据实现高效单阶段训练,其1B模型在MMAU基准测试中表现优异,优于其他大型模型。
Comments Accepted at ASRU 2025
朝着理解视觉-语言模型量化最佳实践
机构 * University of Maryland, College Park(马里兰大学学院公园分校)
专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)
AI总结 本研究探讨了视觉-语言模型量化方法对多模态流水线性能的影响,发现LLM低位量化在减少bpw时仍保持高精度,为高效部署MLLMs提供实践指导。
Comments 15 pages, 12 figures, 1 table
RelServe: 在关系数据上实现快速大语言模型推理服务
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 RelServe通过动态优先级更新和自适应批处理优化,显著提升了关系数据查询的LLM推理效率,降低了延迟。
Comments Paper Under Review
MHA2MLA-VLM: 使DeepSeek的经济型多头潜在注意力在视觉-语言模型中生效
机构 * DeepSeek
专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MHA2MLA-VLM通过参数高效的方法将现有视觉-语言模型转换为多头潜在注意力架构,减少缓存足迹并提升推理效率。
SwiftKV:一种面向边界的注意力算法和多头加速器,用于快速高效的LLM解码
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 SwiftKV提出了一种面向边界的注意力算法和多头加速器,通过高效流水线化和统一处理实现快速高效的LLM解码,显著提升性能和效率。