SCoRD: Semantic-Assisted Continual Retriever-Reranker Distillation for LLM-Based Recommendation
SCoRD:用于基于大语言模型(LLM)推荐的语义辅助持续检索-重排序蒸馏
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 SCoRD是面向非平稳数据流的LLM推荐两阶段流程的持续知识蒸馏框架,通过语义推理助手实现检索器与重排序器的高效协同适配,在真实数据集上验证了其有效性。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
SCoRD:用于基于大语言模型(LLM)推荐的语义辅助持续检索-重排序蒸馏
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 SCoRD是面向非平稳数据流的LLM推荐两阶段流程的持续知识蒸馏框架,通过语义推理助手实现检索器与重排序器的高效协同适配,在真实数据集上验证了其有效性。
大语言模型智能体何时有用?自动驾驶车辆边缘的感知期限感知混合关键度任务调度
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 该研究针对自动驾驶车辆边缘MEC的混合关键度任务调度,构建强启发式算法,发现LLM控制平面仅在安全关键任务激增时优于静态启发式算法。
Comments 8 pages, 5 figures, and 4 tables
基于大语言模型的测试生成中的代码健康度:有效性与标记效率
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本研究探究LLM生成单元测试的有效性随CodeScene的CodeHealth水平的变化,发现CH是测试有效性的微弱但一致信号,且与输入标记数负相关,证实可维护性与LLM软件开发存在关联。
Comments Accepted at the Engineering Track of the 26th IEEE International Conference on Source Code Analysis and Manipulation (SCAM 2026)
L-COIN:用于亚太赫兹低轨卫星网络中博弈论分布式计算卸载的大语言模型辅助反事实推理
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 该研究针对亚太赫兹低轨卫星网络的分布式计算卸载问题,提出L-COIN框架,结合LLM与反事实推理,降低卸载成本10.9%-27.7%,提升了时变场景下的卸载性能。
FlashQuant:面向内存高效的异常值感知大语言模型推理的稀疏-密集融合方案
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 FlashQuant是面向异常值感知W4A16解码的内容共享执行框架,通过融合GPU内核实现稀疏-密集路径的片上复用,在内存受限的LLM解码中大幅降低异常值处理开销,获得显著加速比。
分布式大语言模型系统的集体通信:规划、运行时适配与计算协调
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本文提出以集体为中心的分类法,将分布式LLM系统集体通信进展分为规划、执行适配、计算通信协调三层,探讨相关开放挑战与未来机遇。
HW-Router:面向可扩展多大语言模型服务的硬件感知路由
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 HW-Router是一种动态路由框架,结合实时硬件信号与模型特征实现SLO感知路由,在多LLM服务中相比CARROT等基线显著降低延迟、提升SLO达成率并均衡GPU负载。
Comments Preprint
Journal ref 2026 Design Automation Conference (DAC)
探索用于现代大语言模型推理的高带宽闪存:机遇与挑战
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本研究分析高带宽闪存(HBF)用于大语言模型(LLM)推理的机遇与挑战,发现HBF可提升LLM服务系统性能并降低GPU需求,但需维持类HBM读取带宽并提升耐用性。
Comments 4 pages, 7 figures, IEEE Computer Architecture Letters (CAL)
HBF在大语言模型(LLM)服务系统中的潜在应用
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 该研究针对LLM服务的内存容量限制,提出将HBF集成到GPU内存层级的方案,通过仿真验证其可提升MoE和多模型服务性能,需保留HBM驻留执行路径。
极值阿尔法与崩盘风险:通过LLM提取的披露网络区分结构性尾部与彩票式尾部
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 该研究利用LLM从10-K文件提取的公司披露网络,将股票收益上尾分为崩盘侧与结构性尾部,通过24家科技公司试点验证了崩盘侧信号的有效性,明确了判别器的适用边界。
Comments 19 pages, 5 figures, 2 tables
MetaStrategy:基于可执行大语言模型策略的生成式排序
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 MetaStrategy是一种可执行LLM策略的生成式排序框架,经淘宝部署测试,其提升了多项核心业务指标且未增加响应时间。
FSGen:面向大语言模型应用的具备精确功耗模型的敏捷融合与稀疏加速器生成器
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 FSGen是面向LLM的敏捷加速器生成框架,支持融合算子数据流与稀疏性,其PPA评估器精度更高,能找到功耗效率提升1.4倍或加速比达10倍的帕累托最优设计,大幅缩短设计空间探索时间,品质因数提升58倍。
Comments Research Manuscript Published in Design Automation Conference (DAC) 63 (2026)
C2C-Explorer:用于大语言模型云计算系统中芯片间互连架构的探索框架
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 C2C-Explorer是一种自适应贝叶斯DSE框架,整合流量生成器、可扩展互连模拟器与评估器,用于探索LLM云计算系统的C2C互连架构,在DeepSeek-R1-671B负载中可提升有效吞吐量并降低内存占用。
Comments Accepted in DAC'26
HybridFlow: 适应资源的子任务路由用于高效的边缘-云LLM推理
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 HybridFlow通过动态资源适应的子任务路由框架,提升边缘-云LLM推理的效率与准确性。
Comments Accepted by ICML 2026
OmniInfer: 通过优化LLM服务吞吐量和延迟提升系统整体加速技术
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 OmniInfer通过统一框架优化LLM服务吞吐量和延迟,减少TPOT和TTFT,提升系统整体性能。
Comments Project page: [this https URL](https://gitee.com/omniai/omniinfer)
RAC:面向通信高效的分割式大语言模型推理的参考感知激活压缩
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 该研究针对分割式LLM推理的通信瓶颈,提出参考感知激活压缩方法RAC,通过参考感知编解码器等技术降低通信开销,在多模型多链路对实验中验证了其时间性能提升与任务分数变化情况。
Comments 10 pages, 7 figures, 2 tables
用于令牌高效视频语言模型的持久对象叙事
专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract)
AI总结 本文提出SlotNarrative,一种用于Video-LLM的紧凑结构化视觉接口,通过持久对象叙事减少视觉令牌数量,在多数据集上实现准确率与令牌数的良好权衡。
面向高效低比特大语言模型推理的异构感知微缩放技术
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 研究针对低比特LLM推理的MX格式精度损失问题,提出异构感知的AdaMX格式与加速器,在不增加EBW的前提下提升精度、降低存储能耗,在多类LLM及多模态模型上表现优异。
Wi-Fi中的广播速率限制:协作式边缘大语言模型(LLM)推理被遗忘的瓶颈
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 该研究针对协作式边缘LLM推理的通信瓶颈,提出适配UDP广播的MoE推理方法,发现Wi-Fi广播速率限制的遗留问题并通过仿真验证,推动Wi-Fi标准将广播纳入高吞吐量数据平面。
CASPER——面向基于大语言模型(LLM)系统高效回归测试的感知变更的切片优先级排序
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 针对基于LLM系统回归测试的独特挑战,提出CASPER框架,通过进化切片识别与基于执行日志行为信息的优先级排序,实现更优的回归切片处理效果。
面向无线边缘大语言模型推理的空间前缀缓存:一种随机几何与排队框架
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本文构建随机几何与排队框架,针对无线边缘LLM推理的空间通信-缓存-计算权衡优化,揭示延迟最优节点非最近节点、TTFT随缓存前缀深度非单调变化的规律。
SLIM:面向大语言模型服务的饱和度感知轻量级性能建模
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 该研究针对LLM服务吞吐量饱和问题,通过GPU剖析明确其源于解码阶段注意力内核的DRAM带宽饱和,提出SLIM半分析性能模型及BCA工具,可高效预测吞吐量与延迟并优化批处理配置。
Comments Pol G. Recasens and Ferran Agullo contributed equally to the work
SmartGen:支持无缝拆分式大语言模型推理的选择性KV缓存传输方案
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 SmartGen是一款KV缓存传输引擎,通过三种数据传输路径实现拆分式LLM推理的KV缓存选择性传输,可将首token生成时间最多缩短4.3倍,且后续性能与准确率相当。
换个名字就不甜了:LLM文档工作流中格式鲁棒性的实证研究
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 本文提出感知格式的变形测试框架,经大规模实证研究发现LLM文档工作流的格式鲁棒性存在严重问题,切换格式可致准确率降53.63%,并设计出无需重训模型的缓解策略。
Comments 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)
LimICE:将大语言模型(LLM)集成到ICE框架以实现高效循环不变式推理
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 该研究提出集成LLM与ICE框架的增量式学习框架LimICE,用于循环不变式综合,在367个线性、50个非线性基准上的实验显示其解决实例更多、运行速度更快,性能优于相关基线。
Comments 21 pages, 2 figures
Clairvoyant: 预测性SJF调度以缓解串行LLM后端中的队头阻塞
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 提出Clairvoyant,一种轻量级侧车代理,通过预测请求长度实现SJF调度,缓解串行LLM后端中的队头阻塞,显著降低短请求延迟。
Comments 17 pages, 3 figures, 8 tables. Code: https://github.com/Aravind0403/clairvoyant-scheduler
NELSSA:一种基于GPU-PNM异构系统的LLM混合长度服务框架,通过基于长度的请求放置实现
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 NELSSA是集成GPU与PNM加速器的LLM服务系统,通过基于长度的请求放置处理混合长度工作负载,解码吞吐量最高提升5.5倍,P99延迟最高降低15倍,为LLM基础设施提供新范式。
Comments 14 pages, 19 figures. Accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)
超越预填充-解码分解:通过动态算子调度剖析异构平台上的大语言模型推理
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 研究针对异构平台上LLM推理,提出硬件感知的DOPS框架,通过构建阶段感知DAG,集成双焦点调度器和权重布局仲裁器,实现算子调度与权重布局联合优化,在异构系统中取得加速效果并支持相关分析。
Comments To appear in MICRO 2026
TENT:一种用于高性能和容错数据移动的声明式切片喷射引擎
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 TENT通过解耦传输意图与物理执行,统一异构互连技术为动态资源池,实现高效、容错的数据传输,提升LLM推理和RL流水线性能。
LMEdge:边缘集群上的QoS感知大语言模型推理编排
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 研究在边缘集群上进行QoS感知的LLM推理编排问题,提出LMEdge服务。通过BILP优化并结合五个轻量级ML模型预测相关指标,设计轻量级启发式方法。在边缘测试平台评估,结果显示其降低延迟、保持准确性、提高资源利用率及服务比率。
Comments 12 pages, 5 figures, 2 tables, EUROPAR conference paper