Attention Is All You Need But You Don't Need All Of It For Inference of Large Language Models
专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.LG
专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.LG
Comments 14 pages, 8 figures, 7 tables - to be published at ACL 2024
专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.LG
专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.AI
专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.AI
Comments Technical Report. Yiran Zhong is the corresponding author. The source code is available at https://github.com/OpenNLPLab/lightning-attention
专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.LG
专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.LG
专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.LG
你只有一份工作:利用LLM隐藏表示进行每任务量化
机构 * Technion—Israel Institute of Technology(技术ion—以色列理工学院) ; Zenity(Zenity公司) ; DeepKeep(DeepKeep公司) ; Ben-Gurion University of the Negev(巴伊兰大学) ; New York University(纽约大学)
专题命中 效率与部署 :LLM(title_cn,abstract);post-training(abstract);分类 cs.CL;foundation model(comments)
AI总结 本文提出TAQ框架,通过任务校准提示分配更高精度给任务相关的transformer层,提升精度-内存比和部署性能。
Comments Accepted at ICML 2026 Workshop on AdaptFM: Resource-Adaptive Foundation Model Inference
专题命中 效率与部署 :foundation model(title,abstract);language model(abstract,comments);分类 cs.LG;large language model(comments)
Comments Keywords: Distributed Training, Foundation Models, Large Language Models, Optimizers, Communication Efficiency, Federated Learning, Distributed Systems, Optimization Theory, Scaling, Robustness. Preprint, under review at NeurIPS
SoulGard-VL-2B:用于边缘端猫行为理解的视觉语言模型
专题命中 效率与部署 :language model(title,abstract);post-training(abstract);prompting(abstract)
AI总结 本研究提出基于Qwen3-VL-2B后训练得到的边缘端VLM SoulGard-VL-2B,结合多阶段后训练方案,在RK3576芯片上实现高准确率与低延迟,可生成猫行为JSON结构化输出,提升了动物VLM的实用性。
无线物理层基础模型:架构、学习范式、应用与部署
专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)
AI总结 本文综述无线物理层基础模型(WPFMs)的架构、学习范式等,提出五维度分类体系,分析其在多领域的应用部署可行性,探讨模型压缩与挑战,为相关研究提供参考。
从推理到适应:视觉语言模型的统一最优传输视角
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊公司) ; Wayne State University(韦恩州立大学)
专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究提出名为algname的VLM测试时适应方法,通过Wasserstein最优传输统一VLM的推理与适应目标,实验显示其性能较最优方法提升7%且效率先进。
P-PAS:面向长上下文大语言模型服务的预填充压力自适应调度
专题命中 效率与部署 :LLM(title,summary_cn)
AI总结 针对长上下文LLM服务中静态最大批处理令牌数(MBT)无法适配不同调度压力的问题,提出P-PAS动态调度策略,可在各类负载下维持低延迟,避免固定MBT的局限。
通过潜在人格特质实现语言模型的高效安全对齐
机构 * Mila, Quebec AI Institute(米拉,魁北克人工智能研究所) ; McGill University(麦吉尔大学) ; LawZero ; Université de Montréal(蒙特利尔大学)
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对大语言模型安全方法易受攻击问题,提出潜在人格对齐(LPA)方法,基于66条陈述训练,通过假设人格表征与避害共享结构,实现高攻击成功率、轻量级训练及良好泛化性。
Comments 19 pages, 6 figures. Published as a conference paper at COLM 2026
超越容量:通过具有直接GPU和HBM路径的高带宽闪存实现可扩展的MoE大语言模型推理
专题命中 效率与部署 :LLM(title,abstract);language model(abstract)
AI总结 该研究针对MoE大语言模型推理的HBM容量瓶颈,提出同时利用HBF到GPU的直接路径和HBF经HBM到GPU的中继路径的架构,可提升专家传递效率,实现1.94倍吞吐量与1.90倍端到端加速。
面向以KV为核心的大语言模型服务的高带宽闪存全栈表征
专题命中 效率与部署 :LLM(title,summary_cn)
AI总结 该研究通过全栈表征发现,将高带宽闪存(HBF)直接替代SSD作为瞬态KV卸载层会降低LLM服务性能,HBF需作为感知复用的协调层使用而非SSD替代品。
Comments 13 pages, 12 figures
面向专用语言模型的解释引导式变异测试:一项实证研究
专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn)
AI总结 本文通过在三个数据集、四种模型架构下的20种配置开展实证研究,发现解释引导式变异测试生成的经验证故障诱导测试用例是启发式变异策略的2.30倍,可有效评估专用语言模型的鲁棒性。
Comments 20 pages, 4 figures. Accepted at ESEM 2026
WIDE:通过令牌级动态宽度剪枝提升自适应大语言模型推理效率
机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波东方理工大学宁波数字孪生研究院) ; Munich Center for Machine Learning, LMU Munich(慕尼黑大学慕尼黑机器学习中心)
专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 WIDE是首个端到端可微令牌级动态宽度剪枝框架,通过两阶段训练与剪枝-内核协同设计,在50%稀疏度下实现显著推理加速与更优精度保持,性能优于现有动态剪枝方法。
Comments 30 pages, 19 figures
反对用于检索的生成式模型:判别式语言模型作为有效的检索器
专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)
AI总结 研究探讨大语言模型用于检索的问题,通过将其作为语义表示主干重振双塔检索架构,引入创新的双塔框架,经实验评估,该架构在公共基准和生产系统中表现出色,证明传统双塔范式结合现代学习后在工业检索中仍具竞争力。
GLIDE:用于高效大语言模型推理的引导式分层混合注意力机制
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对大语言模型推理时KV缓存瓶颈问题,提出GLIDE引导式分层混合注意力机制,通过分层自适应平衡线性循环与softmax窗口,非均匀压缩softmax占用空间,实现性能-效率权衡,降低长上下文生成延迟。
InstantInfer:使用通信有限自动机实现快速大语言模型冷启动
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究大语言模型推理服务冷启动低效问题,提出通信有限自动机抽象及编程框架,经证明其正确性后应用于vLLM相关环节形成InstantInfer,大幅加速冷启动且在多场景表现鲁棒。
Comments 15 pages, 18 figures
打破MoE大语言模型三重困境:动态专家聚类与结构压缩
机构 * Guangzhou University(广州大学) ; Institue of Automation Chinese Academy of Sciences(中国科学院自动化研究所) ; ByteDance Inc.(字节跳动公司) ; University of Science and Technology Beijing(北京科技大学)
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出动态专家聚类与结构压缩框架,通过参数分解和分层路由策略,显著提升MoE大语言模型的效率和内存利用率。
Comments 10 pages, 2 figures, 8 tables. Under review as a conference paper at ICML 2026
用于边缘大语言模型推理的过渡感知后端调度
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究边缘平台大语言模型推理问题,提出过渡感知后端调度方法,结合算子特征与后端选择,经实验验证该方法能降低延迟、能量及能量延迟积,减少切换,提升边缘变压器工作负载调度效率。
基于大语言模型驱动的量子最优控制跨范式设计
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究针对量子最优控制实际应用的瓶颈,提出由大语言模型驱动的QOC-Workbench工作流程,可跨范式设计协议,能自主解析文献、积累控制模式,在多场景验证中表现出色,建立了自主量子控制的跨范式方法。
Comments 19 pages, 8 figures
Lil: 在长解码阶段应用后训练稀疏注意力算法时,少即是少
机构 * SCS, Peking University, Beijing, China(北京大学信息科学与技术学院,北京,中国) ; Key Lab of HCST (PKU), MOE, Beijing, China(高等教育出版社HCST重点实验室(PKU),北京,中国) ; State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国) ; Tencent, Shenzhen, China(腾讯,深圳,中国) ; Beijing Tongming Lake Information Technology Application Innovation Center, Beijing, China(北京 Tongming Lake 信息技术应用创新中心,北京,中国)
专题命中 效率与部署 :post-training(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了在长解码阶段应用稀疏注意力算法时,信息丢失导致序列变长的问题,提出早停算法减少token消耗并降低精度损失。
Mediator:基于较少参数冲突和不确定性路由的内存高效大语言模型合并
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对大语言模型合并中参数冲突致性能下降等问题,提出基于层参数冲突情况分别处理,结合任务算术稀疏性解耦专家,依输入数据任务不确定性选合并专家,实验表明该方法提升性能且降低系统成本。
Comments work in progress. arXiv admin note: text overlap with arXiv:2405.09673 by other authors
OmniVLM:一种用于高效设备端推理的令牌压缩、参数少于十亿的视觉语言模型
机构 * Nexa AI
专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);preference optimization(abstract)
AI总结 研究提出OmniVLM视觉语言模型,通过令牌压缩机制减少计算开销,经多阶段训练匹配更大模型性能。在多基准测试中优于现有基线,在笔记本电脑上实证显示速度提升,能在边缘设备高效部署,模型权重可在huggingface获取。
GPU-Tile-Sim:用于大语言模型软硬件协同设计的以瓦片为中心的GPU仿真框架
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究针对大语言模型中GPU内核给性能模型带来的挑战,提出GPU-Tile-Sim框架,以瓦片图表示内核执行,设计前后端,在多种工作负载上评估,精度高,还扩展到Blackwell验证其对设计分析的有效性。
Comments 14 pages, 14 figures. Accepted to MICRO 2026
用于大语言模型生成代码检测的高效通用水印技术
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 针对大语言模型生成代码检测问题,提出即插即用的ACW水印方法,无需训练,通过精心设计的代码转换作隐式水印,有效高效检测代码,保留其实用性且具通用性,解决了现有方法的局限。
Comments This work has been accepted by IEEE Transactions on Software Engineering for publication, and the copyright follows IEEE policies