Parameter-Efficient Sparsity for Large Language Models Fine-Tuning
专题命中 效率与部署 :language model(title,abstract);large language model(title);分类 cs.AI
Comments This paper is published in IJCAI 2022
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 效率与部署 :language model(title,abstract);large language model(title);分类 cs.AI
Comments This paper is published in IJCAI 2022
专题命中 效率与部署 :language model(title,abstract);large language model(title);分类 cs.CL
向大型音频语言模型中的音频标记压缩迈进
机构 * MIT(麻省理工学院) ; IBM Research(IBM研究院) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) ; Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)
专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出通过无监督分割和低秩适配器技术,压缩音频标记以提升大型音频语言模型在资源受限平台上的性能。
LACE-SVD:用于大语言模型压缩的带累积误差校正的损失感知奇异值分解
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对大语言模型参数规模增长需求,提出LACE-SVD框架,先依候选压缩率估算损失增加量分配秩预算,再用局部更新和误差校正优化模型,降低累积误差传播,效果优于现有方法。
Comments 12 pages, 5 figures, 5 tables
卡利普索:关系型大语言模型服务
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究如何提升大语言模型服务语义查询效率,提出关系型大语言模型服务,通过跨语义运算符流水线执行复用KV缓存状态,卡利普索系统利用自适应算法执行查询计划,解决在线调度问题,相比基线系统大幅提高查询完成时间。
Comments 14 pages, 12 figures
工具增强型大语言模型系统中的持久语义实体
专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI、cs.LG
AI总结 该研究定义工具增强型LLM系统的持久语义实体(PSEs),证实其在24款不同规模模型中普遍存在,偏好/指令污染难自校正,上下文隔离自验证可降低污染,为智能体系统安全提供关键发现。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). Camera-ready version; 32 pages . The openreview url is https://openreview.net/forum?id=zPjmtawzT8¬eId=CXB95ws5so and ICML poster url is https://icml.cc/virtual/2026/poster/60521
HindsightBench:用于时间索引语言模型决策任务中参数后见之明的黑盒行为审计协议
机构 * University College Dublin(都柏林大学学院)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 研究针对大语言模型在金融决策任务中泄露参数知识的问题,提出HindsightBench黑盒行为审计协议,通过特定矩阵、探测及指标分析参数后见之明,应用于多模型获三个主要模式,揭示模型特性及审计结果与服务的关系,还发布相关数据。
Comments 17 pages, 3 figures. Code, panel, and per-model audit rows: https://github.com/Khaozhe/hindsightbench (v1.0 release archived at doi:10.5281/zenodo.21453191)
深奥语言模型:一类任意阶扩散LLM
机构 * Cornell University(康奈尔大学) ; NVIDIA(英伟达)
专题命中 效率与部署 :language model(title,abstract);LLM(title_cn);分类 cs.CL、cs.LG
AI总结 提出Eso-LMs模型,融合自回归与掩码扩散范式,通过因果注意力实现精确似然计算和KV缓存,在速度-质量帕累托前沿上达到新最优。
Comments ICML 2026 Camera Ready
在大语言模型谷中导航:从AdamW到内存高效和矩阵优化器
机构 * Center for Applied Scientific Computing(应用科学计算中心)
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 本文探讨了大语言模型优化器的发展,从传统方法到内存高效和矩阵优化器,强调了在大规模训练中优化器的统计有效性、计算和内存效率。
Comments No figures, 65 pages
基于阈值符号排序的基于大语言模型的源代码压缩
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 研究基于大语言模型的源代码无损压缩问题,提出两种阈值符号排序变体,将预测限制在前\(T\)个排名,通过通用压缩器联合压缩阈值外符号。实验表明该方法在压缩率和吞吐量上优于此前方法,在压缩速度频谱中提供新权衡点。
Comments This is the version of the paper submitted and then accepted for presentation at the 24th International Conference of the Italian Association for Artificial Intelligence (AIxIA 2026), Perugia, Italy, 6--9 October 2026. The paper will appear in the proceedings, published by Springer Verlag in the Lecture Notes in Artificial Intelligence (LNAI) series
MiniCache:用于高效大语言模型推理的具有小模型接口的可重复使用程序缓存
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大语言模型推理成本高的问题,提出MiniCache框架,将PoT程序转换为参数化缓存对象,通过重用小模型进行语义变量提取和推测性起草,减少目标大语言模型调用,实验证明其能提升推理性能,平衡延迟、缓存重用和准确性。
Comments 16 pages, 8 figures
生成式增强推断
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Toronto(多伦多大学)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出生成式增强推断(GAI)框架,将AI输出视为学习真实标签的高维信息特征而非代理,通过非参数方法建模,实现人机数据联合的一致估计和有效推断,在随机标注下渐近效率严格优于仅用人类数据。
智能多无人机在综合陆地与非陆地网络中的导航:一种分层大语言模型方法
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对高速无人机在三维空中高速公路部署中面临的协调问题,提出分层大语言模型驱动控制框架,利用云端大语言模型管理全局负载平衡,边缘大语言模型转化局部观测为子目标,引导深度强化学习控制器执行轨迹,降低碰撞率并提高系统吞吐量。
Comments This paper has been accepted by IEEE GLOBECOM 2026
KernelBench验证:大语言模型生成的内核真的能超越PyTorch吗?
机构 * Meta ; FAIR at Meta SuperIntelligence Lab(元超智能实验室公平团队) ; Stanford University(斯坦福大学)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型生成的内核是否真能超越PyTorch,指出前沿模型存在奖励黑客行为。引入KernelBench-Verified扩展评估框架及内存效率指标,实验发现最佳模型加速比低,无模型始终超PyTorch,部分模型增加GPU内存峰值使用,强调持续调整评估协议的必要性。
联邦基础模型与智能电力电网的协同作用
专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出联邦基础模型与智能电网的协同方法,通过双向视角探讨M3T FedFMs在电网功能增强和模型设计优化中的应用。
Journal ref IEEE Electrification Magazine, 2026
用于消费级设备上混合CPU - GPU大语言模型推理的自动张量调度
机构 * School of Computer Science, Nanjing University(南京大学计算机科学学院)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究在消费级设备运行大语言模型时因模型权重超GPU内存需卸载推理的问题,提出ATSInfer系统,通过结合静态张量放置与负载感知动态传输及异步协调,在代表性平台评估,相比现有系统显著提升吞吐量、利用率等,改善本地大语言模型部署体验。
MemDecay:用于高效大语言模型智能体推理的区域感知键值缓存逐出策略
机构 * Independent Researcher(独立研究者)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型智能体KV缓存内存瓶颈问题,提出无需训练的区域感知逐出策略MemDecay,为令牌分配特定区域优先级和衰减率,经实验验证该策略能有效管理缓存,确立语义提示结构对KV缓存管理的作用并明确其与关注重要性的结合方式。
用于大语言模型路由的具有替代奖励的相关感知上下文博弈
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究用于大语言模型路由的相关感知上下文博弈问题,提出耦合奖励混合与解耦预测混合两种利用替代奖励的算法,经理论分析和实验评估,相比基线方法提高了样本效率和精度 - 成本权衡。
低延迟系统中的工具制作与自我进化大语言模型智能体
机构 * Amazon(亚马逊)
专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.CL、cs.LG
AI总结 研究如何解决生产LLM智能体因重复生成代码浪费延迟和可靠性的问题,提出用智能工具制作管道取代推理时编码循环,部署该方法使系统更快、更可靠、易操作,降低延迟和错误率,提高可审计性。
Comments Preprint
dOPSD:扩散语言模型的策略内自蒸馏
机构 * National University of Singapore(新加坡国立大学)
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.AI
AI总结 研究扩散语言模型强化推理难的问题,提出dOPSD,通过从学生去噪轨迹直接推导教师特权信息,实现策略内自蒸馏,提升模型在数学推理和代码生成等任务表现。
Kara: 通过滑动窗口KV缓存压缩实现高效推理LLM服务
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对推理语言模型长思维链导致KV缓存过大、解码延迟高的问题,提出Kara滑动窗口KV缓存压缩方法,利用双向注意力评分选择信息性KV对并通过Token2Chunk模块扩展为块,结合PagedAttention构建KvLLM推理框架,降低内存占用并提升输出吞吐量。
Comments 9 pages, 6 figures
聚焦会议:加速多模态基础模型的硬件和软件技术
机构 * eBRAIN Lab, New York University (NYU) Abu Dhabi(eBRAIN实验室,纽约大学(NYU)阿布扎比)
专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文提出了一种多层方法,通过硬件和软件协同设计和优化流程,提升多模态基础模型的效率。方法包括混合精度量化、结构剪枝、推测解码等技术,结合硬件加速器优化计算和内存需求,验证了在医疗和代码生成任务中的有效性。
Comments Accepted at the Design, Automation and Test in Europe Conference (DATE), April 20-22, 2026 in Verona, Italy
具有可变预填和解码长度的LLM服务优化
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系) ; Department of Industrial Engineering and Decision Analytics, HKUST(香港科技大学工业工程与决策分析系)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究在固定KV缓存内存预算下,异构提示和响应长度的离线调度问题,提出Sorted-F算法以平衡批次大小与下游解码成本,实现常数因子近似保证。
通过概率需求建模实现LLM应用的高效服务
机构 * Shanghai Jiao Tong University(上海交通大学) ; Huawei Cloud(华为云) ; Unaffiliated(无隶属机构)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Hermes系统,利用概率需求图建模LLM应用资源需求,采用Gittins策略优化调度顺序,预热冷后台,提升服务效率,减少平均完成时间70%以上,P95完成时间80%以上。
Journal ref ACM Transactions on Architecture and Code Optimization 23, 2, Article (June 2026), 1-25
UniRank: 面向低秩大语言模型压缩的统一秩分配方法
机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究院,东方理工大学(宁波)) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出UniRank方法,将全局低秩分配转化为排序截断流程,通过局部奇异能量比和全局功能重要性双准则评分各奇异分量,并引入秩保持微调避免信息损失,在一次性压缩中困惑度降低高达50%。
PerceptionDLM:基于多模态扩散语言模型的并行区域感知
机构 * Peking University(北京大学) ; MSALab ; ByteDance(字节跳动)
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 提出PerceptionDLM,利用扩散语言模型的并行解码特性,通过高效提示和结构化注意力掩码实现多区域并行感知,显著提升推理效率,并构建ParaDLC-Bench基准进行评估。
Comments Code available at https://github.com/MSALab-PKU/PerceptionDLM
TWLA:通过训练后量化实现大语言模型的三值权重和低位激活
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 效率与部署 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出TWLA框架,通过后训练量化实现1.58位权重和4位激活,解决激活分布长尾问题,加速推理。
Comments Accepted by ICML 2026
Litespark Inference For CPUs: 三元(1.58位)语言模型的超快SIMD框架
机构 * Mindbeam AI
专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI
AI总结 针对三元语言模型权重为{-1,0,1}的特点,提出自定义SIMD内核,用加减运算替代矩阵乘法,在CPU上实现18-96倍加速和6倍内存减少。
数据高效的自回归到扩散语言模型通过策略内蒸馏
机构 * Department of Computer Science and Engineering, Texas A&M University(德克萨斯大学阿马尔科分校计算机科学与工程系) ; Department of Bioinformatics and Systems Medicine, University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校生物信息学与系统医学系) ; Department of Electrical and Computer Engineering, Texas A&M University(德克萨斯大学阿马尔科分校电气与计算机工程系)
专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);post-training(abstract);分类 cs.CL、cs.AI
AI总结 提出策略内扩散语言模型(OPDLM),通过策略内蒸馏将自回归模型转换为扩散语言模型,解决分布偏移和训练-推理不匹配问题,实现15倍至7000倍更少训练数据下的强性能。
重新思考持续经验内化以实现自我进化的大语言模型智能体
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) ; School of Software, Beihang University(北航软件学院) ; Meituan(美团)
专题命中 效率与部署 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文通过经验粒度、注入模式和内化机制三个维度,提出一种稳定可持续的经验内化方法,解决多轮经验学习中的能力崩溃问题。
Comments 10 pages, 8 figures