Do Compressed LLMs Forget Knowledge? An Experimental Study with Practical Implications
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
激活与影响感知秩 (AIR):保持功能的SVD压缩用于大语言模型
机构 * Fraunhofer HHI(弗劳恩霍夫研究所)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.LG;foundation model(comments)
AI总结 提出AIR框架,基于SVD和反向信号影响度量,通过单次交替最小二乘扫描实现权重矩阵的低秩近似,在参数保留≤60%时困惑度比SVD-LLM(W)改善>18%,并减少90%校准数据。
Comments Accepted at the ICML 2026 Workshop on Resource-Adaptive Foundation Model Inference (AdaptFM), Seoul, South Korea (non-archival)
AWP: 基于激活感知的权重剪枝与量化方法(投影梯度下降)
机构 * Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 AWP通过投影梯度下降方法实现激活感知的权重剪枝与量化,优于现有LLM压缩技术。
Comments ICML 2025 workshop on Efficient Systems for Foundation Models
ES-VP:用于高效模型适配的能量型动态视觉提示
机构 * Rutgers University(罗格斯大学) ; Zhejiang University(浙江大学) ; University at Buffalo, SUNY(纽约州立大学布法罗分校) ; Adobe Research(奥多比研究院) ; University of Connecticut(康涅狄格大学) ; Washington University(华盛顿大学)
专题命中 效率与部署 :prompting(title,abstract)
AI总结 本文提出ES-VP方法,以低秩初始化和能量引导动态适配生成图像特异性提示,参数效率更高、泛化性更好,在多架构多数据集上均优于现有SOTA视觉提示方法。
基于视觉基础模型的跨域目标检测的语义兼容知识蒸馏
机构 * National Supercomputing Center in Changsha, Hunan University(湖南大学长沙国家超级计算中心)
专题命中 效率与部署 :foundation model(title,abstract)
AI总结 该研究针对跨域目标检测中VFM的语义不兼容问题,提出SLE-T框架,通过适配DINOv2实现高效知识迁移,在DAOD基准上达到SOTA性能,且训练成本更低。
CSMoE:一种基于软混合专家(MoE)的高效遥感基础模型
机构 * Berlin Institute for the Foundations of Learning and Data (BIFOLD)(柏林学习与数据基础研究院) ; Technische Universität Berlin(柏林技术大学)
专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)
AI总结 该研究针对现有遥感基础模型计算复杂度高、表征能力或数据效率不足的问题,提出基于软混合专家机制的CSMoE模型及主题-气候描述符采样策略,在多任务上性能相当且浮点运算量显著降低。
减少矩阵乘法:面向大语言模型推理的输入自适应矩阵乘积约简方法
机构 * University of Chicago(芝加哥大学) ; Stony Brook University(石溪大学)
专题命中 效率与部署 :LLM(title);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究针对Transformer语言模型推理开销高的问题,提出无需训练的输入自适应RMM方法,通过选择矩阵乘积信息切片减少计算,在多任务多模型上验证其鲁棒性,可提升长序列推理效率,且适用于多模态场景。
Comments 24 pages
基于基础模型的高效数据采样(FEEDS):用于泛癌、多示踪剂PET/CT数据集的标签高效训练策略
机构 * Geisel School of Medicine at Dartmouth(达特茅斯盖泽尔医学院) ; Dartmouth Hitchcock Medical Center(达特茅斯-希区柯克医疗中心) ; Yale University(耶鲁大学)
专题命中 效率与部署 :foundation model(title,abstract)
AI总结 该研究提出FEEDS策略,利用视觉基础模型嵌入选择信息性和多样性未标注病例,在减少70%标注负担时达到全标注训练性能,解决了PET/CT病灶分割的标签稀缺问题。
Comments Code is publicly available on https://github.com/Image-and-Multimodal-Data-Analytics/FEEDS
评估基础模型在遥感影像中小规模光伏分割的语义与空间引导
机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学) ; The Hebrew University of Jerusalem(耶路撒冷希伯来大学) ; Ben Gurion Institute for the Study of Israel & Zionism(本-古里安以色列与犹太复国主义研究所) ; Ben-Gurion Israel Research Institute(本-古里安以色列研究所)
专题命中 效率与部署 :foundation model(title,abstract);prompting(abstract)
AI总结 该研究评估了SAM3在遥感影像中小规模光伏分割中不同提示策略的效果,发现混合提示性能最优,仅需少量标注样本即可实现高效分割,为无电网地区光伏测绘提供了可行方案。
LAAFD: 基于大语言模型的加速FPGA设计代理
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)
AI总结 LAAFD利用大语言模型将通用C++转换为优化的Vitis HLS内核,实现高性能FPGA设计,同时降低专业门槛。
WiFo-INR:一种基于隐式神经表示的无线基础模型
专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)
AI总结 本研究提出基于隐式神经表示的无线基础模型WiFo-INR,通过两阶段自监督预训练实现高效紧凑的CSI表示,在性能提升的同时降低延迟,可高效迁移至多任务并实现零样本泛化。
用于语言模型的Length-MAX分词器
机构 * Dong Dong(董东) ; Weijie Su(苏伟杰)
专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Length-MAX分词器通过优化平均token长度,提高了语言模型的效率和下游任务性能。
Comments Accepted at Transactions on Machine Learning Research (TMLR). OpenReview: https://openreview.net/forum?id=CRjrpwGD9A
SlimVLM:面向高效视觉-语言模型的感知敏感性动态结构化剪枝与自适应视觉token选择
专题命中 效率与部署 :language model(title,abstract);large language model(abstract)
AI总结 SlimVLM是一种结构化剪枝框架,通过自适应视觉token选择和感知敏感性动态剪枝机制,在压缩视觉-语言模型的同时保持性能,在多模态基准测试中达到最优。
LEAP:用于高效Transformer推理的分层退出感知预训练
机构 * Walmart Inc.(沃尔玛公司)
专题命中 效率与部署 :pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 LEAP通过分层退出感知预训练解决传统蒸馏与早退机制的兼容性问题,实现显著的推理加速与效率提升。
Comments Accepted at ACL 2026 (Industry Track). 14 pages, 5 figures
Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Industry Track, pages 761-774, San Diego, California, USA
一种面向共享内存网络的开关中心网络架构,用于加速大语言模型推理
专题命中 效率与部署 :LLM(title,abstract)
AI总结 本文提出SCIN架构,通过在开关内直接访问附加加速器的内存区域,实现低延迟高带宽的All-Reduce,同时支持8位精度的In-Network Quantization,提升LLaMA-2模型推理效率。
TextNCA:通过分层局部注意力实现语言建模的神经细胞自动机
机构 * Singapore Institute of Technology(新加坡理工学院) ; IIIT Delhi(德里印度信息技术学院) ; Nanyang Technological University(南洋理工大学) ; NVIDIA AI Technology Centre(英伟达人工智能技术中心)
专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究提出分层局部注意力的TextNCA模型作为分析探针,发现其性能受从窄到宽的分阶段调度主导,迭代和GRU门控等仅带来小增益。
利用对抗蒸馏定制去偏差的、针对乳腺癌的疾病专用病理学基础模型
机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) ; School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院) ; Leicester Cancer Research Centre, University of Leicester(莱斯特大学莱斯特癌症研究中心) ; Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Nuffield Department of Medicine, University of Oxford(牛津大学纳菲尔德医学院) ; Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程学系) ; ZoyMed(佐医医疗(ZoyMed))
专题命中 效率与部署 :foundation model(title,abstract)
AI总结 本研究提出SmartStu框架,通过多教师集成蒸馏与对抗蒸馏等技术,定制出比通用PFMs小30倍以上且性能相当的乳腺癌专用病理学基础模型。
Comments 11 pages, 2 figures, 2 tables. Accepted to MICCAI 2026 (early accept)
看见不可见:基于知识增强视觉语言模型的无训练风机叶片检测方法
专题命中 效率与部署 :language model(title,abstract)
AI总结 该研究提出结合RAG与VLM的零样本风机叶片检测框架,构建多模态知识库,在小样本测试中表现优于基线,为工业检测提供数据高效方案。
MedARC:面向3D医学视觉-语言模型的无训练视觉令牌自适应冗余压缩
专题命中 效率与部署 :language model(title,abstract);foundation model(abstract)
AI总结 针对3D医学VLMs的视觉令牌冗余压缩问题,本文提出无训练框架MedARC,整合三类线索估计令牌重要性,通过显著性感知合并策略压缩令牌,在CT-RATE和MR-RATE上实现性能保持的同时降低开销。
Comments 9 pages
UltraViT:用于大型视觉语言模型的延迟优化设备端视觉编码器
机构 * Samsung AI Cambridge(三星人工智能剑桥实验室) ; Technical University of Iasi(雅西技术大学) ; Queen Mary University of London(伦敦玛丽女王大学)
专题命中 效率与部署 :language model(title,abstract);LLM(abstract)
AI总结 针对大型视觉语言模型在设备端部署受限问题,提出UltraViT视觉编码器,通过考虑设备延迟设计金字塔架构,并采用两阶段生成式预训练策略,有效提升编码效率,优于现有基线。
Comments Accepted at ECCV 2026
Mask2Shield:增强大语言模型抵御神经元剪枝攻击的安全性
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)
AI总结 研究针对大语言模型神经元剪枝攻击问题,提出Mask2Shield方法,通过掩码前向对齐训练模型,减少对可移除安全神经元集的依赖,降低针对性剪枝攻击成功率,同时保持能力基准。
通过分类引导的大型视觉语言模型从文档中提取视觉信息
机构 * China Mobile Information Technology Co., Ltd.(中国移动信息技术有限公司) ; School of Information Science and Engineering, NingboTech University(宁波诺丁汉大学信息科学与工程学院)
专题命中 效率与部署 :language model(title,abstract);SFT(abstract)
AI总结 研究从视觉丰富文档提取视觉信息的挑战,提出分类引导大型视觉语言模型框架,通过解耦分类与提取、运用动态提示工程实现零样本推理,在真实数据集上性能超监督基线,为办公自动化文档理解提供高效方案。
Comments 14 pages, 3 figures
Journal ref Scientific Reports 16, 14158 (2026)
大语言模型在医疗分诊中的社会经济推断:相同症状,不同邮政编码
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)
AI总结 研究大语言模型对相同症状但不同社会经济地位患者的医疗分诊建议,通过三个模型固定症状改变SES信号,发现对明确信号各模型均提高低SES患者急诊转诊率,对隐含信号的敏感性因模型而异,揭示信号明确性梯度并发布相关内容。
Comments 8 pages, 4 tables. Code, prompts, and raw results: https://github.com/wongqihan/triagebench
以太坊非同质化代币智能合约:基于大语言模型和代码切片的知识引导漏洞检测
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)
AI总结 研究以太坊NFT智能合约漏洞检测,结合漏洞聚焦代码切片、ERC-721知识库及受限DeepSeek分析,正则表达式定位候选语句,提取代码切片分析,结果显示聚焦代码上下文和领域约束影响检测器输出,提升阳性标签率。
SonicSampler:用于语言模型采样和推测性验证的统一瓦片感知内核
机构 * Together AI
专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对语言模型推理采样中现有实现的局限,提出SonicSampler,它是统一的瓦片感知Triton内核套件,垂直融合采样流水线。核心方法是分层两阶段top-k算法,在异构推测性解码工作负载中比基线快达16倍,保持灵活批处理执行。
Comments 26 pages, 12 figures
一个用于德语和英语的自主开源基础模型
机构 * KI Bundesverband(德国人工智能协会) ; DFKI(德国人工智能研究中心) ; Fraunhofer IAIS(弗劳恩霍夫自动化与信息研究所) ; Fraunhofer IIS(弗劳恩霍夫集成电路研究所) ; Technische Universität Darmstadt(达姆施塔特工业大学) ; Universität Würzburg(维尔茨堡大学) ; Berliner Hochschule für Technik(柏林技术大学) ; L3S Research Center(L3S研究中心) ; ellamind(艾拉明德公司) ; Merantix Momentum(梅兰蒂克斯动力公司)
专题命中 效率与部署 :foundation model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究提出自主开源的Soofi S 30B - A3B基础模型,采用MoE混合设计,预训练于约27万亿令牌,在德英语基准测试表现出色,优于欧洲自主基线及其他开源模型,将在宽松条款下发布,为相关领域提供强大且开源的模型支持。
人工智能解码芯片的经济学:重新平衡计算、容量和带宽以实现高效的大语言模型推理
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)
AI总结 研究大语言模型解码中GPU计算与内存不匹配问题,提出用F/B和F/S常数衡量效率,主张重新平衡解码加速器,介绍Skymizer HTX-301优势,如成本低、无受限输入,能以较低成本实现高效推理。
视觉-语言模型中基于情境的可及性计算
机构 * Dissensus AI ; King’s College London(伦敦国王学院)
专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究揭示视觉-语言模型中可及性计算的高度情境依赖性,通过大规模实验显示超过90%的词汇描述受情境影响,提出动态本体投影方法替代静态世界建模。
Comments 33 pages, 13 tables, 3 figures. Code available at: https://github.com/studiofarzulla/semantic-vision
诊断和修复大语言模型建议中的角色崩塌
专题命中 效率与部署 :LLM(title);post-training(abstract);prompting(abstract)
AI总结 研究大语言模型建议中的角色崩塌问题,提出逆过程蒸馏方法,将情境到角色的策略提炼出来进行训练,减少与人类角色分布的差异,但在盲测中发现多数经验丰富的建议者更青睐崩塌的默认回复。
Comments Working draft
用于边缘高效病理学基础模型的多教师对比蒸馏
机构 * EKFZ for Digital Health(数字健康EKFZ) ; TU Dresden(德累斯顿工业大学) ; University of Augsburg(奥格斯堡大学) ; Bavarian Cancer Research Center (BZKF)(巴伐利亚癌症研究中心) ; Department of Medicine I, TU Dresden(德累斯顿工业大学第一医学院) ; NCT Heidelberg(海德堡NCT) ; University of Leeds(利兹大学)
专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)
AI总结 研究针对计算病理学基础模型本地部署难题,提出MuCoDi预训练框架,通过多教师对比蒸馏,将多个PFMs的切片嵌入蒸馏到轻量级编码器,经实验验证该方法能大幅减小模型大小并保持性能,推动病理学表示向边缘部署发展。