TextPruner: A Model Pruning Toolkit for Pre-Trained Language Models
专题命中 效率与部署 :language model(title,abstract);post-training(abstract);分类 cs.CL
Comments 7 pages. Accepted to ACL 2022 Demo
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 效率与部署 :language model(title,abstract);post-training(abstract);分类 cs.CL
Comments 7 pages. Accepted to ACL 2022 Demo
专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);分类 cs.CL
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL
Comments Under Review
专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);分类 cs.CL
Comments 11 pages. SustaiNLP workshop at EMNLP 2021
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL
Comments Accepted to SC 2021
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL
DistillPath:一种高效的22M级蒸馏病理编码器,性能接近大型基础模型
机构 * ETH Zürich(苏黎世联邦理工学院)
专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)
AI总结 本文提出22M级蒸馏病理编码器DistillPath-KS16,通过蒸馏86M至1.1B的病理编码器得到,性能接近大型模型Virchow2,参数少29倍、速度快25倍以上,在EVA等基准上表现优异。
Comments 26 pages, 5 figures. Accepted at the ECCV 2026 Workshop on Medical Foundation Models and Benchmarks (MedFM-Bench)
mHC-SSM:基于流的约束超连接用于具有流专用适配器的状态空间语言模型
机构 * Department of Digital Forensics Engineering, Technology Faculty, Firat University(费拉特大学数字取证工程系)
专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG;SLM(comments)
AI总结 本文提出mHC-SSM,通过约束残差流混合矩阵到双随机矩阵流形,改进状态空间语言模型的性能,并引入流专用适配器以提升模型效果。
Comments 28 Pages, 3 Figures, all implementation code available at: https://github.com/abdulvahapmutlu/mhc-slm
专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments "Primer: Searching for Efficient Transformers for Language Modeling" NeurIPS camera ready. 34 pages
MAPLE:MoE自适应即插即用分层专家分配
机构 * University of Bristol(布里斯托尔大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 MAPLE是一种即插即用框架,可在不修改预训练MoE LLM权重或重新训练的情况下,异质性分配专家预算,在75%预算下超越基线,降低延迟并提升吞吐量,同时提升多项任务准确率。
小型推理模型是函数调用中的指令跟随者
机构 * Islamic Azad University(伊斯兰阿扎德大学) ; University of Isfahan(伊斯法罕大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出指令跟随式函数调用(IFFC)框架,将函数调用逻辑与主大语言模型解耦,交由专用小型模型处理,其性能优于原生和基于提示的函数调用基线,可高效部署于边缘计算场景。
因果锻造:一个用于因果推理自动化研究的形式化基础、自我改进的智能框架
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出因果锻造框架用于因果推理自动化研究,结合因果论库与因果史密斯智能管道,通过声明审核增强内核验证,并用自主研究工件评估系统,为因果推理自动化研究提供新途径。
STS: 高效稀疏注意力与推测性标记稀疏性
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; UC Berkeley(加州大学伯克利分校)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文提出STS,一种无需模型再训练的稀疏注意力机制,通过利用较小的草稿模型识别出的重要标记来预测更大目标模型的重要标记,从而在大规模语言模型推理中实现高效的稀疏注意力计算,显著提升速度并保持准确性。
Comments 14 pages, 12 figures
压缩与遗忘:bitsandbytes量化放大了大语言模型中的主动干扰
机构 * Shahid Beheshti University(沙希德·贝赫什提大学)
专题命中 效率与部署 :post-training(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 该研究发现bitsandbytes 4位量化会放大大语言模型的主动干扰,降低高干扰场景下的检索准确率,其效应源于量化后的Transformer主干,对依赖长语义密集上下文的应用有额外成本。
Comments 21 pages, 6 figures, 11 tables. Author list formatting simplified. Code and data released at https://github.com/ShayanShahrabi/compress-and-forget
量化智能体剖析:代码合成智能体工作负载中的VRAM稳定性与预测
机构 * Nokia Germany(诺基亚德国)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 该研究针对基于LangGraph的AgentK智能体,在1920条轨迹上评估量化LLM的VRAM消耗,提出闭式峰值内存预测模型,发现编译成功率受LLM容量限制,且无需复杂VRAM预测模型。
大语言模型不承担“跳跃”的代价
机构 * Birla Institute of Technology and Science, Pilani(毕拉理工与科学学院皮拉尼分校)
专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 该研究指出LLMs无法完成催生科学发现的溯因“跳跃”,因固定权重Transformer推理缺乏认知误差与物理代价的耦合,提出机器溯因需更深层物理机制的核心观点。
Comments 14 pages
联邦提示学习:统一框架、实证分析与未来方向
机构 * Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学先进技术网络空间研究院) ; Huangpu Research School of Guangzhou University(广州大学黄埔研究院) ; Iwate Biotechnology Research Center(岩手生物技术研究中心) ; Nanjing University of Posts and Telecommunications(南京邮电大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文为联邦提示学习(FPL)的全面综述,明确其与传统联邦学习及全模型联邦微调的差异,分析其多维度权衡与现存挑战,梳理全生命周期方法及防御机制,为该领域研究提供方向。
填补空白:常识知识生成对自然语言推理是否有帮助?
机构 * University of Florida(佛罗里达大学)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本研究探讨了大型语言模型通过生成常识公理提升自然语言推理性能的效果,并发现选择性知识访问能有效提高准确率并减少对中性类别的偏见。
Comments 12 pages, 7 figures, and 5 tables
幂律图注意力:缩放点积注意力的精确泛化,推理时的经验崩溃
机构 * Fromthesky Research Labs LLC(弗洛姆斯基研究实验室有限责任公司)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 该研究提出PLGA注意力机制,其在$G_{LM}=I$时精确包含SDPA,还证明了推理崩溃定理,在测试样本上的分块与顺序评分结果与TruthfulQA度量偏差极小,相关证明核心已通过Lean 4机器验证。
Comments 61 pages, 1 figure, 8 tables
论智能体工具调用与强化学习训练的有效性与效率
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Toronto(多伦多大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文系统分析工具调用评估中的实现选择对结果敏感性的影响,并针对强化学习训练中的计算浪费提出两种加速技术。
Comments ICML 2026
SAGE:面向生产级RAG系统的感知SLO自适应检索方案
机构 * Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG
AI总结 SAGE是面向生产级RAG系统的感知SLO自适应检索策略,通过模仿学习训练,能动态选段落数,在多数据集与LLM上提升SLO合规率、降本减时延且质量损失小。
Comments 7 pages, 5 figures, 2 tables. Authors' accepted version of a paper published in Proc. IEEE CoDIT 2026. The version of record is available at the DOI below
Journal ref 2026 12th International Conference on Control, Decision and Information Technologies (CoDIT), Bari, Italy, 2026, pp. 169-175
基于技能的智能体人工智能系统中的动态联盟形成与通信定价
机构 * University of Calgary(卡尔加里大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对技能型智能体 AI 系统通信低效问题,提出基于夏普利值的边际值激活与贪心路由方法,在合成实验中其效用达蛮力最优的 99.5%,激活智能体数远少于全广播。
KV缓存量化下的对齐崩溃:诊断与缓解
机构 * Stanford University(斯坦福大学) ; California Institute of Technology(加利福尼亚理工学院)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究发现低比特KV缓存量化会无声破坏大模型的安全对齐,根源在于安全特征位于低维激活子空间,易受量化噪声影响;提出逐通道缩减(PCR)诊断方法,分类三种失效模式并指导缓解,无需训练即可恢复高达97%的对齐损失。
Comments Preprint. 61 pages, 9 figures
SkillClaw: 让技能与代理进化者共同进化
机构 * DreamX Team(DreamX团队)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 SkillClaw通过聚合多用户交互数据,实现技能的集体进化,提升代理在现实场景中的性能。
TreeHop:高效的嵌入层查询重写器
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 TreeHop是一种无需LLM的嵌入层MHQA框架,通过精简循环降低计算开销,在四个开放域MHQA数据集上性能与先进RAG相当,参数仅为现有方案2.2%-29.4%,延迟降低92.8%-97.8%。
Comments 8 pages
头自主性:基于冻结查询-键几何的无数据稀疏注意力
机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Baidu Inc.(百度公司)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出无数据稀疏注意力方法 AoH,通过查询-键投影谱几何识别检索头与流头,在 50% 稀疏度下平均保留全注意力 96.5% 性能,同时显著降低 LLM 的计算延迟与 KV-cache 内存。
APQF:基于智能体分析引导的结构化剪枝与混合精度量化及自适应微调
机构 * Iowa State University(爱荷华州立大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 APQF是结合LLM引导与分析支撑的自动化剪枝量化框架,在ImageNet等数据集上实现高压缩比且精度接近基线,优于现有联合剪枝量化方法。
Comments 22 pages, 7 figures
平衡效率与效能:面向多模态大语言模型(MLLM)的无训练注意力引导式显式与隐式思维切换
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对MLLM推理中感知与逻辑混淆的问题,提出无训练的注意力引导式切换框架,通过视觉-文本注意力比率自适应切换显式与隐式推理,实现性能与效率的双重提升。
Comments Accepted by ACM MM 2026. 10 pages, 6 figures, 5 tables
面向移动端检索增强生成的轻量级分块选择
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本文针对移动端RAG部署的成本问题,提出结合LLM侧查询意图、MoE路由信号与检索分块嵌入的轻量级分块选择方法,提升了排名1的证据选择性能。
通过结构感知策略学习内化学术写作工作流以生成引言
专题命中 效率与部署 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对LLM生成论文引言的挑战,提出StructPO框架将多阶段写作工作流内化为单遍策略,实验显示其在语义对齐等指标上优于基线,泛化性好且与GPT-5.1性能相当。