AnchorKV: Anchor-Residual KV Cache Compression
AnchorKV:锚点-残差键值缓存压缩
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG
AI总结 针对长上下文LLM推理的KV缓存内存瓶颈,提出AnchorKV压缩方案,不丢令牌且压缩20倍,70B规模下保留99%全缓存精度,大幅降低上下文成本。
Comments Under review
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
AnchorKV:锚点-残差键值缓存压缩
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG
AI总结 针对长上下文LLM推理的KV缓存内存瓶颈,提出AnchorKV压缩方案,不丢令牌且压缩20倍,70B规模下保留99%全缓存精度,大幅降低上下文成本。
Comments Under review
LEAP:面向GPU内核生成的代码强化学习的自适应剪枝轻量环境反馈框架
机构 * Moore Threads(摩尔线程)
专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 LEAP是针对GPU内核生成的代码强化学习框架,通过难度条件剪枝与基于排名的奖励公式解决低级代码RL的信号稀疏性等问题,收敛更快且性能更优。
跨语言的推测解码
机构 * University of Colorado(科罗拉多大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文研究了通过微调草稿模型或使用n-gram模型来提高非英语语言中推测解码效率的策略,发现任务特定蒸馏虽能提升效率但泛化性差,而n-gram模型尽管接受率较低,但由于生成速度快,始终能提供显著的加速效果。
Comments 15 pages, 12 figures, submitted to ACL ARR August 2026
野外环境下的智能体编码:生产规模下GitHub Copilot轨迹的特征分析
机构 * Microsoft Azure Research(微软Azure研究院) ; Microsoft Azure(微软Azure)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 该研究对GitHub Copilot等AI编码智能体的生产规模轨迹进行特征分析,揭示其工作负载特性,设计轻量级空闲预测器,为智能体原生LLM服务基础设施提供实证基础。
Prox:基于大语言模型中近似中间通道显著性的无训练前馈网络激活稀疏化方法
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 Prox是一种两阶段无训练的SwiGLU前馈网络激活稀疏化框架,通过近似中间通道显著性构建掩码,在多类大语言模型上实现了优于基线的性能与解码加速,且兼容量化和稀疏注意力。
自适应深度稀疏框架:基于相似性驱动的预训练语言模型资源分配
机构 * Southern University of Science and Technology(南方科技大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 研究针对预训练语言模型推理成本高的问题,提出自适应深度稀疏框架AdaDSF,基于层输入输出隐藏状态余弦相似性分配令牌保留率,用轻量级路由器选择信息令牌,在多任务中大幅降推理FLOPs且精度退化小。
Comments Accepted by ICIC 2026. 12 pages, 2 figures, 4 tables
权重剪枝放大了偏见:压缩LLM用于边缘AI的多方法研究
机构 * Meta
专题命中 效率与部署 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究探讨了三种指令微调模型在不同剪枝方法下的公平性影响,发现激活感知剪枝虽保持低困惑度但放大偏见,而随机剪枝破坏语言能力但产生随机偏见,揭示剪枝对对齐风险高于量化。
Comments 8 pages, 7 figures, 8 tables. Accepted at the 7th Annual World AIIoT Congress (AIIoT 2026). This is the author's accepted version; the version of record will appear in IEEE Xplore
TriAgent:用于成本效益型金融情绪分析的差异感知多智能体委员会
机构 * The Overlake School(奥弗湖学校) ; Edwards Vacuum Inc.(爱德华兹真空公司) ; The University of Memphis(孟菲斯大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG
AI总结 研究针对基于生产LLM的金融情绪分析成本高问题,提出TriAgent多智能体委员会,按上下文粒度分层,用SDI衡量分歧并路由查询,有批评者平稳期等发现及三个推论,节省成本且效果好。
野外的智能体:研究与部署的交汇点
机构 * Georgetown University(乔治敦大学) ; Salesforce(Salesforce公司) ; Bayer(拜耳公司) ; Bloomberg(彭博公司) ; Microsoft Research(微软研究院)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 探讨基于大语言模型的智能体系统从研究到部署的转变,通过案例研究分析成功设计模式及失败缓解策略,为与会者提供跨行业安全可靠部署的全面视角、设计模式、评估清单和模板。
AgentJet:一种用于智能体强化学习的灵活群体训练框架
机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出AgentJet,一种解耦的多节点群体训练框架,支持异构多模型强化学习、多任务鸡尾酒训练、容错执行和实时代码迭代,并通过上下文跟踪模块实现1.5-10倍训练加速。
Comments Technical report, 32 pages
OPINE-World:基于本体错误优先的交互式探索的程序化世界建模
机构 * University of Toronto(多伦多大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 提出OPINE-World,一种在线交互学习面向对象的程序化世界模型的LLM智能体,通过本体错误度量引导探索,在ARC-AGI-3基准上无需逐游戏训练即解决20/25个游戏,动作效率达78.4。
遵循潜在路径:利用锚定令牌导航扩散LLM的可撤销解码
机构 * King's College London(伦敦国王学院) ; The Chinese University of Hong Kong(香港中文大学) ; The Alan Turing Institute, UK(英国艾伦·图灵研究所)
专题命中 效率与部署 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对扩散大语言模型解码速度与质量的权衡,提出无训练框架ASRD,通过锚定令牌解耦上下文,结合锚定引导生成与锚定扰动验证,在数学和编码基准上提升准确率6.4%,加速推理7.2倍。
DSpark:结合半自回归生成的置信度调度投机解码框架
机构 * Peking University(北京大学) ; DeepSeek-AI(深势科技人工智能)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对现有投机解码接受率衰减、高并发下吞吐量劣化问题,DSpark采用半自回归架构与置信度调度验证,在实测中显著提升大模型推理速度与系统性能边界。
为人工智能智能体提供自然语言工具的显著有效性:一项在14个模型上验证自然语言工具性能的复制研究
机构 * Sage.is AI-UI(Sage.is人工智能用户界面)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究独立复制并扩展了自然语言工具(NLT)框架,在14个模型和8560次试验中评估NLT,验证其效果,发现其能提升工具调用准确率、减少关键错误、降低令牌使用量,还证实模型能力对NLT优势有调节作用。
Comments 28 pages, 6 figures, replication study, replication of arXiv:2510.14453 findings
用于大语言模型中顺序信息收集的摊销贝叶斯实验设计
机构 * University of Oxford(牛津大学) ; Ellison Institute of Technology(埃里森理工学院)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型在顺序决策中信息收集问题,提出摊销顺序信息收集方法,将贝叶斯实验设计融入模型策略,经实验验证该方法能有效提升成功率并降低推理成本。
Comments 20 pages, 7 figures. Accepted to FoGen 2026: Foundations of Deep Generative Models: Understanding Memorization, Generalization, and Reasoning, an ICML 2026 workshop (non-archival)
ARCQuant:通过增强残差通道提升大语言模型的NVFP4量化
机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 提出ARCQuant框架,利用增强残差通道提升NVFP4性能,维持统一格式,将误差补偿融入矩阵降维以用标准GEMM内核,理论分析和实验表明达到先进精度且有实际效益。
Comments Accepted to ACL 2026 (Main Conference)
Journal ref In Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 8609-8623, San Diego, California, United States, July 2026. Association for Computational Linguistics
Evergreen:用于语义聚合的高效声明验证
机构 * Brown University(布朗大学) ; Snowflake Inc.(Snowflake公司)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 Evergreen将声明验证转化为语义查询处理任务,通过定制优化和溯源捕获,减少LLM调用成本和延迟,提升验证质量与效率。
FED-FSTQ:基于Fisher的令牌量化用于边缘设备上通信高效联邦微调大型语言模型
机构 * School of Computing and Information Technology, Great Bay University(计算与信息学院,大亚湾大学) ; Beijing Institute of Technology(北京理工大学) ; University of Warwick(沃里克大学) ; City University of Hong Kong (Dongguan)(香港城市大学(东莞)) ; Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Fed-FSTQ,一种基于Fisher的令牌量化方法,用于在边缘设备上高效联邦微调大型语言模型,通过非均匀混合精度量化和重要性感知令牌选择,减少通信开销并提升训练效率。
Comments 18 pages, 14 figures
超环变压器
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG
AI总结 本文提出一种改进语言模型参数效率的超环变压器架构,通过循环Transformer和超连接技术,在较少参数下优于基线模型。
DuoMem: 通过双空间蒸馏实现高效的设备端记忆代理
机构 * Samsung R&D Institute UK(三星英国研发中心) ; Queen Mary University of London(伦敦女王大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出DuoMem双空间蒸馏框架,将大型教师模型的过程问题解决能力转移到紧凑学生模型,在ALFWorld基准上将4B参数模型的任务成功率从4.3%提升至77.9%,接近72B教师模型的87.1%,且参数增加少于10M,速度提升3倍以上。
Comments 18 pages, 7 figures, 10 tables
召回再排序:面向大规模代码到代码检索的深度学习模型基准测试
机构 * Sant’Anna School of Advanced Studies(圣安娜高级研究院)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG
AI总结 本文评估了当代深度学习模型在大规模代码到代码搜索引擎中第一阶段召回的有效性、效率和可扩展性,并提出了基于LLM的代码标准化和查询重写方案,以提升低性能模型的精度。
Comments 15 pages, 4 figures
测量语音大语言模型中解码器层的冗余性
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究语音大语言模型解码器层的冗余性,发现7-8B模型仅需60%的解码器层即可保持良好ASR性能,且冗余结构跨语音编码器、任务和语言一致。
Project Auto-World: 迈向神经关系推理器的自动化基准测试
机构 * Cardiff University(卡迪夫大学) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 利用大语言模型自动化生成基准测试实例,通过进化搜索和自主代理搜索发现困难样本,提升Edge Transformer的泛化能力,并应用于新世界以推动神经关系推理的自主研究。
Comments Submitted to NeurIPS 2026 E&D track. Code is available at https://github.com/autoworldrules/auto-world-rules
MONAQ:面向资源受限设备的时间序列分析多目标神经架构查询
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 MONAQ通过多目标神经架构查询框架,结合大语言模型能力,实现对时间序列数据的高效处理与部署,实验表明其模型性能优于传统方法。
Comments EMNLP 2025 (Findings), Project Page: https://kaist-dmlab.github.io/MONAQ
ThermoLLM: 基于空间语义知识图谱的热力学感知HVAC控制
机构 * University of New South Wales(新南威尔士大学) ; CSIRO Energy Centre(澳大利亚联邦科学与工业研究组织能源中心)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 提出一种热力学感知的LLM控制框架,利用物理信息空间知识图谱和近期交互历史,实现多区域HVAC的节能与舒适度优化。
Comments 10 pages, 5 figures. Submitted to ACM SIGSPATIAL 2026
小型LLM:剪枝 vs. 从头训练
机构 * Princeton University(普林斯顿大学) ; New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 效率与部署 :LLM(title_cn);language model(abstract);small language model(abstract);分类 cs.CL、cs.LG
AI总结 本文通过六种剪枝方法在Llama-3.1-8B上比较剪枝与从头训练,发现有限预算下剪枝更优,预算充足时粗粒度剪枝可被超越。
Comments Our code is available at https://github.com/zlab-princeton/pruning-vs-scratch
通过演化程序瓶颈解释神经组合优化
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Nanyang Technological University(南洋理工大学) ; Microsoft Research(微软研究院) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 提出演化程序瓶颈(EPB)框架,通过将黑盒神经组合优化模型蒸馏为可读程序组合,利用LLM和混合梯度下降实现可解释性,揭示模型行为与经典启发式变体的关系。
Comments Under Review
大语言吉布斯结构化推理
机构 * University of Edinburgh, School of Informatics(爱丁堡大学信息学院)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 提出大语言吉布斯方法,利用大语言模型的条件分布作为转移算子进行结构化概率推理,通过迭代重采样变量避免顺序偏差,在合成分布、一致性推理和贝叶斯结构学习中验证有效性。
Comments Code: https://github.com/hyeok9855/large-language-gibbs
信任区域在线策略蒸馏
机构 * Samsung Research(三星研究院) ; University of Oxford(牛津大学) ; Peking University(北京大学)
专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 提出信任区域在线策略蒸馏(TrOPD),通过信用分配策略和信任区域学习解决师生分布差异导致的训练不稳定问题,在数学推理、代码生成和通用基准上超越现有方法。
模型选择在因果推断中的关键作用:基于InferBERT框架的药物警戒分类模型比较分析
机构 * Department of Stochastics, Institute of Mathematics, Budapest University of Technology and Economics(布达佩斯技术与经济大学数学研究所随机学系) ; Institute of Biostatistics and Network Science, Semmelweis University(塞梅维什大学生物统计学与网络科学研究所) ; Department of Computer Science, University of Warwick(华威大学计算机科学系)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG
AI总结 本研究在InferBERT框架下比较XGBoost、ALBERT、BioBERT和Med-LLaMA四种模型,发现领域特定预训练(BioBERT)在药物警戒因果ADE检测中优于简单基线和大型LLM,校准改善ECE但对准确率和因果发现影响不一。
Comments 10 pages, 5 figures