arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22497 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22497 篇

2605.08685 2026-05-12 cs.LG cs.AI 81%

Event Fields: Learning Latent Event Structure for Waveform Foundation Models

事件场:学习隐式事件结构用于波形基础模型

Li Na, Yuanyun Zhang, Shi Li

机构 * University of Science and Technology of China(中国科学技术大学) Columbia University(哥伦比亚大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种新的波形基础模型,通过将生理时间序列建模为隐式事件过程的实现,而非传统序列表示。该方法通过自监督学习框架,促使波形的随机分割和时间频率投影之间的一致性,提升模型对信号扰动的鲁棒性并保持事件层面的组织结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08128 2026-05-12 cs.LG cs.AI 81%

Towards Universal Gene Regulatory Network Inference: Unlocking Generalizable Regulatory Knowledge in Single-cell Foundation Models

迈向通用基因调控网络推断:在单细胞基础模型中解锁可泛化的调控知识

Jiaxin Qi, Hang Li, Yan Cui, Yuhua Zheng, Jianqiang Huang

机构 * Computer Network Information Center, Chinese Academy of Sciences, Beijing, China(中国科学院计算机网络信息中心,北京,中国) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China(中国科学院大学杭州高等研究院,杭州,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出两种新方法,通过单细胞基础模型提取隐含的调控信息,提升基因调控网络推断的泛化能力,实验表明优于现有方法。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20816 2026-05-11 cs.CL cs.LG 81%

Don't Ignore the Tail: Decoupling top-K Probabilities for Efficient Language Model Distillation

不要忽视尾部:为高效语言模型蒸馏解耦top-K概率

Sayantan Dasgupta, Trevor Cohn, Timothy Baldwin

机构 * School of Computing and Information Systems, University of Melbourne, Melbourne, Australia(计算与信息系统学院,墨尔本大学,澳大利亚墨尔本)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种尾部意识的分歧度,解耦教师模型top-K预测概率与低概率预测的贡献,提升分布尾部信息在语言模型蒸馏中的作用。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22031 2026-05-08 cs.LG cs.AI 81%

Mochi: Aligning Pre-training and Inference for Efficient Graph Foundation Models via Meta-Learning

Mochi:通过元学习实现预训练与推理对齐的高效图基础模型

João Mattos, Arlei Silva

机构 * Computer Science Department(计算机科学系) Ken Kennedy Institute(肯尼迪研究所)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 Mochi通过元学习框架解决任务统一和训练效率问题,通过预训练与推理对齐提升性能,优于现有图基础模型。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05421 2026-05-08 cs.CV cs.AI cs.LG 81%

DARK: Diagonal-Anchored Repulsive Knowledge Distillation for Vision-Language Models under Extreme Compression

DARK:针对极端压缩下视觉-语言模型的对角锚定排斥知识蒸馏

Numan Saeed, Asif Hanif, Fadillah Adamsyah Maani, Hussain Alasmawi, Mohammad Yaqub

机构 * Mohamed Bin Zayed University of Artificial Intelligence(Mohamed Bin Zayed人工智能大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DARK,一种对比知识蒸馏框架,通过分解损失函数为对角项和非对角项,使学生模型在极端压缩下更高效地排斥教师模型的非目标相似结构,实验证明其在零样本基准上表现优异。

Comments Project website: www.numansaeed.com/mobilefetalclip

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05219 2026-05-08 cs.LG cs.AI 81%

Sparse Prefix Caching for Hybrid and Recurrent LLM Serving

稀疏前缀缓存用于混合和递归语言模型服务

Mikhail Shirokikh, Sergey Nikolenko

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出稀疏前缀缓存方法,通过在稀疏检查点位置存储精确递归状态,优化混合和递归语言模型服务的延迟,实验证明其在实际数据中优于传统启发式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01106 2026-05-05 cs.CL cs.AI 81%

Component-Aware Self-Speculative Decoding in Hybrid Language Models

混合语言模型中的组件感知自推测解码

Hector Borobia, Elies Seguí-Mas, Guillermina Tormo-Carbó

机构 * organization= VRAIN -- Valencian Research Institute for Artificial Intelligence, Universitat Polit\`ecnica de Val\`encia , city= Valencia , country= Spain organization= Department of Economics organization= Department of Business Organisation, Universitat Polit\`ecnica de Val\`encia , city= Valencia , country= Spain

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出组件感知自推测解码,首次利用混合语言模型的内部架构异质性,通过隔离SSM/线性注意力子图作为零成本内部草案,提升了推测解码效率,并展示了不同架构混合模型的组件组合模式对自推测可行性的影响。

Comments 29 pages, 1 figure, 9 tables. Code: https://github.com/hecboar/hybrid-speculative-decoding

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00857 2026-05-05 eess.SP cs.AI cs.LG q-bio.NC 81%

Foundation Model Guided Dual-Branch Co-Adaptation for Source-Free EEG Decoding

基于基础模型的双分支共适应源无关EEG解码

Peiliang Gong, Han Zhang, Zhen Jiang, Chenyu Liu, Ziyu Jia, Xinliang Zhou, Daoqiang Zhang, Xiaoli Li

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) College of Artifical Intelligence and Automation, Hohai University(河海大学人工智能与自动化学院) College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) Brainnetcome Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所脑网络中心) Information Systems Technology and Design, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出FUSED框架,通过双分支共适应机制整合大规模基础模型与紧凑专家模型,提升源无关EEG解码的泛化能力和稳定性,实验验证其在多任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00140 2026-05-04 cs.LG cs.CL cs.CV 81%

Technical Report: Activation Residual Hessian Quantization (ARHQ) for Low-Bit LLM Quantization

技术报告:用于低比特大语言模型量化的小激活残差Hessian量化(ARHQ)

YiFeng Wang, Zhun Sun, Keisuke Sakaguchi

机构 * Graduate School of Information Sciences(信息科学研究生院)

专题命中 效率与部署 :LLM(title);post-training(abstract);分类 cs.CL、cs.LG

AI总结 ARHQ通过构建输入侧残差Hessian来隔离误差敏感的权重方向,提升低比特激活权重量化的层间SNR并保持下游推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28075 2026-05-04 cs.CL cs.AI 81%

Repetition over Diversity: High-Signal Data Filtering for Sample-Efficient German Language Modeling

重复与多样性:高信号数据过滤以提升德国语言模型的样本效率

Ansar Aynetdinov, Patrick Haller, Alan Akbik

机构 * Humboldt-Universität zu Berlin(洪堡大学柏林分校)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在德国语言模型训练中,通过高信号数据过滤在多样性和质量之间进行权衡,发现重复高质量数据比单次训练更大更少过滤的数据表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14845 2026-04-30 cs.LG cs.AI 81%

Integrating Weather Foundation Model and Satellite to Enable Fine-Grained Solar Irradiance Forecasting

融合天气基础模型与卫星实现精细化太阳能辐照度预报

Ziqing Ma, Kai Ying, Xinyue Gu, Tian Zhou, Tianyu Zhu, Haifan Zhang, Peisong Niu, Zheng Wang, Cong Bai, Liang Sun

机构 * DAMO Academy, Alibaba Group(阿里集团达摩院) College of Computer Science, Zhejiang University of Technology(浙江工业大学计算机学院)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Baguan-solar框架,融合全球天气基础模型与高分辨率静止卫星图像,实现千米级24小时辐照度预报,优于现有基准模型,降低RMSE 16.08%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23994 2026-04-28 cs.LG cs.CL 81%

When to Commit? Towards Variable-Size Self-Contained Blocks for Discrete Diffusion Language Models

何时承诺?面向离散扩散语言模型的可变大小自包含块

Danny Wang, Ruihong Qiu, Zi Huang

机构 * The University of Queensland(昆士兰大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出可变大小自包含块(VSB)以解决离散扩散语言模型中固定大小或启发式块解码导致的早token承诺问题,通过自包含性原则提升预测一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21098 2026-04-24 cs.AI cs.CL 81%

Propensity Inference: Environmental Contributors to LLM Behaviour

倾向推断:对大语言模型行为的环境贡献

Olli Järviniemi, Oliver Makins, Jacob Merizian, Robert Kirk, Ben Millwood

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 效率与部署 :LLM(title);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过分析环境因素对大语言模型行为的影响,提出三种方法改进,发现战略与非战略因素对行为的解释作用相近,且战略因素随能力提升不显著变化,同时发现目标冲突敏感性趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20122 2026-04-23 cs.LG cs.AI 81%

Adaptive Conformal Anomaly Detection with Time Series Foundation Models for Signal Monitoring

自适应置信区间异常检测与时间序列基础模型用于信号监控

Natalia Martinez Gil, Fearghal O'Donncha, Wesley M. Gifford, Nianjun Zhou, Dhaval C. Patel, Roman Vaculin

机构 * IBM Research(IBM研究院)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种自适应置信区间异常检测方法,利用预训练基础模型进行预测,无需额外微调,实现可解释的异常评分,适用于资源受限环境,解决数据有限和快速推理需求问题。

Comments Code in : https://github.com/ibm-granite/granite-tsfm/tree/main/notebooks/hfdemo/adaptive_conformal_tsad

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15143 2026-04-20 cs.AI cs.CL 81%

Protecting Language Models Against Unauthorized Distillation through Trace Rewriting

通过追踪重写保护语言模型免受未经授权的蒸馏

Xinhang Ma, William Yeoh, Ning Zhang, Yevgeniy Vorobeychik

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 效率与部署 :language model(title);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出通过追踪重写技术防止未经授权的知识蒸馏,通过反蒸馏和API水印两种方法提升教师模型性能并防止恶意使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15009 2026-04-17 cs.AI cs.LG 81%

Towards Faster Language Model Inference Using Mixture-of-Experts Flow Matching

迈向更快的语言模型推断:专家混合流匹配

Aihua Li

机构 * Duke University(杜克大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出MoE-FM框架,通过分解复杂潜空间传输几何结构,提升语言模型推断效率,YAN模型在多个任务中表现优异,速度提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11496 2026-04-17 cs.CV cs.CL cs.LG 81%

Revisiting Compositionality in Dual-Encoder Vision-Language Models: The Role of Inference

重新审视双编码视觉-语言模型中的组合性:推断的作用

Imanol Miranda, Ander Salaberria, Eneko Agirre, Gorka Azkune

机构 * HiTZ Center – Ixa, University of the Basque Country (UPV/EHU)(希茨中心–Ixa,巴斯克国家大学(UPV/EHU))

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了双编码视觉-语言模型中组合性问题的根源,提出通过改进推断协议提升组合性能,引入轻量级变压器学习局部对齐,优于全微调和端到端训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12104 2026-04-14 cs.CL cs.AI cs.CR 81%

Powerful Training-Free Membership Inference Against Autoregressive Language Models

针对自回归语言模型的强大无训练成员推断

David Ilić, David Stanojević, Kostadin Cvejoski

机构 * JetBrains Research(JetBrains 研究院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出EZ-MIA方法,通过分析错误位置的概率偏差来检测细调语言模型的隐私风险,实验表明其在WikiText和AG News数据集上显著提高了检测率,为隐私审计提供了更有效的工具。

Comments 9 pages, 2 figures; appendix with additional experiments and derivations

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27960 2026-04-14 cs.LG cs.CL cs.CV 81%

Towards Efficient Large Vision-Language Models: A Comprehensive Survey on Inference Strategies

迈向高效的大型视觉-语言模型:关于推理策略的综合调查

Surendra Pathak, Bo Han

机构 * George Mason University(乔治梅森大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文综述了提升大型视觉语言模型推理效率的最新方法,从视觉token压缩、内存管理、架构设计和解码策略四个维度进行分类,并指出当前方法的局限性及未来研究方向。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08118 2026-04-10 cs.CL cs.LG 81%

Initialisation Determines the Basin: Efficient Codebook Optimisation for Extreme LLM Quantization

初始化决定盆地:面向极端LLM量化高效的代码本优化

Ian W. Kennedy, Nafise Sadat Moosavi

机构 * University of Sheffield(谢菲尔德大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出OA-EM方法,通过Hessian加权马氏距离改进代码本初始化,解决极端LLM量化中初始化不足导致的性能问题,提升压缩模型的优化效果。

Comments 9 pages (+ references and appendix). Under review at ACL Rolling Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07911 2026-04-10 cs.MA cs.AI cs.LG 81%

Dynamic Attentional Context Scoping: Agent-Triggered Focus Sessions for Isolated Per-Agent Steering in Multi-Agent LLM Orchestration

动态注意力上下文扫描:基于代理触发的聚焦会话用于多代理LLM orchestration中的独立代理控制

Nickson Patel

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出动态注意力上下文扫描机制,通过代理触发的聚焦会话实现多代理LLM orchestration中的独立代理控制,显著提升决策准确率和上下文效率。

Comments 15 pages, 4 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19982 2026-04-10 cs.CL cs.AI 81%

Diffusion Language Models Know the Answer Before Decoding

扩散语言模型在解码前就知道答案

Pengxiang Li, Yefan Zhou, Dilxat Muhtar, Lu Yin, Shilin Yan, Li Shen, Soroush Vosoughi, Shiwei Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) Dartmouth College(达特茅斯学院) University of Surrey(萨里大学) Sun Yat-sen University(中山大学) ELLIS Institute Tübingen(ELLIS 图宾根研究所) MPI for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Prophet方法,通过早期解码收敛机制加速扩散语言模型推理,减少解码步骤并保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12040 2026-04-10 cs.LG cs.AI cs.CV 81%

BTC-LLM: Efficient Sub-1-Bit LLM Quantization via Learnable Transformation and Binary Codebook

BTC-LLM: 通过可学习转换和二进制代码表实现高效的亚1位LLM量化

Hao Gu, Lujun Li, Hao Wang, Lei Wang, Zheyu Wang, Bei Liu, Jiacheng Liu, Qiyuan Zhu, Sirui Han, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) City University of Hong Kong(香港城市大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 BTC-LLM通过二进制模式聚类和权重转换克服传统二值化限制,实现亚1位LLM量化,在极端压缩下达到1.11-0.7 bits的压缩率,同时保持高性能和高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06871 2026-04-09 cs.CL cs.AI 81%

Do We Need Distinct Representations for Every Speech Token? Unveiling and Exploiting Redundancy in Large Speech Language Models

我们是否需要为每个语音令牌都使用不同的表示?揭示和利用大型语音语言模型中的冗余

Bajian Xiang, Tingwei Guo, Xuan Chen, Yang Han

机构 * Beike Inc.(贝壳找房)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语音语言模型中是否需要每个语音令牌都使用不同表示,通过层间干预揭示了冗余层次结构,并提出Affinity Pooling方法,有效压缩表示而不损失语义信息,实验表明在三个任务中实现了27.48%的计算节省和显著的效率提升。

Comments Accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19693 2026-04-09 cs.LG cs.AI 81%

TREASURE: The Visa Payment Foundation Model for High-Volume Transaction Understanding

TREASURE:高交易量理解的Visa支付基础模型

Chin-Chia Michael Yeh, Uday Singh Saini, Xin Dai, Xiran Fan, Shubham Jain, Yujie Fan, Jiarui Sun, Junpeng Wang, Menghai Pan, Yingtong Dou, Yuzhong Chen, Vineeth Rakesh, Liang Wang, Yan Zheng, Mahashweta Das

机构 * Visa Research(Visa研究院)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出TREASURE模型,用于高交易量数据理解,通过捕捉消费者行为和支付网络信号,提升异常检测和推荐系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04373 2026-04-07 cs.AI cs.LG 81%

Decocted Experience Improves Test-Time Inference in LLM Agents

解毒经验提升LLM代理的测试时间推理

Maohao Shen, Kaiwen Zha, Zexue He, Zhang-Wei Hong, Siru Ouyang, J. Jon Ryu, Prasanna Sattigeri, Suhas Diggavi, Gregory Wornell

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究通过解毒经验提升LLM代理测试时间推理性能,探讨如何通过经验构建有效上下文以优化复杂推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03057 2026-04-06 cs.CL cs.AI 81%

Querying Structured Data Through Natural Language Using Language Models

通过语言模型查询结构化数据

Hontan Valentin-Micu, Bunea Andrei-Alexandru, Tantaroudas Nikolaos Dimitrios, Popovici Dan-Matei

机构 * National University of Science and Technology POLITEHNICA Bucharest(布加勒斯特理工大学) Institute of Communication and Computer Systems (ICCS)(通信与计算机系统研究所)

专题命中 效率与部署 :language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种开源方法,使用户能通过自然语言查询结构化非文本数据集,通过训练LLM生成可执行查询,展示了在资源受限环境下小型领域模型的高效性。

Comments in publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01563 2026-04-03 cs.AI cs.LG 81%

Does Your Optimizer Care How You Normalize? Normalization-Optimizer Coupling in LLM Training

你的优化器是否在意你如何归一化?LLM训练中的归一化-优化器耦合

Abdelrahman Abouzeid

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究发现归一化层与优化器在LLM训练中存在交互影响,动态Erf在Muon优化器下表现下降,通过调整参数可恢复性能,揭示归一化方法对优化器的敏感性。

Comments 16 pages, 8 figures. Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08228 2026-04-02 cs.SE cs.AI cs.CL cs.PF 81%

Investigating Execution-Aware Language Models for Code Optimization

探究面向执行的语言模型用于代码优化

Federico Di Menna, Luca Traini, Gabriele Bavota, Vittorio Cortellessa

机构 * University of L’Aquila(拉奎拉大学) Software Institute - Università della Svizzera Italiana(软件研究所 - 瑞士意大利语大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了将代码执行信息整合到语言模型中对代码优化能力的影响,通过三种训练策略测试了四种执行方面对CodeT5+模型的优化效果,发现执行感知模型在代码优化上收益有限。

Journal ref 2025 IEEE/ACM 33rd International Conference on Program Comprehension (ICPC), Ottawa, ON, Canada, 2025, pp. 204-215

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28795 2026-04-01 cs.OS cs.AI cs.CL cs.DC 81%

StepCache: Step-Level Reuse with Lightweight Verification and Selective Patching for LLM Serving

StepCache: 基于轻量验证和选择性修补的步骤级重用用于大语言模型服务

Azam Nouri

机构 * Department of Science, Technology & Mathematics, Lincoln University(林肯大学科学与技术数学系)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 StepCache通过步骤级重用和轻量验证实现LLM服务的高效处理,减少延迟并提高准确性,支持结构化输出和容错机制。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏