arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2606.18042 2026-06-18 cs.DC 新提交 91%

Latency Prediction for LLM Inference on NPU Systems

NPU系统上LLM推理的延迟预测

Juhyun Park, Seungwoo Jeong, Jingyu Lee, Kyungyong Lee

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对NPU上LLM推理延迟预测面临微架构不公开、编译器优化不可预测和分桶导致非线性延迟的挑战,提出LENS延迟估计器,通过每个桶两次端到端测量组合预测任意输入输出长度组合的延迟,平均预测误差2.15%。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17787 2026-06-17 cs.DC 新提交 91%

LUMEN: Coordinated Failure Recovery for Distributed LLM Serving

LUMEN:分布式LLM服务的协调故障恢复

Zhang Cao, Shujie Han, Juncheng Zhang, Yuanming Ren, Yongkun Li, Patrick P. C. Lee

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对分布式LLM服务中工作节点故障导致KV缓存丢失和请求重算的问题,提出LUMEN系统,通过负载感知的协调恢复策略(检查点放置、中断请求分配、容量恢复)显著提升服务与恢复时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17421 2026-06-17 cs.CR 新提交 91%

Bifrost: Hybrid TEE-FHE Inference for Privacy-Preserving Transformer and LLM Serving

Bifrost: 面向隐私保护Transformer和LLM服务的混合TEE-FHE推理架构

Chenghao Chen, Kailun Qin, Xiaolin Zhang, Chi Zhang, Dawu Gu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出Bifrost混合架构,利用CPU TEE处理非线性操作和状态刷新,FHE加密线性层委托给加速器,实现安全高效的LLM推理,相比纯FHE方案延迟降低9-53倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17058 2026-06-17 cs.DC 新提交 91%

Evaluating LLM Coding Agents on SZ-Family Lossy Compression Across Architectures

评估LLM编码代理在不同架构上的SZ系列有损压缩

Changqing Li, Shouwei Gao, Kai Zhao, Sheng Di, Wenqian Dong

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 评估LLM编码代理在SZ系列有损压缩内核上的表现,发现GPU上强模型性能高但对提示敏感,Cerebras上主要挑战是生成可运行程序,且代理在模块化内核上更有效。

Comments 5 pages, 4 figures. Accepted to IPDPS 2026 HPAI4S Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15789 2026-06-16 cs.AR 新提交 91%

Approaching Shannon Bound with Lossless LLM Weight Compression

接近香农极限的无损LLM权重压缩

Hongshi Tan, Yao Chen, Gustavo Alonso, Weng-Fai Wong, Bingsheng He

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 通过熵分析发现LLM权重有效熵远低于存储位宽,提出基于非对称数字系统的瓦片级无损解压框架,实现接近香农极限的压缩率,在SGLang中集成后显著提升批处理大小和吞吐量。

Comments Accepted to ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09537 2026-06-16 cs.NI 新提交 91%

STEPS: Semantic Contract-Guided Scheduling for LLM-Assisted Natural Language-Driven Edge AI Services

STEPS: 面向LLM辅助自然语言驱动的边缘AI服务的语义契约引导调度

Houyi Qi, Minghui Liwang, Xianbin Wang, Xinlei Yi, Seyyedali Hosseinalipour

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出STEPS框架,通过语义契约将用户自然语言需求转化为可执行接口,利用LLM解析服务级别和置信度,构建势博弈模型联合优化节点选择、资源分配和带宽分配,提升语义契约满足率并适应模糊请求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06093 2026-06-16 cs.AR 版本更新 91%

Compass: Co-Exploration of Mapping and Hardware for Heterogeneous Multi-Chiplet Accelerators Targeting LLM Inference Service Workloads

Compass:面向LLM推理服务工作负载的异构多芯粒加速器映射与硬件协同探索

Boyu Li, Zongwei Zhu, Qianyue Cao, Xi Li, Xuehai Zhou

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM推理服务的动态请求类型和可变序列长度,提出Compass框架,通过基于计算执行图的映射编码方案和协同优化引擎,在异构多芯粒加速器上实现延迟降低63.92%、能耗降低40.32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12928 2026-06-15 cs.DC 版本更新 91%

ProServe: Unified Multi-Priority Request Scheduling for LLM Serving

ProServe: 面向LLM服务的统一多优先级请求调度

Weizhe Huang, Tao Peng, Tongxuan Liu, Donghe Jin, Kang Meng, Xianzhe Dong, Ke Zhang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM服务中多优先级请求的SLO保障问题,提出ProServe框架,通过引擎层滑动批处理和块管理优化及服务层增益导向调度,最大化服务增益。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12950 2026-06-12 cs.DC 新提交 91%

Maestro: Workload-Aware Cross-Cluster Scheduling for LLM-Based Multi-Agent Systems

Maestro: 面向基于LLM的多智能体系统的工作负载感知跨集群调度

Jinghao Wang, Xiao Zhou, Xiaoyang Sun, Yihui Zhang, Yilong Li, Tianyu Wo, Xu Wang, Chunming Hu, Renyu Yang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出Maestro调度系统,利用智能体语义预测输出长度和内存使用,通过层次化调度(节点级多模型共置、集群级延迟感知路由、全局工作流感知优先级)在严格GPU预算下优化LLM多智能体服务,减少KV缓存HBM占用67.2%,提高高竞争SLO达标率23.6个百分点。

Comments Accepted to the 46th IEEE International Conference on Distributed Computing Systems (ICDCS 2026). 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05727 2026-06-11 cs.DC 版本更新 91%

LLM-Enhanced Deep Reinforcement Learning for Task Offloading in Collaborative Edge Computing

LLM增强的深度强化学习用于协作边缘计算中的任务卸载

Hao Guo, Kaixiang Xu, Ziwu Ge, Lei Yang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LeDRL框架,结合轻量级LLM与自注意力增强DRL,通过结构化提示和语义反馈实现实时任务卸载,在成功率、收敛速度和实时性上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11145 2026-06-10 cs.CR 新提交 91%

OpenPCC: Open and Confidential LLM Serving on Commodity TEEs

OpenPCC:在商用TEE上提供开放且保密的LLM服务

Haoling Zhou, Shixuan Zhao, Chao Wang, Zhiqiang Lin

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对云推理服务中用户请求包含敏感信息的问题,提出OpenPCC框架,利用商用TEE实现开放、保密的LLM服务,并通过原型验证其可行性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09061 2026-06-09 cs.DC cs.PF 新提交 91%

Fairness-Aware and Latency-Controllable Scheduling for Chunked-Prefill LLM Serving

面向分块预填充LLM服务的公平感知与延迟可控调度

Haoxin Liu, Jiayi Wang, Yueshen Xu, Rui Li

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对分块预填充LLM服务中的调度公平性与延迟稳定性问题,提出基于老化策略的动态优先级调度、延迟预测请求调度和主动预填充控制,在NVIDIA GPU和Ascend加速器上实验表明,相比FCFS,平均端到端延迟降低10%以上,P99尾延迟显著减少。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04415 2026-06-09 cs.DC 91%

FlexNPU: Transparent NPU Virtualization for Dynamic LLM Prefill-Decode Co-location

FlexNPU: 用于动态LLM预填充-解码共置的透明NPU虚拟化

Jiongjiong Gu, Jianfeng Wang, Zidong Han, Yongqiao Wang, Pengfei Xia, Mingjie Zhang, Hong Liu, Yuanyi Xia, Jiajia Chu, Yifeng Tang, Hui Zang, Xin Yao, Qijie Qiu, Yuzhao Wang, Chuanfei Xu, Lin Zhang, Zhuonan Lai, Hongming Huang, Jiawei Qiu, Gong Zhang, Weipeng Cao, Zhong Ming

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM服务中预填充与解码阶段资源需求互补的问题,提出FlexNPU,一种透明用户空间虚拟化层,通过动态共置调度提升吞吐量并降低TTFT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05511 2026-06-05 cs.ET 91%

RH+: Row-Hit-Optimized Scheduling for PIM-based LLM Inference

RH+:基于PIM的LLM推理的行命中优化调度

Yongchan Jung, Shafayat Mowla Anik, Byeong Kil Lee, Jeeho Ryoo

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对PIM架构中LLM推理的GEMV操作,提出RH+调度通过改变步长使连续MAC操作在同一行,解决行周期瓶颈,实现8-12倍加速和74%以上能耗降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02987 2026-06-05 cs.DC math.OC 91%

Large-Scale LLM Inference with Heterogeneous Workloads: Prefill-Decode Contention and Asymptotically Optimal Control

大规模LLM推理与异构工作负载:Prefill-Decode竞争及渐进最优控制

Ruihan Lin, Zezhen Ding, Zean Han, Jiheng Zhang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了大规模LLM推理中异构工作负载下的Prefill-Decode竞争问题,提出了一种随机控制框架,通过多类多服务器队列网络模型,实现了渐进最优的资源分配与调度策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00365 2026-06-02 cs.AR 91%

SPARQLe: Sub-Precision Activation Representation for Quantized LLM Inference

SPARQLe: 用于量化LLM推理的子精度激活表示

Aradhana Mohan Parvathy, Soumendu Kumar Ghosh, Shamik Kundu, Arnab Raha, Souvik Kundu, Deepak A. Mathaikutty, Anand Raghunathan

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM推理中激活值高精度需求导致的硬件开销,提出SPARQLe软硬件协同设计框架,利用激活值低位稀疏性,将高精度张量分解为密集低位和稀疏高位部分,在保持精度的同时降低内存访问和计算能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29639 2026-05-29 cs.OS 91%

RTP-LLM: High-Performance Alibaba LLM Inference Engine

RTP-LLM:高性能阿里巴巴大语言模型推理引擎

Boyu Tan, Jiarui Guo, Zongwei Lv, Hanbo Sun, Tong Yang, Kan Liu, Xinfei Shi, Zetao Hu, Yaxin Yu, Chi Zhang, Jianning Zhang, Xi Yang, Wei Zhang, Bo Cai, Silu Zhou, Xiyu Wang, Na He, Yinghao Yu, Wending Bao, Guiyang Huang, Yuxing Yuan, Juncheng Yin, Nan Wang, Lin Yang, Zechao Zhang, Lu Chen, Guoding Li, Tao Lan, Lin Qu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出RTP-LLM推理引擎,通过文件顺序驱动I/O、预填充-解码分离架构、分层多级KV缓存、模块化推测解码等技术,在工业规模部署中实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25655 2026-05-26 cs.DC 91%

Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers

异构众核超级计算机上的带宽感知LLM推理

Yao Lu, Zhongzhi Luan, Gen Li, Jiaxing Qi, Shiqing Ma, Bin Han, Shizhe Shang, Hailong Yang, Depei Qian

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对异构众核处理器带宽瓶颈,提出硬件感知推理框架THInfer,通过软硬件协同设计和并行策略优化,在MT-3000处理器上实现高效LLM推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25247 2026-05-26 cs.DC 91%

Kavier: Exploring Performance, Sustainability, and Efficiency of LLM Ecosystems under Inference through Cache-Aware Discrete-Event Simulation

Kavier:通过缓存感知离散事件模拟探索推理下LLM生态系统的性能、可持续性和效率

Radu Nicolae, Alexandru Iosup, Animesh Trivedi, Jesse Donkervliet

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出并验证了推理下LLM生态系统的参考架构,并设计了首个通过离散事件和缓存感知模拟预测LLM生态系统性能、可持续性和效率的仿真工具Kavier。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24832 2026-05-26 cs.DC 91%

Optimus: Elastic Decoding for Efficient Diffusion LLM Serving

Optimus: 用于高效扩散LLM服务的弹性解码

Chiyue Wei, Cong Guo, Bowen Duan, Junyao Zhang, Haoxuan Shan, Yifei Wang, Yangjie Zhou, Hai "Helen" Li, Danyang Zhuo, Yiran Chen

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出Optimus系统,通过动态调整解码粒度(分块解码与饱和度感知调度)来平衡GPU利用率和令牌效率,实现扩散LLM的弹性解码,显著提升吞吐量并保持模型精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24022 2026-05-26 cs.AR cs.DC 91%

Adaptive KV Cache Reuse for Fast Long-Context LLM Serving

自适应KV缓存重用用于快速长上下文LLM服务

Fei li, Song Liu, Yan Liu, Jinhua Cui, Shiqiang Nie, Jinyu Wang, Weiguo Wu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对长上下文LLM推理中预填充阶段TTFT延迟瓶颈,提出CacheTune系统,通过频域分析识别关键KV对并选择性重计算,结合稀疏传输、异步重叠和硬件感知自适应重计算比调优,实现3.72x-4.86x TTFT加速和接近全重计算的生成质量。

Comments 14 pages, Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20191 2026-05-26 cs.LG cs.AI cs.CL 91%

MoBiQuant: Mixture-of-Bits Quantization for Token-Adaptive Any-Precision LLM

MoBiQuant: 面向令牌自适应任意精度LLM的混合比特量化

Dongwei Wang, Jinhee Kim, Seokho Han, Denis Gudovskiy, Yohei Nakata, Tomoyuki Okuno, KhayTze Peong, Kang Eun Jeon, Jong Hwan Ko, Yiran Chen, Huanrui Yang

机构 * University of Arizona(亚利桑那大学) Duke University(杜克大学) Sungkyunkwan University(成均馆大学) Panasonic AI Lab(松下人工智能实验室) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对动态运行时约束下大语言模型任意精度量化的泛化性问题,提出基于令牌敏感度的混合比特量化框架MoBiQuant,通过多合一递归残差量化和令牌感知路由器实现灵活推理,在匹配或超越前沿单精度PTQ的同时显著节省内存并提升吞吐量。

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23280 2026-05-25 cs.DB 91%

BCTuner: LLM-Guided Monte Carlo Tree Search for Efficient Blockchain Knob Tuning

BCTuner: 基于LLM引导的蒙特卡洛树搜索实现高效区块链参数调优

Yaoyi Deng, Chongyang Tao, Mingxuan Li, Xuelian Lin, Han Sun, Mingchao Wan, Shuai Ma

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对许可区块链参数调优中架构复杂、语义鸿沟及试错成本高的问题,提出BCTuner框架,结合大语言模型知识推理与蒙特卡洛树搜索,通过结构化动作轨迹逐步构建配置并自适应剪枝,显著提升吞吐量并减少系统交互次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16867 2026-05-19 cs.DC 91%

GoodServe: Towards High-Goodput Serving of Agentic LLM Inferences over Heterogeneous Resources

GoodServe: 向异构资源上实现高吞吐量的代理LLM推理服务

Boxiao Du, Boning Huangfu, Yizhou Luo, Chen Chen, Zijun Li, Minchen Yu, Xiaoyi Fan, Minyi Guo

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出GoodServe系统,通过预测和修正的方法优化异构资源上的代理LLM推理服务,提高吞吐量。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18249 2026-05-19 cs.IR 91%

Dual-Tree LLM-Enhanced Negative Sampling for Implicit Collaborative Filtering

双树LLM增强的隐式协同过滤负采样

Jiayi Wu, Zhengyu Wu, Xunkai Li, Rong-Hua Li, Guoren Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出双树LLM增强负采样方法,通过无文本和无微调的结构化编码提升隐式协同过滤推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19179 2026-05-18 cs.DC 91%

CascadeInfer: Length-Aware Scheduling of LLM Serving with Low Latency and Load Balancing

CascadeInfer: 基于长度意识的LLM服务调度以实现低延迟和负载均衡

Yitao Yuan, Chenqi Zhao, Bohan Zhao, Zane Cao, Yongchao He, Wenfei Wu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 CascadeInfer通过动态调度请求降低LLM服务延迟和负载不均,提升系统吞吐量,减少端到端延迟达67%。

Comments 15 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15601 2026-05-18 cs.DC cs.PF 91%

LMDeploy Accelerates Mixed-Precision LLM Inference with TurboMind

LMDeploy通过TurboMind加速混合精度LLM推理

Li Zhang, Youhe Jiang, Guoliang He, Xin Chen, Han Lv, Qian Yao, Ningsheng Ma, Fangcheng Fu, Kai Chen

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 LMDeploy通过TurboMind实现高效混合精度LLM推理,通过通用化和高效的混合精度流水线优化矩阵运算和注意力计算,降低延迟并提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06052 2026-05-08 cs.AR 91%

XtraMAC: An Efficient MAC Architecture for Mixed-Precision LLM Inference on FPGA

XtraMAC:一种适用于FPGA上混合精度LLM推断的高效MAC架构

Feng Yu, Hongshi Tan, Yao Chen, Weng-Fai Wong, Bingsheng He

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出XtraMAC架构,通过统一整数、浮点和混合精度运算,实现动态运算打包和高效资源共享,提升FPGA在混合精度LLM推断中的计算密度和能效。

Comments Accepted to ISCA 2026. 14 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05274 2026-05-08 cs.CR 91%

Sealing the Audit-Runtime Gap for LLM Skills

填补LLM技能的审计-运行时差距

Tingda Shen, Yebo Feng, Konglin Zhu, Xiaojun Jia, Yang Liu, Lin Zhang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SIGIL框架,通过去中心化链上注册表和技能验证协议,实现LLM技能从发布到运行时的可验证绑定,有效抵御技能供应链攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00741 2026-05-04 cs.CR 91%

Self-Adaptive Multi-Agent LLM-Based Security Pattern Selection for IoT Systems

自适应多智能体LLM基于的安全模式选择用于物联网系统

Saeid Jamshidi, Foutse Khomh, Carol Fung, Kawser Wazed Nafi

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出ASPO方法,结合LLM推理与确定性执行,在MAPE-K控制循环中实现自适应安全模式选择,通过减少极端情况执行成本,提升资源效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏