arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2606.09549 2026-06-09 cs.CR cs.AI 新提交 92%

SecureClaw: Clawing Back Control of LLM Agents

SecureClaw: 夺回对LLM智能体的控制

Yuhan Ma, Stefan Schmid

机构 * TU Berlin(柏林技术大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对工具使用型LLM智能体的双重安全漏洞,提出双边界架构SecureClaw,在效果汇点实施授权、在读边界实施明文隔离,通过预览-提交协议和可信网关实现安全控制,在多个基准上保持可用性的同时将攻击成功率降至接近零。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09388 2026-06-09 cs.LG 新提交 92%

Distilling Safe LLM Systems via Soft Prompts for On Device Settings

通过软提示蒸馏安全的设备端LLM系统

Motasem Alfarra, Cristina Pinneri, Dana Kianfar, Mohammed Almousa, Christos Louizos

机构 * Qualcomm AI Research(高通人工智能研究院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对资源受限设备上部署安全大语言模型(LLM)的挑战,提出基于软提示与蒸馏训练的安全对齐方法,在最小化额外计算开销的同时实现优越的安全-有用性权衡。

Comments Accepted to UAI 2026

Journal ref 42nd Conference on Uncertainty in Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09032 2026-06-09 cs.CL 新提交 92%

Bridging the Agent-World Gap: Text World Models for LLM-based Agents

弥合智能体-世界鸿沟:面向基于LLM的智能体的文本世界模型

Yixia Li, Hongru Wang, Peng Lai, Zhiwen Ruan, He Zhu, Youxin Zhu, Ganlong Zhao, Minda Hu, Yun Chen, Sibei Yang, Peng Li, Jeff Z. Pan, Jia Pan, Guanhua Chen, Yang Liu, Guanbin Li

机构 * Southern University of Science and Technology(南方科技大学) University of Edinburgh(爱丁堡大学) Peking University(北京大学) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文系统综述了面向基于LLM的智能体的文本世界模型,围绕形式化框架和智能体生命周期,涵盖基础定义、构建范式、应用(训练时经验合成与推理时规划、验证、适应)及评估,旨在整合该领域并明确设计空间与开放挑战。

Comments Code: https://github.com/sustech-nlp/awesome-text-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04945 2026-06-09 cs.LG 版本更新 92%

STaR-Quant: State-Time Consistent Post-Training Quantization for Diffusion Large Language Models

STaR-Quant:扩散大语言模型的状态-时间一致训练后量化

Xin Yan, Aqiang Wang, Zhenglin Wan, Xingrui Yu, Ivor Tsang

机构 * School of Artificial Intelligence, Beijing Normal University, Beijing, China(北京师范大学人工智能学院) Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系) Centre for Frontier AI Research, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局前沿人工智能研究中心)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 针对扩散大语言模型低比特量化中的状态相关激活差异和时间误差累积问题,提出STaR-Quant框架,通过状态引导激活变换和时间注意力补偿实现高效量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30836 2026-06-09 cs.LG math.DG 版本更新 92%

Cross-Layer Subspace Coupling for LLM Compression: A Unifying Framework and Its Empirical Limits

跨层子空间耦合用于LLM压缩:一个统一框架及其经验极限

Snigdha Chandan Khilar

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一个统一框架将SVD LLM和Basis Sharing等基于SVD的压缩方法纳入同一优化问题,但实验发现跨层耦合在实用任务中失败,原因是残差流在正向传播中解耦了相邻层,因此逐层优化优于联合优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24189 2026-06-09 cs.CL 版本更新 92%

SPECTRA: Revealing the Full Spectrum of User Preferences via Distributional LLM Inference

SPECTRA:通过分布化LLM推理揭示用户偏好的全频谱

Luyang Zhang, Jialu Wang, Shichao Zhu, Beibei Li, Zhongcun Wang, Guangmou Pan, Yang Song

机构 * Carnegie Mellon University(卡内基梅隆大学) TikTok Inc.(TikTok公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SPECTRA方法,将微调后的LLM视为隐式概率模型,通过探测softmax层推断用户偏好的概率分布,有效恢复长尾偏好并提升公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07472 2026-06-08 cs.LG cs.NI 版本更新 92%

Scalable Joint Resource Allocation for SLO-Constrained LLM Inference in Heterogeneous GPU Clouds

异构GPU云中SLO约束的LLM推理的可扩展联合资源分配

Jiaming Cheng, Duong Tung Nguyen

机构 * Ira A. Fulton Schools of Engineering, Arizona State University(亚利桑那州立大学工程学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对异构GPU云中LLM推理的SLO约束,提出可扩展框架,通过约束感知启发式算法(GH和AGH)实现联合资源分配,在秒级内生成可行解并接近最优,显著降低成本和SLO违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02963 2026-06-03 cs.LG 92%

KForge: LLM-Driven Cross-Platform Kernel Generation for AI Accelerators

KForge:面向AI加速器的LLM驱动跨平台内核生成

Taras Sereda, Burak Bartan, Ankita Nayak, Tom St. John, Natalie Serrino, Zain Asgar

机构 * Gimlet Labs Inc(Gimlet实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出KForge框架,通过两个协作的LLM代理(生成代理和性能分析代理)迭代优化,自动生成跨平台高性能内核,在NVIDIA B200和Intel Arc B580上分别实现2.12%的吞吐量提升和5.13倍的几何平均加速。

Comments Accepted at ISCA 2026 Workshop MLArchSys

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27435 2026-05-28 cs.AR cs.AI 92%

When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference

当NPU并非总是更快:移动LLM推理的阶段级分析

Pu Li, Jiawen Qi, Qinyu Chen

机构 * Leiden Institute of Advanced Computer Science (LIACS)(莱顿先进计算机科学研究所)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过OPMASK控制管道分解方法,在CPU-NPU异构SoC上对移动LLM推理进行阶段感知的多级基准测试,发现Prefill阶段CPU比NPU快1.6倍,Decode阶段NPU仅提供1.05-1.2倍加速,且NPU卸载增加能耗高达51%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26433 2026-05-27 cs.CL 92%

Vectors Are Not Neutral: Sensitive-Information Inference from Exported LLM Representations in Summarization

向量并非中性:从摘要任务中导出的LLM表示进行敏感信息推断

Weixin Liu, Bowen Qu, Juming Xiong, Congning Ni, Bradley A. Malin, Zhijun Yin

机构 * Vanderbilt University(范德比大学) Vanderbilt University Medical Center(范德比大学医学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究LLM摘要系统导出向量中的敏感信息泄露风险,提出SurfaceLoRA微调方法降低特定向量的可恢复性,但未针对的池化向量仍存在风险。

Comments 30 pages, 2 figures; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26118 2026-05-27 cs.DC cs.AI 92%

Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU

Xe-Forge:面向Intel GPU的多阶段LLM驱动的内核优化

Marcin Spoczynski, Daniel Fleischer, Moshe Berchansky, Gabriela Ben-Melech Stan, Shira Guskin, Weilin Xu, Adam Siemieniuk, Alexander Heinecke

机构 * Intel Corporation(英特尔公司)

专题命中 效率与部署 :LLM(title,title_cn);SLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出Xe-Forge,一个多阶段LLM流水线,通过Chain-of-Verification-and-Refinement(CoVeR)代理和硬件验证,自动将Triton内核优化为Intel GPU,实现几何平均1.17倍加速,Flash Attention加速2-13.3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24598 2026-05-26 cs.AI cs.MA 92%

Hera: Learning Long-Horizon Coordination for Device-Cloud Collaborative LLM Agents

Hera: 面向设备-云协作LLM智能体的长时程协调学习

Yuxin Zhang, Mengxue Hu, Zheng Lin, Xiaoyi Fan, Fan Xie, Zihan Fang, Jing Yang, Wenjun Zhu, Zhiwen Chen, Chengfei Lv, Zhe Chen

机构 * Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) The University of Hong Kong(香港大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学) New York University(纽约大学) Universiti Malaya(马来亚大学) SpaceAIC Co., Ltd.(SpaceAIC公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Hera,一种步骤级设备-云LLM智能体协调器,通过两阶段训练(模仿学习+强化学习)优化长时程任务的性能-成本帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23929 2026-05-26 cs.AI cs.SE 92%

Toward Reliable Design of LLM-Enabled Agentic Workflows: Optimizing Latency-Reliability-Cost Tradeoffs

面向LLM驱动的智能体工作流的可靠设计:优化延迟-可靠性-成本权衡

Ya-Ting Yang, Quanyan Zhu

机构 * New York University(纽约大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过引入参数化指数可靠性函数建模LLM与非LLM智能体的性能,提出水填充令牌分配策略,并刻画最优工作流可靠性的影子价格,以解决延迟、可靠性和成本之间的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22566 2026-05-22 cs.LG 92%

GraphFlow: A Graph-Based Workflow Management for Efficient LLM-Agent Serving

GraphFlow: 一种基于图的流程管理用于高效的LLM代理服务

Ao Li, Shangpeng Yang, Fahao Chen, Tianheng Xu, Peng Li, Zhou Su

机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University, Xi'an, China(西安交通大学计算机科学与工程学院) School of Artificial Intelligence, Shandong University, Jinan, China(山东大学人工智能学院) Shanghai Advanced Research Institute, Chinese Academy of Sciences, Shanghai, China(中国科学院上海先进研究院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种基于图的流程管理方法GraphFlow,通过统一图结构wGraph动态生成任务特定流程,提高LLM代理服务的效率和性能,实验表明其在多个基准数据集上表现优异,性能提升显著且内存占用减少。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21560 2026-05-22 cs.LG 92%

AutoMCU: Feasibility-First MCU Neural Network Customization via LLM-based Multi-Agent Systems

AutoMCU: 通过基于LLM的多智能体系统实现面向MCU的神经网络定制化

Penglin Dai, Zijie Zhou, Xincao Xu, Junhua Wang, Xiao Wu, Lixin Duan

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(深圳先进研究院,电子科技大学) School of Computer Science and Engineering, Northeastern University(计算机科学与工程学院,东北大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出AutoMCU,一种基于LLM的多智能体系统,用于在MCU约束下实现神经网络的自动化定制化。通过自然语言任务需求和硬件规格,AutoMCU迭代生成结构化架构候选方案,通过供应商工具链反馈过滤不可行设计,在训练前进行筛选,评估可行模型并在受控协议下验证部署可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09472 2026-05-22 cs.DC cs.LG 92%

WarmServe: Enabling One-for-Many GPU Prewarming for Multi-LLM Serving

WarmServe: 为多LLM服务实现一种多GPU预热

Chiheng Lou, Sheng Qi, Rui Kang, Yong Zhang, Chen Sun, Pengcheng Wang, Xuanzhe Liu, Xin Jin

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出WarmServe系统,通过基于工作负载预测的多GPU预热技术,减少LLM服务中的尾部时间到第一个令牌(TTFT)并提高请求吞吐量。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21427 2026-05-21 cs.AI cs.DC 92%

PALS: Power-Aware LLM Serving for Mixture-of-Experts Models

PALS: 为混合专家模型的功率感知LLM服务

Can Hankendi, Rana Shahout, Minlan Yu, Ayse K. Coskun

机构 * Boston University(波士顿大学) Harvard University School of Engineering(哈佛大学工程与应用科学学院) Harvard University(哈佛大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PALS,一种功率感知的LLM服务运行时,通过将GPU功率上限作为可控制的参数与软件参数如批大小联合优化,提升能效并减少在功率限制下的服务质量违规。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21049 2026-05-21 cs.CL 92%

Cross-lingual robustness of LLM-brain alignment and its computational roots

LLM-脑对齐的跨语言鲁棒性及其计算根源

Ni Yang, Rui He, Philipp Homan, Iris Sommer, Davide Staub, Wolfram Hinzen

机构 * Grammar and Cognition Lab, Department of Translation & Language Sciences, Universitat Pompeu Fabra(语言与翻译科学系语法与认知实验室,庞培法华大学) Department of Adult Psychiatry and Psychotherapy, University of Zurich(苏黎世大学成人精神病学与心理治疗系) Neuroscience Center Zurich, University of Zurich and ETH Zurich(苏黎世大学神经科学中心与苏黎世联邦理工学院) Center for Clinical Neuroscience and Cognition and Department of Psychiatry, University of Groningen, University Medical Center Groningen(格罗宁根大学临床神经科学与认知中心及精神病学系,格罗宁根大学医学中心) Scalable Scientific Machine Learning Lab, Imperial College London, Department of Earth Science and Engineering(伦敦帝国理工学院可扩展科学机器学习实验室,地球科学与工程系) Institut Català de Recerca i Estudis Avançats (ICREA), Barcelona, Spain(加泰罗尼亚高级研究与研究机构(ICREA),巴塞罗那,西班牙)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究探讨了大型语言模型与大脑对齐的跨语言鲁棒性,通过多语言全脑编码框架分析了中文、英语和法语在自然故事听觉过程中大脑与LLM的对齐情况,发现其在空间上具有跨语言重叠性,但无法通过预测不确定性或表征几何来解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10726 2026-05-21 cs.CR cs.DC cs.LG 92%

PrefixWall: Mitigating Prefix Caching Side Channels in Shared LLM Systems

PrefixWall: 缓解共享LLM系统中的前缀缓存侧信道

Panagiotis Georgios Pennas, Konstantinos Papaioannou, Marco Guarnieri, Thaleia Dimitra Doudali

机构 * IMDEA Software Institute(IMDEA软件研究所) Universidad Politécnica de Madrid(马德里理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出PrefixWall系统,通过监控缓存重用并选择性隔离前缀,有效缓解多租户LLM服务系统中自动前缀缓存(APC)侧信道带来的安全风险,同时提升缓存利用率和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19604 2026-05-20 cs.AI 92%

Formal Skill: Programmable Runtime Skills for Efficient and Accurate LLM Agents

形式技能:用于高效且准确LLM代理的可编程运行时技能

Xi Zhang, Meijun Gao, Yuntian Zhao, Xinyu Tan, Yilun Yao, Feiyu Wang, Yanshu Wang, Dingsiyi, Tong Yang

机构 * FairyClaw

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出形式技能,一种用于LLM代理的可编程运行时技能抽象,通过JSON元数据和动作模式、可靠的Python执行器、受钩子控制的控制逻辑、形式技能路由和本地运行时状态,提高代理的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19593 2026-05-20 cs.AI cs.DC 92%

Towards Multi-Model LLM Schedulers: Empirical Insights into Offloading and Preemption

迈向多模型LLM调度器:关于卸载和抢占的实证洞察

Mert Yildiz, Pietro Spadaccino, Alexey Rolich, Francesca Cuomo, Andrea Baiocchi

机构 * Sapienza University of Rome(罗马大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过实证研究探讨了不同LLM在不同硬件平台上的行为,重点分析了层卸载和抢占对性能的影响,揭示了卸载和抢占对解码吞吐量的非线性影响以及其在不同模型和硬件平台上的差异,为设计高效的多模型LLM服务系统提供了指导。

Comments The 2026 Mediterranean Artificial Intelligence and Networking Conference (MAIN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17467 2026-05-19 cs.CL 92%

VerifyMAS: Hypothesis Verification for Failure Attribution in LLM Multi-Agent Systems

VerifyMAS: LLM多智能体系统中故障归因的假设验证

Hezhe Qiao, Hanghang Tong, Ee-Peng Lim, Bing Liu, Guansong Pang

机构 * Singapore Management University(新加坡国立管理学院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出VerifyMAS框架,通过验证假设的方法对LLM多智能体系统中的故障进行归因,解决了现有方法在全局故障识别和细粒度归因方面的不足,实验表明其在多种模型上均优于现有方法。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07347 2026-05-19 stat.ML cs.LG math.PR 92%

Throughput-Optimal Scheduling Algorithms for LLM Inference and AI Agents

面向LLM推理和AI代理的吞吐量最优调度算法

J. G. Dai, Tianze Deng, Yueying Li, Tianyi Peng

机构 * School of Operations Research and Information Engineering, Cornell University(Cornell大学运筹学与信息工程学院) Operations Management, Booth School of Business, University of Chicago(芝加哥大学博斯商学院运营管理系) Decision, Risk and Operations, Columbia Business School, Columbia University(哥伦比亚大学哥伦比亚商学院决策、风险与运营系)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文从排队论角度研究了LLM推理系统的吞吐量优化问题,证明了工作保持调度算法在DAG和Fork-Join路由拓扑中能实现最大吞吐量,并揭示了批量处理网络中K-FCFS调度的流极限框架,评估了Orca和Sarathi-Serve的吞吐量最优性,同时指出批量大小限制和循环路由拓扑对吞吐量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02161 2026-05-19 cs.LG 92%

LLM-TabLogic: Preserving Inter-Column Logical Relationships in Synthetic Tabular Data via Prompt-Guided Latent Diffusion

LLM-TabLogic: 通过提示引导的潜在扩散模型在合成表格数据中保留列间逻辑关系

Yunbo Long, Liming Xu, Alexandra Brintrup

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出LLM-TabLogic方法,利用大语言模型推理捕捉表格列间的复杂逻辑关系,并通过Score-based Diffusion模型在潜在空间中生成数据,以在不需领域知识的情况下有效保持合成表格数据中的列间关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17359 2026-05-19 cs.CL 92%

Learning Transferable Topology Priors for Multi-Agent LLM Collaboration Across Domains

学习跨领域的多智能体LLM协作可转移拓扑先验

Taolin Zhang, Zijie Zhou, Jiuheng Wan, Tingyuan Hu, Chengyu Wang, Xiaofeng He, Richang Hong

机构 * Hefei University of Technology(合肥工业大学) China University of Petroleum (Beijing)(中国石油大学(北京)) East China Normal University(东华大学) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出TopoPrior框架,通过学习可转移的拓扑先验来提升多智能体LLM在跨领域协作中的效率,减少在线搜索开销并提高可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16786 2026-05-19 cs.LG 92%

Lever: Speculative LLM Inference on Smartphones

Lever:智能手机上的推测LLM推理

Tuowei Wang, Fengzu Li, Yanfan Sun, Wei Gao, Ju Ren

机构 * Tsinghua University(清华大学) Beihang University(北航) University of Pittsburgh(匹兹堡大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Lever系统,通过联合优化推测解码的三个阶段,在智能手机上实现高效的闪存支持的LLM推理,显著降低了推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15051 2026-05-15 cs.LG cs.PF 92%

An Interpretable Latency Model for Speculative Decoding in LLM Serving

为LLM服务中的推测解码开发一个可解释的延迟模型

Linghao Kong, Megan Flynn, Michael Peng, Nir Shavit, Mark Kurtz, Alexandre Marques

机构 * MIT(麻省理工学院) Red Hat AI(红帽人工智能)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一个可解释的延迟模型,用于LLM服务中的推测解码,通过Little定律推断有效批处理大小,并分解预填充、草稿和验证的请求需求,以解释延迟变化及系统配置影响。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02711 2026-05-15 cs.AI 92%

Dynamic Mixed-Precision Routing for Efficient Multi-step LLM Interaction

动态混合精度路由用于高效多步LLM交互

Yuanzhe Li, Jianing Deng, Jingtong Hu, Tianlong Chen, Song Wang, Huanrui Yang

机构 * University of Arizona(亚利桑那大学) University of Pittsburgh(匹兹堡大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Central Florida(佛罗里达中央大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出动态混合精度路由框架,通过自适应选择高精度与低精度LLM,在多步决策中实现准确率与成本的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14929 2026-05-15 cs.LG cs.AR 92%

A Hardware-Aware, Per-Layer Methodology for Post-Training Quantization of Large Language Models

一种面向硬件的、分层的后训练量化方法用于大语言模型

Earl Killian

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 本文提出了一种面向硬件的分层后训练量化方法,通过优化代码本和硬件效率,实现4.5-6位/权重的近无损精度,展示了小原子块与精心选择的精度可替代传统FP8。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13496 2026-05-14 cs.DC cs.LG 92%

MARLIN: Multi-Agent Game-Theoretic Reinforcement Learning for Sustainable LLM Inference in Cloud Datacenters

MARLIN:多智能体博弈强化学习用于云数据中心可持续LLM推理

H. Moore, S. Qi, D. Milojicic, C. Bash, S. Pasricha

机构 * Colorado State University(科罗拉多州立大学) Hewlett Packard Labs(惠普实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出MARLIN框架,通过博弈强化学习优化LLM推理的TTFT、碳排放、用水量和能耗,实现至少18%的TTFT、33%的碳排放、43%的用水量和11%的能耗降低。

详情

展开后加载摘要…

URL PDF HTML 收藏