arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2608.01655 2026-08-04 cs.DC 新提交 92%

PrefixPlace: Provable Prefix Key-Value Placement for Large Language Model Serving under Heterogeneous Compute and Transfer Costs

PrefixPlace:异构计算与传输成本下大语言模型服务的可证明前缀键值放置方案

Zhiyu Wang, Rajkumar Buyya

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 针对异构计算与传输成本下LLM前缀KV放置的次优问题,提出PrefixPlace规划器,其性能接近最优且效率高,可提升RAG等场景的成本节省效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29136 2026-08-03 cs.CV 新提交 92%

On the Efficacy of Self-Supervised Point Cloud Encoders for Efficient 3D Large Language Models

自监督点云编码器在高效3D大语言模型中的效能研究

Yao Zheng, Tian Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 该研究探究低成本自监督点云编码器能否替代昂贵多模态编码器用于3D-LLM,经实验发现其与架构存在强交互,为高性价比3D-LLM设计提供指南。

Comments 14 pages, 3 figures. This work has been previously released as a preprint on ChinaXiv (No. ChinaXiv:202607.00167, DOI: 10.12074/202607.00167)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27918 2026-07-31 math.OC 新提交 92%

OptGraph: Large Language Models Enhanced Evolutionary Optimization Via Graph Retrieval-Augmented Generation

OptGraph:基于图检索增强生成的大语言模型增强进化优化

Xianchao Xiu, Jianhao Li, Huangyue Chen, Wanquan Liu

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 针对现有LLM自动化进化优化的局限,提出引入GraphRAG的OptGraph工作流,通过类型化图复用经验等方法,在基准数据集上较现有框架平均精确准确率提升8.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15297 2026-07-20 eess.IV cs.MM 新提交 92%

Large Language Model-Enhanced Multi-hop Parallel Image Semantic Communication

大语言模型增强的多跳并行图像语义通信

Bingyan Xie, Jihong Park, Rui Mao, Longyu Zhou, Tianhao Liang, Yongpeng Wu, Wenjun Zhang

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 研究提出LLM-MHPSC框架减轻多跳无线图像传输失真累积,设计粗到细残余压缩方案,开发LLM-RTO并提出自适应跳选择策略,实验表明其优于现有方案,为多跳语义通信应用提供灵活有效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00511 2026-07-02 cs.SE 新提交 92%

Large Language Models for Multi-Lingual Equivalent Mutant Detection: An Extended Empirical Study

大型语言模型用于多语言等价变异检测:一项扩展的实证研究

Honglin Shu, Zhao Tian, Dong Wang, Junji Yu, Jiazhe Zhang, Xuejie Cao, Junjie Chen, Yasutaka Kamei

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文首次全面实证研究大型语言模型(LLMs)在等价变异检测(EMD)中的应用,使用Java和C变异对评估其性能,发现基于LLM的方法在F1分数上优于传统方法,且微调后的代码嵌入策略检测精度最高,同时展现出跨语言泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01752 2026-06-24 cs.LG cs.AI cs.CL cs.CR 版本更新 92%

Tuning without Peeking: Provable Generalization Bounds and Robust LLM Post-Training

无窥调优:可证明的泛化边界与鲁棒的大语言模型后训练

Ismail Labiad, Mathurin Videau, Matthieu Kowalski, Marc Schoenauer, Alessandro Leite, Julia Kempe, Olivier Teytaud

机构 * Meta FAIR LISN, Inria, CNRS(LISN,Inria,CNRS) NYU Courant Institute(NYU Courant学院)

专题命中 效率与部署 :LLM(title,summary_cn);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出BBoxER黑盒进化方法用于LLM后训练,通过隐式压缩数据诱导信息瓶颈,提供非平凡泛化边界和对数据投毒、提取攻击的鲁棒性理论保证,实验证明其有效性和隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28042 2026-05-28 cs.CL cs.AI cs.LG 92%

Extracting Small Translation Specialists from LLMs by Aggressively Pruning Experts

通过激进剪枝专家从LLM中提取小型翻译专家

Liu O. Martin, Lucas Bandarkar, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 效率与部署 :LLM(title_cn,summary_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种从混合专家LLM中激进剪枝与翻译无关的专家,实现大幅压缩MoE块而不显著降低翻译质量的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11286 2026-05-27 cs.SI cs.CY 92%

Grok in the Wild: Characterizing the Roles and Uses of Large Language Models on Social Media

野外Grok:表征社交媒体上大语言模型的角色与用途

Katelyn Xiaoying Mei, Robert Wolfe, Nicholas Weber, Martin Saveski

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本研究通过分析X平台上三个月的Grok交互数据,系统性地探究了LLM在公共社交空间中的使用模式、角色分类及用户特征,发现Grok主要充当信息提供者,但也承担争议管理角色。

Comments Camera-ready Version for ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26153 2026-04-30 cs.AR cs.IR 92%

RAG-Enhanced Kernel-Based Heuristic Synthesis (RKHS): A Structured Methodology Using Large Language Models for Hardware Design

基于检索增强的核启发式合成(RKHS):利用大语言模型的结构化方法用于硬件设计

Shiva Ahir, Alex Doboli

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文提出RKHS方法,结合检索增强生成、紧凑核启发式模板和LLM驱动的反馈循环,用于硬件设计中的启发式优化,实验证明其在降低延迟的列表调度中有效。

Comments Presented at the NSF Workshop on Agents for Chip Design Automation, UCLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22906 2026-04-28 cs.DC 92%

Network Edge Inference for Large Language Models: Principles, Techniques, and Opportunities

大型语言模型的网络边缘推断:原理、技术与机遇

Zhixiong Chen, Bingjie Zhu, Jiangzhou Wang, Hyundong Shin, Arumugam Nallanathan, Dusit Niyato

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文探讨了大型语言模型在边缘网络中的推断挑战,综述了系统架构、模型优化与资源管理等最新进展,旨在提升边缘环境下的LLM性能。

Comments Accepted as a ACM Computing Surveys 2026 paper

Journal ref ACM Computing Surveys, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21503 2026-04-23 cs.AI cs.CL cs.LG cs.NE 92%

MAR: Efficient Large Language Models via Module-aware Architecture Refinement

MAR:通过模块感知架构优化实现高效的大型语言模型

Junhong Cai, Guiqin Wang, Kejie Zhao, Jianxiong Tang, Xiang Wang, Luziwei Leng, Ran Cheng, Yuxin Ma, Qinghai Guo

机构 * Department of CSE, Southern University of Science and Technology(南方科技大学计算机科学与工程系) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) National Engineering Laboratory for Big Data Analytics, Xi’an Jiaotong University(西安交通大学大数据分析国家工程实验室) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) ACS Laboratory, Huawei Technologies Co., Ltd.(华为技术有限公司ACS实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MAR框架,结合状态空间模型和激活稀疏化,降低LLM的能耗并提升性能,同时设计ATMN和SBDS解决SNN与SSM整合问题,实验表明其在受限资源下性能优异且能超越同等或更大规模的高效模型。

Comments Accepted by ICASSP 2026. 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07115 2025-03-24 cs.CL cs.AI cs.LG 92%

Advancing Tool-Augmented Large Language Models: Integrating Insights from Errors in Inference Trees

Sijia Chen, Yibo Wang, Yi-Feng Wu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Lijun Zhang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16844 2024-07-18 cs.LG cs.AI cs.CL 92%

Think Big, Generate Quick: LLM-to-SLM for Fast Autoregressive Decoding

Benjamin Bergner, Andrii Skliar, Amelie Royer, Tijmen Blankevoort, Yuki Asano, Babak Ehteshami Bejnordi

专题命中 效率与部署 :LLM(title,abstract);SLM(title,abstract);large language model(abstract);language model(abstract)

Comments Work presented at the ES-FoMo II Workshop at ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26170 2026-08-21 cs.CL 版本更新 92%

EvoSelect: Data-Efficient LLM Evolution for Targeted Task Adaptation

EvoSelect:面向目标任务的高效LLM进化

Ting-Wei Li, Sirui Chen, Jiaru Zou, Yingbing Huang, Tianxin Wei, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EvoSelect框架,通过迭代生成-选择-训练循环提升LLM在目标任务上的适应能力,通过最优传输和多样性机制优化数据选择,实验表明其在不同基准测试中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14635 2026-08-19 cs.DC cs.LG 版本更新 92%

Belayer: Efficient Fault Tolerance for LLM Agentic RL Training

Belayer:面向LLM智能体强化学习训练的高效容错机制

Jiecheng Zhou, Qinghao Hu, Peng Sun, Xingcheng Zhang, Weiming Zhang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Belayer系统,针对LLM智能体强化学习训练的生成引擎和环境故障设计容错机制,可降低无故障训练开销,大幅缩短工作节点与环境故障的恢复时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16477 2026-08-18 cs.LG 新提交 92%

Pallas: A Proactive KV Cache Migration Framework for LLM Inference in AI-RAN

Pallas:面向AI-RAN中LLM推理的主动KV缓存迁移框架

Tianhang Ding, Jianchun Liu, Hongli Xu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Pallas是面向AI-RAN中LLM推理的主动KV缓存迁移框架,通过切换前在目标基站预准备推理状态,结合在线调度器优化,显著降低服务中断时间与令牌间延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16201 2026-08-18 cs.LG 新提交 92%

Multi-Granularity Sentiment Integration for LLM-Based Multimodal Sentiment Analysis

面向基于大语言模型(LLM)的多模态情感分析的多粒度情感集成

Shanshan Lin, Yuesheng Wu, Chao Chen, Yizhe Yang, Zhihao Chen, Zexian Yang, Xiangwen Liao

机构 * Fuzhou University(福州大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Jiangxia University(江夏大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究提出MGSI多粒度情感集成框架,通过多尺度编码、文本引导对齐等优化,提升基于LLM的多模态情感分析性能,在四个公开基准上效果优于冻结LLM基线。

Comments Accepted to NLPCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03770 2026-08-18 cs.DC cs.AI 版本更新 92%

E2LLM: Towards Efficient LLM Serving in Heterogeneous Edge/Fog Environments

E2LLM:异构边缘/雾环境中高效LLM服务

Truong-Thanh Le, Amir Taherkordi, Hoang-Loc La, Frank Eliassen, Phuong Hoai Ha, Peiyuan Guan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出E2LLM框架,通过复制模型到多设备组并采用模型并行,结合遗传算法聚类和动态规划分区,在资源受限的异构边缘/雾环境中实现高效LLM部署,相比Splitwise基线在高需求下平均等待时间降低50%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13573 2026-08-17 cs.AI 新提交 92%

A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing

LLM 服务的一年:工作负载演变、缓存与负载均衡

William Nixon, Jon Durbin, Florian Standhartinger, Haryadi S. Gunawi, Juncheng Yang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究通过分析 Chutes 一年的 LLM 生产请求轨迹,揭示了 LLM 服务工作负载的演变规律与用户-模型结构,并将发布完整轨迹供后续研究使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09696 2026-08-14 cs.AI 版本更新 92%

Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models

模型发现智能体:用于数据高效发现机制世界模型的大语言模型辅助贝叶斯实验设计

Kevin Murphy

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出模型发现智能体(MDA),结合LLM与贝叶斯机制,在少量干预下发现机制世界模型,在三类基准上实现数据高效模型学习与可靠干预预测的SOTA性能。

Comments v3: further improve app A (algorithm pseudocode), add new app G (further related work) - (main text unchanged)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10532 2026-08-12 cs.NI cs.LG 新提交 92%

Benchmarking LLM-Guided Control-Plane Policies for Backend Fault Isolation in HAProxy

对HAProxy中后端故障隔离的LLM引导控制平面策略进行基准测试

Aman Chauhan, Vishnu Pendyala

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文测试了不同规模和架构的LLM在HAProxy后端故障隔离中的策略效果,发现约3B有效参数的能力阈值,达标后可显著降低5xx错误,但会增加延迟与令牌开销,高效方案为阈值以上模型的非推理模式。

Comments 43 pages, 6 figures, 15 tables. Submitted to Journal of Network and Computer Applications (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09949 2026-08-12 cs.AI physics.bio-ph 新提交 92%

Closed-Loop LLM Co-Pilots for Digital Agriculture

面向数字农业的闭环大语言模型(LLM)协作副驾驶系统

Serge Kernbach

机构 * CYBRES GmbH(CYBRES有限公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究开发闭环LLM协作副驾驶系统,基于49通道植物传感器网络实现数字农业自主控制,通过三案例验证可缩短生产周期、降低能耗,提升成本价值比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08730 2026-08-12 cs.LG cs.DC cs.PF 版本更新 92%

Measuring and Reducing WebGPU Dispatch Overhead for LLM Inference

测量与降低用于大语言模型(LLM)推理的WebGPU调度开销

Jędrzej Maczan

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究针对WebGPU用于LLM推理时的调度开销问题,提出顺序调度测量方法,发现批大小为1时调度开销是瓶颈,核心贡献为明确该优化方向并指出调度摊销的改进路径。

Comments Accepted to The Fourth UK AI Conference 2026 as a full paper, to be published in Proceedings of Machine Learning Research (PMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26453 2026-08-11 cs.LG 版本更新 92%

Optimizing CUDA like a Human: Micro-Profiling Tools as Expert Surrogates for LLM-Based GPU Kernel Optimization

像人类一样优化CUDA:微剖析工具作为基于LLM的GPU内核优化的专家替代品

Jiading Gai, Shuai Zhang, Kaj Bostrom, Jin Huang, Vihang Patil, Haoyang Fang, Bernie Wang, Huzefa Rangwala, George Karypis

机构 * Amazon(亚马逊) Siemens(西门子) University of Minnesota(明尼苏达大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出KernelPro闭环多智能体系统,通过LLM代码生成与硬件剖析反馈及可插拔瓶颈检测工具迭代优化GPU内核,在KernelBench上实现2.42x/4.69x/5.30x加速比,并首次兼顾能效优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11027 2026-08-11 cs.LG 版本更新 92%

On the Effect of Sampling Diversity in Scaling LLM Inference

在LLM推理扩展中采样多样性的影响

Tianchun Wang, Zichuan Liu, Yuanzhou Chen, Jonathan Light, Weiyang Liu, Haifeng Chen, Xiang Zhang, Wei Cheng

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Los Angeles(加州大学洛杉矶分校) Rensselaer Polytechnic Institute(罗切斯特理工学院) The Chinese University of Hong Kong(香港中文大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) NEC Laboratories America(NEC美国实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了在LLM推理扩展中采样多样性对性能的影响,通过理论和实验证明多样化的采样能提升模型表现,并在不同任务中实现了显著的增益。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06867 2026-08-10 cs.CL 新提交 92%

LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers

LLMRouter:用于开发、评估和部署LLM路由器的统一基础设施

Tao Feng, Fangxu Yu, Haozhen Zhang, Zhongjie Dai, Liangqi Yuan, Zijie Lei, Weizhi Zhang, Kunlun Zhu, Haodong Yue, Keyang Xuan, Ge Liu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland, College Park(马里兰大学帕克分校) Nanyang Technological University(南洋理工大学) Purdue University(普渡大学) University of Illinois Chicago(芝加哥伊利诺伊大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有LLM路由器难以公平比较和扩展的问题,研究提出LLMRouter统一基础设施,构建含多类任务的基准xRouteBench,发现学习型路由器等的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06557 2026-08-10 cs.DC cs.LG 新提交 92%

Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving

Cascade:利用感知SLO的延迟预算实现公平且高吞吐量的LLM推理服务

Muhammad Adnan, Rohan Mahapatra, Prashant J. Nair, Daniel Berger, Pantea Zardoshti, Rodrigo Fonseca, Esha Choukse

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Cascade是一款LLM服务系统,利用单请求延迟预算协同调度与KV缓存管理,在保留异构请求公平性的同时,使LLM推理服务吞吐量最高提升2.4倍,SLO违规率降低40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16336 2026-08-10 cs.CR cs.AI cs.CY 版本更新 92%

On Seeding Watermarks to Detect Verbatim LLM Copy-Paste Responses

检测作业中的直接LLM复制粘贴

Aizierjiang Aiersilan, Artin Yousefi, Robert Pless

机构 * The George Washington University(乔治·华盛顿大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SteganoPrompt工具,通过在作业提示中嵌入隐形指令,使LLM在响应时生成特征签名,帮助教师检测学生直接复制粘贴模型回复的行为。

Comments We are pleased to announce that this paper has been accepted by the 9th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026). We appreciate the valuable feedback from the reviewers and look forward to sharing our findings with the community

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07396 2026-08-06 cs.AR cs.LG 版本更新 92%

SHIELD: A Segmented Hierarchical Memory Architecture for Energy-Efficient LLM Inference on Edge NPUs

SHIELD:一种用于边缘NPUs上高效LLM推断的分段分层内存架构

Jintao Zhang, Xuanyao Fong

机构 * National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SHIELD通过分段eDRAM架构优化边缘NPUs上LLM推断的能效,减少eDRAM刷新能耗35%同时保持准确性。

Comments Accepted to 2026 IEEE 8th International Conference on Artificial Intelligence Circuits and Systems (AICAS'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02995 2026-08-05 cs.CR cs.AI 新提交 92%

SparSEEty: Extracting Tokens from Sparsity-Exploiting LLM Serving Systems via Deterministic Side Channels

SparSEEty:通过确定性侧信道从利用稀疏性的大语言模型(LLM)服务系统中提取 token

Yongwan Jo, Jinyoung Park, Euihyun Lee, Dokyung Song

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SparSEEty 是一种针对利用稀疏性的 LLM 服务系统的 token 提取攻击,通过 CVM 侧信道构建预言机、降低监控开销并反转激活轨迹,可高准确率重建 token,监控开销仅 3.7%-7.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏