arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1990 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1990 篇

2608.09252 2026-08-11 cs.AR 新提交 89%

FSGen: Agile Fused and Sparse Accelerator Generator with Accurate Power Model for LLM Applications

FSGen:面向大语言模型应用的具备精确功耗模型的敏捷融合与稀疏加速器生成器

Jay Zhe-An Mok, Qijun Zhang, Zhiyao Xie

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 FSGen是面向LLM的敏捷加速器生成框架,支持融合算子数据流与稀疏性,其PPA评估器精度更高,能找到功耗效率提升1.4倍或加速比达10倍的帕累托最优设计,大幅缩短设计空间探索时间,品质因数提升58倍。

Comments Research Manuscript Published in Design Automation Conference (DAC) 63 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08611 2026-08-11 cs.DC cs.AR cs.CE 新提交 89%

C2C-Explorer: An Exploration Framework for Chip-to-Chip Interconnect Architectures in LLM Cloud Computing Systems

C2C-Explorer:用于大语言模型云计算系统中芯片间互连架构的探索框架

Jiayi Li, Di Wu, Qingxu Li, Hongxiao Zhao, Jiaqi Yang, Anjunyi Fan, Wenbin Zhang, Boqiang Wu, Shuting Liu, Shifeng Fang, Jianbo Dong, Dimin Niu, Bonan Yan

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 C2C-Explorer是一种自适应贝叶斯DSE框架,整合流量生成器、可扩展互连模拟器与评估器,用于探索LLM云计算系统的C2C互连架构,在DeepSeek-R1-671B负载中可提升有效吞吐量并降低内存占用。

Comments Accepted in DAC'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04991 2026-08-06 cs.DC 新提交 89%

RAC: Reference-Aware Activation Compression for Communication-Efficient Split LLM Inference

RAC:面向通信高效的分割式大语言模型推理的参考感知激活压缩

Guotao Yang, Mingxi Zhao, Haopeng Li, Zhengchao Wang, Sheng Chen, Yitao Hu, Keqiu Li

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对分割式LLM推理的通信瓶颈,提出参考感知激活压缩方法RAC,通过参考感知编解码器等技术降低通信开销,在多模型多链路对实验中验证了其时间性能提升与任务分数变化情况。

Comments 10 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04866 2026-08-06 cs.CV 新提交 89%

Persistent Object Narratives for Token-Efficient Video Language Models

用于令牌高效视频语言模型的持久对象叙事

Junzhe Chen, Siyuan Meng, Xiaojie Guo

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract)

AI总结 本文提出SlotNarrative,一种用于Video-LLM的紧凑结构化视觉接口,通过持久对象叙事减少视觉令牌数量,在多数据集上实现准确率与令牌数的良好权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03867 2026-08-05 cs.AR 新提交 89%

Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference

面向高效低比特大语言模型推理的异构感知微缩放技术

Junyi Luo, Xinting Jiang, Tai-Hao Wen, Ruichen Qi, Minxing Chu, Hongyi Wu, Gregory Kielian, Ben Laurie, Qirui Zhang, Quan Cheng, Dennis Sylvester, Mehdi Saligane

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对低比特LLM推理的MX格式精度损失问题,提出异构感知的AdaMX格式与加速器,在不增加EBW的前提下提升精度、降低存储能耗,在多类LLM及多模态模型上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02341 2026-08-04 cs.NI 新提交 89%

Broadcast Rate Limits in Wi-Fi: A Forgotten Bottleneck for Collaborative Edge LLM Inference

Wi-Fi中的广播速率限制:协作式边缘大语言模型(LLM)推理被遗忘的瓶颈

Liujianfu Wang, Yuyang Du, Shiqi Xu, Soung Chang Liew

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 该研究针对协作式边缘LLM推理的通信瓶颈,提出适配UDP广播的MoE推理方法,发现Wi-Fi广播速率限制的遗留问题并通过仿真验证,推动Wi-Fi标准将广播纳入高吞吐量数据平面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00378 2026-08-04 cs.SE 新提交 89%

CASPER-Change-Aware Slice Prioritization for Efficient Regression Testing of LLM-based systems

CASPER——面向基于大语言模型(LLM)系统高效回归测试的感知变更的切片优先级排序

Biruk Asmare Muse, Lionel Briand, Yiwei Lu, Keheliya Gallaba

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对基于LLM系统回归测试的独特挑战,提出CASPER框架,通过进化切片识别与基于执行日志行为信息的优先级排序,实现更优的回归切片处理效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01126 2026-08-04 cs.IT math.IT 新提交 89%

Spatial Prefix Caching for Wireless Edge LLM Inference: A Stochastic-Geometry and Queueing Framework

面向无线边缘大语言模型推理的空间前缀缓存:一种随机几何与排队框架

Le Yang, Zhouyong Liu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文构建随机几何与排队框架,针对无线边缘LLM推理的空间通信-缓存-计算权衡优化,揭示延迟最优节点非最近节点、TTFT随缓存前缀深度非单调变化的规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29575 2026-08-03 cs.DC cs.PF 新提交 89%

SLIM: Saturation-Aware Lightweight Performance Modeling for LLM Serving

SLIM:面向大语言模型服务的饱和度感知轻量级性能建模

Pol G. Recasens, Ferran Agullo, Yue Zhu, Chen Wang, Jordi Torres, Josep Ll. Berral

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对LLM服务吞吐量饱和问题,通过GPU剖析明确其源于解码阶段注意力内核的DRAM带宽饱和,提出SLIM半分析性能模型及BCA工具,可高效预测吞吐量与延迟并优化批处理配置。

Comments Pol G. Recasens and Ferran Agullo contributed equally to the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28150 2026-07-31 cs.DC 新提交 89%

SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer

SmartGen:支持无缝拆分式大语言模型推理的选择性KV缓存传输方案

Xuchuan Luo, Jiacheng Shen, Xin Wang, Yangfan Zhou

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 SmartGen是一款KV缓存传输引擎,通过三种数据传输路径实现拆分式LLM推理的KV缓存选择性传输,可将首token生成时间最多缩短4.3倍,且后续性能与准确率相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27648 2026-07-31 cs.SE 新提交 89%

Not as Sweet by Another Name: An Empirical Study of Format Robustness in LLM Document Workflows

换个名字就不甜了:LLM文档工作流中格式鲁棒性的实证研究

Xiaoyu Zhang, Xianyun Cheng, Tianlin Li, Yuwei Zheng, Yue Yang, Yang Liu

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出感知格式的变形测试框架,经大规模实证研究发现LLM文档工作流的格式鲁棒性存在严重问题,切换格式可致准确率降53.63%,并设计出无需重训模型的缓解策略。

Comments 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27606 2026-07-31 cs.SE 新提交 89%

LimICE: Integrating LLM into ICE Framework for Efficient Loop Invariant Inference

LimICE:将大语言模型(LLM)集成到ICE框架以实现高效循环不变式推理

Kai Fan, ShiWen Yu, GuangSheng Fan, HaoAng Chi, WanWei Liu, Ji Wang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 该研究提出集成LLM与ICE框架的增量式学习框架LimICE,用于循环不变式综合,在367个线性、50个非线性基准上的实验显示其解决实例更多、运行速度更快,性能优于相关基线。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26633 2026-07-30 cs.AR 新提交 89%

NELSSA: A GPU-PNM Heterogeneous System for Mixed-Length LLM Serving via Length-based Request Placement

NELSSA:一种基于GPU-PNM异构系统的LLM混合长度服务框架,通过基于长度的请求放置实现

Sookyung Choi, Seungyong Lee, Kangkyu Park, Yunseo Chun, Junseok Lee, Hyeongseok Gwak, Myunghyun Rhee, Euiseok Kim, Donguk Moon, Kwangsik Shin, Guseul Heo, Youngpyo Joo, Hoshik Kim, Jongse Park

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 NELSSA是集成GPU与PNM加速器的LLM服务系统,通过基于长度的请求放置处理混合长度工作负载,解码吞吐量最高提升5.5倍,P99延迟最高降低15倍,为LLM基础设施提供新范式。

Comments 14 pages, 19 figures. Accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25498 2026-07-29 cs.AR 新提交 89%

Beyond Prefill-Decode Disaggregation: Dissecting LLM Inference for Heterogeneous Platforms via Dynamic Operator Scheduling

超越预填充-解码分解:通过动态算子调度剖析异构平台上的大语言模型推理

Jiaqi Yang, Jiayi Li, Yihan Fu, Hongxiao Zhao, Zhan Chen, Qiuping Wu, Yuchao Yang, Bonan Yan

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对异构平台上LLM推理,提出硬件感知的DOPS框架,通过构建阶段感知DAG,集成双焦点调度器和权重布局仲裁器,实现算子调度与权重布局联合优化,在异构系统中取得加速效果并支持相关分析。

Comments To appear in MICRO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17175 2026-07-21 cs.DC 新提交 89%

LMEdge: QoS-Aware LLM Inference Orchestration on Edge Clusters

LMEdge:边缘集群上的QoS感知大语言模型推理编排

Reza Farahani, Zoha Azimi, Mario Colosi, Schahram Dustdar

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究在边缘集群上进行QoS感知的LLM推理编排问题,提出LMEdge服务。通过BILP优化并结合五个轻量级ML模型预测相关指标,设计轻量级启发式方法。在边缘测试平台评估,结果显示其降低延迟、保持准确性、提高资源利用率及服务比率。

Comments 12 pages, 5 figures, 2 tables, EUROPAR conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11810 2026-07-14 cs.HC 新提交 89%

Supporting Reflection in LLM-based Exploratory Search

支持基于大语言模型的探索性搜索中的反思

Giulia Di Fede, Salvatore Andolina

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究探索性搜索中LLMs的问题,提出TrailLM系统,通过与用户意义建构工作流程对齐,帮助用户重构和重温探索路径,在保留基于LLM搜索优势的同时,增加对搜索过程批判性反思机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10186 2026-07-14 cs.AR 新提交 89%

FlashAccel: Leveraging High-Bandwidth Flash for High-Throughput LLM Inference

FlashAccel:利用高带宽闪存实现高吞吐量语言模型推理

Xinyu Wang, Yalong Xue, Xiaotian Sun, Xiaoyu Zhang, Chunmeng Dou, Xueqi Li, Xiaoming Chen

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM推理受HBM容量限制问题,提出FlashAccel系统,将HBF集成到基于HBM的GPU中,通过架构支持、特殊数据布局及引入新管理层和编程模型,在100ms延迟约束下,提升了每GPU吞吐量和能源效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23969 2026-07-13 cs.DC cs.CR cs.PF 新提交 89%

The Serialized Bridge: Understanding and Recovering LLM Serving Performance under Blackwell GPU Confidential Computing

序列化桥接:理解与恢复Blackwell GPU机密计算下的LLM服务性能

Hang Yin, Kevin Wang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文发现Intel TDX加GPU-CC下LLM服务吞吐量下降13-27%的主因是机密VM-GPU桥接的序列化开销,而非GPU计算本身,并通过调度优化恢复高达92%的性能损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04379 2026-07-07 cs.CR 新提交 89%

Knowledge Base Poisoning Attacks and Defense for Policy-Aware LLM-RAG Framework

用于战场物联网任务控制的策略感知大语言模型检索增强生成(PA-LLM-RAG)框架的知识库中毒攻击与防御

Om Solanki, Lopamudra Praharaj, Deepti Gupta, Maanak Gupta

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 研究针对战场物联网任务控制的PA-LLM-RAG框架的对抗安全。提出查询无关语义检索中毒攻击,能注入规则致大语言模型上下文损坏。还提出CLD-KB防御框架,在检测中毒和知识保存方面性能优异。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01617 2026-07-03 cs.AR 新提交 89%

3DLS: A 3D Logic-Stacked Architecture for Disaggregated LLM Serving

3DLS:一种用于分离式LLM服务的3D逻辑堆叠架构

Jaehun Lee, In-Jun Jung, Joo-Young Kim

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对预填-解码分离与张量并行中KV缓存传输和TP集合共享互连导致的关键路径争用问题,提出3D逻辑堆叠架构3DLS,通过垂直互连分离流量,提升吞吐量达1.49倍,降低端到端延迟60.2%。

Comments Accepted to IEEE Computer Architecture Letters (CAL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00151 2026-07-02 cs.DC 新提交 89%

SmoothAgent: Efficient Long-Horizon LLM-Based Agent Serving with Lookahead Context Engineering

SmoothAgent: 基于前瞻上下文工程的高效长程LLM Agent服务

Zaifeng Pan, Qianxu Wang, Zhengding Hu, Chang Chen, Yue Guan, Yanbo Zhou, Steven Swanson, Yufei Ding

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对LLM Agent中上下文变换导致KV缓存失效和TTFT增加的问题,提出前瞻编程模型和调度器,实现异步上下文预处理,降低TTFT达11.9倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30980 2026-07-01 cs.HC 新提交 89%

Ethics and Social Responsibility in AI-Assisted Interviewing: An LLM-in-the-Loop Study of AI-Generated Follow-Up Questions

AI辅助访谈中的伦理与社会责任:基于LLM-in-the-loop的AI生成追问研究

He Zhang, Yueyan Liu, Xin Guan, Jie Cai, John M. Carroll

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 通过LLM-in-the-loop Wizard-of-Oz实验,研究AI实时生成追问在访谈中的应用,发现五大伦理问题:有害语言、尊重缺失、参与不平等、责任模糊及隐私风险,并提出设计与治理建议。

Comments This work has been accepted to CHIWORK '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27990 2026-06-29 cs.CR 新提交 89%

AdvancedShelLM: A Stateful Multi-Agent LLM Honeypot for SSH Deception

AdvancedShelLM:一种用于SSH欺骗的有状态多智能体LLM蜜罐

Muris Sladić, Eman Alibalić, Veronica Valeros, Carlos Catania, Sebastian Garcia

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出AdvancedShelLM蜜罐,采用多智能体多LLM架构,通过Manager和Worker两个LLM代理提升命令理解、减少错误响应并增强欺骗性,实现永久文件系统以支持多攻击者同时观察变化文件,评估显示高通过率和有效欺骗。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27665 2026-06-29 cs.SE 新提交 89%

LLM-Assisted Model-Based GUI Testing for Vue.js Web Applications

基于LLM辅助的Vue.js Web应用模型驱动GUI测试

Tao Li, Chenhui Cui, Rubing Huang, Dave Towey, Shikai Guo, Lei Ma

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LLMVue框架,利用大语言模型从Vue.js源码生成页面转换图,实现模型驱动GUI测试,在10个开源项目上验证了高精度和高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25426 2026-06-25 cs.PF 新提交 89%

Above the Inner Loop: Exceeding Accelerate at LLM Prefill GEMM on the M1 AMX

在内循环之上:在M1 AMX上超越Accelerate的LLM预填充GEMM

Deyvik Bhan

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 通过微基准测试发现M1 AMX的内循环受限于加载-发射,手写内核通过细粒度多线程面板和预打包权重两个部署级杠杆超越Accelerate,在12种LLM预填充GEMM形状上实现1.17倍到2.0倍的加速,且位精确。

Comments 11 pages, 2 figures, 6 tables. Code: https://github.com/dbhan08/inferc

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20847 2026-06-23 eess.IV cs.MM 新提交 89%

LLM-Driven Heuristic Frame-Level Quantization Parameter Adaptation for VVenC

基于LLM的启发式帧级量化参数自适应调整用于VVenC

Liqiang He, Yingwen Zhang, Riyu Lu, Meng Wang, Shiqi Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出利用大语言模型自动设计帧级QP分配的率失真优化启发式,通过闭环进化框架迭代生成并评估候选算法,在VVenC上实现优于固定QP和拉格朗日基线的率失真性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22968 2026-06-23 cs.AR 新提交 89%

MOCAP: Wafer-Scale-Chip-Oriented Memory-Orchestrated Chunked Pipelining Framework for Prefill-Only LLM Inference

MOCAP:面向晶圆级芯片的面向预填充LLM推理的内存协调分块流水线框架

Zichuan Wang, Huizheng Wang, Yuheng Xiao, Haonan Zuo, Taiquan Wei, Jinyi Deng, Chao Li, Yang Hu, Shouyi Yin

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出MOCAP框架,通过内存平衡KV重分配和延迟平衡分块划分,解决晶圆级芯片上长上下文预填充中的内存和延迟不平衡问题,显著降低端到端延迟并提高吞吐量。

Comments 15 pages, 6 figures, accepted by APPT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22560 2026-06-23 cs.CR 新提交 89%

Evidence-Bound Gateway-Path Provenance for Third-Party LLM Inference

第三方LLM推理的证据绑定网关路径溯源

Fei Wang, Zebai Tian

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对第三方LLM网关中路由替换、隐藏回退等不可信问题,提出证据绑定架构,通过受信任执行环境分离控制面与执行面,实现可验证的路径溯源。

Comments 9 pages,2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22175 2026-06-23 cs.DC 新提交 89%

StickyInvoc: Rethinking Task Models for High-throughput Workflows in the LLM Era

StickyInvoc:重新思考LLM时代高通量工作流的任务模型

Thanh Son Phung, Douglas Thain

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对LLM推理在高通量工作流中因反复加载模型参数导致的性能瓶颈,提出StickyInvoc任务模型,通过分离状态创建与销毁,将状态持久化复用,实现3.6倍加速。

Comments arXiv admin note: substantial text overlap with arXiv:2510.14024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18851 2026-06-18 eess.SY cs.SY 新提交 89%

From Tokens to Energy Flexibility: Quantization-Enabled Demand Response for Data Centers with LLM Inference Workloads

从令牌到能量灵活性:面向LLM推理工作负载的数据中心量化使能需求响应

Bojun Du, Xiaoyi Fan, Ershun Du, Long Chen, Jianpei Han, Qingchun Hou, Ning Zhang, Chongqing Kang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一种量化使能的能量管理框架,通过建立量化-功率模型和两阶段需求响应模型,实现多园区协同优化,降低数据中心运营成本34.3%。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏