arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12697 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2145 篇

2608.16174 2026-08-18 eess.SY cs.SY 新提交 89%

L-COIN: LLM-Assisted Counterfactual Inference for Game-Theoretic Distributed Computation Offloading in Sub-THz LEO Satellite Networks

L-COIN:用于亚太赫兹低轨卫星网络中博弈论分布式计算卸载的大语言模型辅助反事实推理

Jinhao Yi, Weijun Gao, Chong Han

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对亚太赫兹低轨卫星网络的分布式计算卸载问题,提出L-COIN框架,结合LLM与反事实推理,降低卸载成本10.9%-27.7%,提升了时变场景下的卸载性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15531 2026-08-18 cs.DC 新提交 89%

FlashQuant: Sparse-Dense Fusion for Memory-Efficient Outlier-Aware LLM Inference

FlashQuant:面向内存高效的异常值感知大语言模型推理的稀疏-密集融合方案

Junqing Lin, Jingwei Sun, Zhengding Hu, Guangzhong Sun

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 FlashQuant是面向异常值感知W4A16解码的内容共享执行框架,通过融合GPU内核实现稀疏-密集路径的片上复用,在内存受限的LLM解码中大幅降低异常值处理开销,获得显著加速比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15118 2026-08-18 cs.DC 新提交 89%

Collective Communication for Distributed LLM Systems: Planning, Runtime Adaptation, and Computation Coordination

分布式大语言模型系统的集体通信:规划、运行时适配与计算协调

Xuebin Song, Menghao Zhang, Yuezheng Liu, Jinyi Xia, Shucan Yang, Xiaohe Hu, Chunming Hu, Mingwei Xu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出以集体为中心的分类法,将分布式LLM系统集体通信进展分为规划、执行适配、计算通信协调三层,探讨相关开放挑战与未来机遇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14575 2026-08-18 cs.NI 新提交 89%

HW-Router: Hardware-Aware Routing for Scalable Multi-LLM Serving

HW-Router:面向可扩展多大语言模型服务的硬件感知路由

Ahasan Kabir, Jiaqi Xue, Mengxin Zheng, Qian Lou

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 HW-Router是一种动态路由框架,结合实时硬件信号与模型特征实现SLO感知路由,在多LLM服务中相比CARROT等基线显著降低延迟、提升SLO达成率并均衡GPU负载。

Comments Preprint

Journal ref 2026 Design Automation Conference (DAC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13868 2026-08-17 cs.AR 新提交 89%

Exploring High-Bandwidth Flash for Modern LLM Inference: Opportunities and Challenges

探索用于现代大语言模型推理的高带宽闪存:机遇与挑战

Dowon Son, Yonggon Park, Hyunuk Cho, Hyungkyu Ham, Onur Mutlu, Sungjin Lee, Gwangsun Kim, Jisung Park

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究分析高带宽闪存(HBF)用于大语言模型(LLM)推理的机遇与挑战,发现HBF可提升LLM服务系统性能并降低GPU需求,但需维持类HBM读取带宽并提升耐用性。

Comments 4 pages, 7 figures, IEEE Computer Architecture Letters (CAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09089 2026-08-11 stat.AP 新提交 89%

Extreme Value Alpha and Crash Risk: Separating Structural Tails from Lottery Tails with LLM-Extracted Disclosure Networks

极值阿尔法与崩盘风险:通过LLM提取的披露网络区分结构性尾部与彩票式尾部

Lin Zhang, Fan Yang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 该研究利用LLM从10-K文件提取的公司披露网络,将股票收益上尾分为崩盘侧与结构性尾部,通过24家科技公司试点验证了崩盘侧信号的有效性,明确了判别器的适用边界。

Comments 19 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09440 2026-08-11 cs.IR 新提交 89%

MetaStrategy: Generative Ranking with Executable LLM Strategies

MetaStrategy:基于可执行大语言模型策略的生成式排序

Chengyu Lai, Jiuning Lin, Zhibo Xiao, Xiaodong Zhu, Ruiquan Lan, Bin Zhang, Zihong Huang, Wendong Zhang, Chuxin Chen, Yinjiang Cai, Shuai Zhong, Lingqing Zhang, Dimin Wang, Jialin Zhu, Han Zhu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 MetaStrategy是一种可执行LLM策略的生成式排序框架,经淘宝部署测试,其提升了多项核心业务指标且未增加响应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09252 2026-08-11 cs.AR 新提交 89%

FSGen: Agile Fused and Sparse Accelerator Generator with Accurate Power Model for LLM Applications

FSGen:面向大语言模型应用的具备精确功耗模型的敏捷融合与稀疏加速器生成器

Jay Zhe-An Mok, Qijun Zhang, Zhiyao Xie

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 FSGen是面向LLM的敏捷加速器生成框架,支持融合算子数据流与稀疏性,其PPA评估器精度更高,能找到功耗效率提升1.4倍或加速比达10倍的帕累托最优设计,大幅缩短设计空间探索时间,品质因数提升58倍。

Comments Research Manuscript Published in Design Automation Conference (DAC) 63 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08611 2026-08-11 cs.DC cs.AR cs.CE 新提交 89%

C2C-Explorer: An Exploration Framework for Chip-to-Chip Interconnect Architectures in LLM Cloud Computing Systems

C2C-Explorer:用于大语言模型云计算系统中芯片间互连架构的探索框架

Jiayi Li, Di Wu, Qingxu Li, Hongxiao Zhao, Jiaqi Yang, Anjunyi Fan, Wenbin Zhang, Boqiang Wu, Shuting Liu, Shifeng Fang, Jianbo Dong, Dimin Niu, Bonan Yan

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 C2C-Explorer是一种自适应贝叶斯DSE框架,整合流量生成器、可扩展互连模拟器与评估器,用于探索LLM云计算系统的C2C互连架构,在DeepSeek-R1-671B负载中可提升有效吞吐量并降低内存占用。

Comments Accepted in DAC'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04991 2026-08-06 cs.DC 新提交 89%

RAC: Reference-Aware Activation Compression for Communication-Efficient Split LLM Inference

RAC:面向通信高效的分割式大语言模型推理的参考感知激活压缩

Guotao Yang, Mingxi Zhao, Haopeng Li, Zhengchao Wang, Sheng Chen, Yitao Hu, Keqiu Li

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对分割式LLM推理的通信瓶颈,提出参考感知激活压缩方法RAC,通过参考感知编解码器等技术降低通信开销,在多模型多链路对实验中验证了其时间性能提升与任务分数变化情况。

Comments 10 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04866 2026-08-06 cs.CV 新提交 89%

Persistent Object Narratives for Token-Efficient Video Language Models

用于令牌高效视频语言模型的持久对象叙事

Junzhe Chen, Siyuan Meng, Xiaojie Guo

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract)

AI总结 本文提出SlotNarrative,一种用于Video-LLM的紧凑结构化视觉接口,通过持久对象叙事减少视觉令牌数量,在多数据集上实现准确率与令牌数的良好权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03867 2026-08-05 cs.AR 新提交 89%

Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference

面向高效低比特大语言模型推理的异构感知微缩放技术

Junyi Luo, Xinting Jiang, Tai-Hao Wen, Ruichen Qi, Minxing Chu, Hongyi Wu, Gregory Kielian, Ben Laurie, Qirui Zhang, Quan Cheng, Dennis Sylvester, Mehdi Saligane

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对低比特LLM推理的MX格式精度损失问题,提出异构感知的AdaMX格式与加速器,在不增加EBW的前提下提升精度、降低存储能耗,在多类LLM及多模态模型上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02341 2026-08-04 cs.NI 新提交 89%

Broadcast Rate Limits in Wi-Fi: A Forgotten Bottleneck for Collaborative Edge LLM Inference

Wi-Fi中的广播速率限制:协作式边缘大语言模型(LLM)推理被遗忘的瓶颈

Liujianfu Wang, Yuyang Du, Shiqi Xu, Soung Chang Liew

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 该研究针对协作式边缘LLM推理的通信瓶颈,提出适配UDP广播的MoE推理方法,发现Wi-Fi广播速率限制的遗留问题并通过仿真验证,推动Wi-Fi标准将广播纳入高吞吐量数据平面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00378 2026-08-04 cs.SE 新提交 89%

CASPER-Change-Aware Slice Prioritization for Efficient Regression Testing of LLM-based systems

CASPER——面向基于大语言模型(LLM)系统高效回归测试的感知变更的切片优先级排序

Biruk Asmare Muse, Lionel Briand, Yiwei Lu, Keheliya Gallaba

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对基于LLM系统回归测试的独特挑战,提出CASPER框架,通过进化切片识别与基于执行日志行为信息的优先级排序,实现更优的回归切片处理效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01126 2026-08-04 cs.IT math.IT 新提交 89%

Spatial Prefix Caching for Wireless Edge LLM Inference: A Stochastic-Geometry and Queueing Framework

面向无线边缘大语言模型推理的空间前缀缓存:一种随机几何与排队框架

Le Yang, Zhouyong Liu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文构建随机几何与排队框架,针对无线边缘LLM推理的空间通信-缓存-计算权衡优化,揭示延迟最优节点非最近节点、TTFT随缓存前缀深度非单调变化的规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29575 2026-08-03 cs.DC cs.PF 新提交 89%

SLIM: Saturation-Aware Lightweight Performance Modeling for LLM Serving

SLIM:面向大语言模型服务的饱和度感知轻量级性能建模

Pol G. Recasens, Ferran Agullo, Yue Zhu, Chen Wang, Jordi Torres, Josep Ll. Berral

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对LLM服务吞吐量饱和问题,通过GPU剖析明确其源于解码阶段注意力内核的DRAM带宽饱和,提出SLIM半分析性能模型及BCA工具,可高效预测吞吐量与延迟并优化批处理配置。

Comments Pol G. Recasens and Ferran Agullo contributed equally to the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28150 2026-07-31 cs.DC 新提交 89%

SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer

SmartGen:支持无缝拆分式大语言模型推理的选择性KV缓存传输方案

Xuchuan Luo, Jiacheng Shen, Xin Wang, Yangfan Zhou

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 SmartGen是一款KV缓存传输引擎,通过三种数据传输路径实现拆分式LLM推理的KV缓存选择性传输,可将首token生成时间最多缩短4.3倍,且后续性能与准确率相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27648 2026-07-31 cs.SE 新提交 89%

Not as Sweet by Another Name: An Empirical Study of Format Robustness in LLM Document Workflows

换个名字就不甜了:LLM文档工作流中格式鲁棒性的实证研究

Xiaoyu Zhang, Xianyun Cheng, Tianlin Li, Yuwei Zheng, Yue Yang, Yang Liu

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出感知格式的变形测试框架,经大规模实证研究发现LLM文档工作流的格式鲁棒性存在严重问题,切换格式可致准确率降53.63%,并设计出无需重训模型的缓解策略。

Comments 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27606 2026-07-31 cs.SE 新提交 89%

LimICE: Integrating LLM into ICE Framework for Efficient Loop Invariant Inference

LimICE:将大语言模型(LLM)集成到ICE框架以实现高效循环不变式推理

Kai Fan, ShiWen Yu, GuangSheng Fan, HaoAng Chi, WanWei Liu, Ji Wang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 该研究提出集成LLM与ICE框架的增量式学习框架LimICE,用于循环不变式综合,在367个线性、50个非线性基准上的实验显示其解决实例更多、运行速度更快,性能优于相关基线。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26633 2026-07-30 cs.AR 新提交 89%

NELSSA: A GPU-PNM Heterogeneous System for Mixed-Length LLM Serving via Length-based Request Placement

NELSSA:一种基于GPU-PNM异构系统的LLM混合长度服务框架,通过基于长度的请求放置实现

Sookyung Choi, Seungyong Lee, Kangkyu Park, Yunseo Chun, Junseok Lee, Hyeongseok Gwak, Myunghyun Rhee, Euiseok Kim, Donguk Moon, Kwangsik Shin, Guseul Heo, Youngpyo Joo, Hoshik Kim, Jongse Park

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 NELSSA是集成GPU与PNM加速器的LLM服务系统,通过基于长度的请求放置处理混合长度工作负载,解码吞吐量最高提升5.5倍,P99延迟最高降低15倍,为LLM基础设施提供新范式。

Comments 14 pages, 19 figures. Accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25498 2026-07-29 cs.AR 新提交 89%

Beyond Prefill-Decode Disaggregation: Dissecting LLM Inference for Heterogeneous Platforms via Dynamic Operator Scheduling

超越预填充-解码分解:通过动态算子调度剖析异构平台上的大语言模型推理

Jiaqi Yang, Jiayi Li, Yihan Fu, Hongxiao Zhao, Zhan Chen, Qiuping Wu, Yuchao Yang, Bonan Yan

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对异构平台上LLM推理,提出硬件感知的DOPS框架,通过构建阶段感知DAG,集成双焦点调度器和权重布局仲裁器,实现算子调度与权重布局联合优化,在异构系统中取得加速效果并支持相关分析。

Comments To appear in MICRO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17175 2026-07-21 cs.DC 新提交 89%

LMEdge: QoS-Aware LLM Inference Orchestration on Edge Clusters

LMEdge:边缘集群上的QoS感知大语言模型推理编排

Reza Farahani, Zoha Azimi, Mario Colosi, Schahram Dustdar

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究在边缘集群上进行QoS感知的LLM推理编排问题,提出LMEdge服务。通过BILP优化并结合五个轻量级ML模型预测相关指标,设计轻量级启发式方法。在边缘测试平台评估,结果显示其降低延迟、保持准确性、提高资源利用率及服务比率。

Comments 12 pages, 5 figures, 2 tables, EUROPAR conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11810 2026-07-14 cs.HC 新提交 89%

Supporting Reflection in LLM-based Exploratory Search

支持基于大语言模型的探索性搜索中的反思

Giulia Di Fede, Salvatore Andolina

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究探索性搜索中LLMs的问题,提出TrailLM系统,通过与用户意义建构工作流程对齐,帮助用户重构和重温探索路径,在保留基于LLM搜索优势的同时,增加对搜索过程批判性反思机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23969 2026-07-13 cs.DC cs.CR cs.PF 新提交 89%

The Serialized Bridge: Understanding and Recovering LLM Serving Performance under Blackwell GPU Confidential Computing

序列化桥接:理解与恢复Blackwell GPU机密计算下的LLM服务性能

Hang Yin, Kevin Wang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文发现Intel TDX加GPU-CC下LLM服务吞吐量下降13-27%的主因是机密VM-GPU桥接的序列化开销,而非GPU计算本身,并通过调度优化恢复高达92%的性能损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04379 2026-07-07 cs.CR 新提交 89%

Knowledge Base Poisoning Attacks and Defense for Policy-Aware LLM-RAG Framework

用于战场物联网任务控制的策略感知大语言模型检索增强生成(PA-LLM-RAG)框架的知识库中毒攻击与防御

Om Solanki, Lopamudra Praharaj, Deepti Gupta, Maanak Gupta

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 研究针对战场物联网任务控制的PA-LLM-RAG框架的对抗安全。提出查询无关语义检索中毒攻击,能注入规则致大语言模型上下文损坏。还提出CLD-KB防御框架,在检测中毒和知识保存方面性能优异。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01617 2026-07-03 cs.AR 新提交 89%

3DLS: A 3D Logic-Stacked Architecture for Disaggregated LLM Serving

3DLS:一种用于分离式LLM服务的3D逻辑堆叠架构

Jaehun Lee, In-Jun Jung, Joo-Young Kim

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对预填-解码分离与张量并行中KV缓存传输和TP集合共享互连导致的关键路径争用问题,提出3D逻辑堆叠架构3DLS,通过垂直互连分离流量,提升吞吐量达1.49倍,降低端到端延迟60.2%。

Comments Accepted to IEEE Computer Architecture Letters (CAL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00151 2026-07-02 cs.DC 新提交 89%

SmoothAgent: Efficient Long-Horizon LLM-Based Agent Serving with Lookahead Context Engineering

SmoothAgent: 基于前瞻上下文工程的高效长程LLM Agent服务

Zaifeng Pan, Qianxu Wang, Zhengding Hu, Chang Chen, Yue Guan, Yanbo Zhou, Steven Swanson, Yufei Ding

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对LLM Agent中上下文变换导致KV缓存失效和TTFT增加的问题,提出前瞻编程模型和调度器,实现异步上下文预处理,降低TTFT达11.9倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30980 2026-07-01 cs.HC 新提交 89%

Ethics and Social Responsibility in AI-Assisted Interviewing: An LLM-in-the-Loop Study of AI-Generated Follow-Up Questions

AI辅助访谈中的伦理与社会责任:基于LLM-in-the-loop的AI生成追问研究

He Zhang, Yueyan Liu, Xin Guan, Jie Cai, John M. Carroll

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 通过LLM-in-the-loop Wizard-of-Oz实验,研究AI实时生成追问在访谈中的应用,发现五大伦理问题:有害语言、尊重缺失、参与不平等、责任模糊及隐私风险,并提出设计与治理建议。

Comments This work has been accepted to CHIWORK '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27990 2026-06-29 cs.CR 新提交 89%

AdvancedShelLM: A Stateful Multi-Agent LLM Honeypot for SSH Deception

AdvancedShelLM:一种用于SSH欺骗的有状态多智能体LLM蜜罐

Muris Sladić, Eman Alibalić, Veronica Valeros, Carlos Catania, Sebastian Garcia

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出AdvancedShelLM蜜罐,采用多智能体多LLM架构,通过Manager和Worker两个LLM代理提升命令理解、减少错误响应并增强欺骗性,实现永久文件系统以支持多攻击者同时观察变化文件,评估显示高通过率和有效欺骗。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27665 2026-06-29 cs.SE 新提交 89%

LLM-Assisted Model-Based GUI Testing for Vue.js Web Applications

基于LLM辅助的Vue.js Web应用模型驱动GUI测试

Tao Li, Chenhui Cui, Rubing Huang, Dave Towey, Shikai Guo, Lei Ma

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LLMVue框架,利用大语言模型从Vue.js源码生成页面转换图,实现模型驱动GUI测试,在10个开源项目上验证了高精度和高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏