arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12697 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2145 篇

2606.25426 2026-06-25 cs.PF 新提交 89%

Above the Inner Loop: Exceeding Accelerate at LLM Prefill GEMM on the M1 AMX

在内循环之上:在M1 AMX上超越Accelerate的LLM预填充GEMM

Deyvik Bhan

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 通过微基准测试发现M1 AMX的内循环受限于加载-发射,手写内核通过细粒度多线程面板和预打包权重两个部署级杠杆超越Accelerate,在12种LLM预填充GEMM形状上实现1.17倍到2.0倍的加速,且位精确。

Comments 11 pages, 2 figures, 6 tables. Code: https://github.com/dbhan08/inferc

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20847 2026-06-23 eess.IV cs.MM 新提交 89%

LLM-Driven Heuristic Frame-Level Quantization Parameter Adaptation for VVenC

基于LLM的启发式帧级量化参数自适应调整用于VVenC

Liqiang He, Yingwen Zhang, Riyu Lu, Meng Wang, Shiqi Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出利用大语言模型自动设计帧级QP分配的率失真优化启发式,通过闭环进化框架迭代生成并评估候选算法,在VVenC上实现优于固定QP和拉格朗日基线的率失真性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22968 2026-06-23 cs.AR 新提交 89%

MOCAP: Wafer-Scale-Chip-Oriented Memory-Orchestrated Chunked Pipelining Framework for Prefill-Only LLM Inference

MOCAP:面向晶圆级芯片的面向预填充LLM推理的内存协调分块流水线框架

Zichuan Wang, Huizheng Wang, Yuheng Xiao, Haonan Zuo, Taiquan Wei, Jinyi Deng, Chao Li, Yang Hu, Shouyi Yin

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出MOCAP框架,通过内存平衡KV重分配和延迟平衡分块划分,解决晶圆级芯片上长上下文预填充中的内存和延迟不平衡问题,显著降低端到端延迟并提高吞吐量。

Comments 15 pages, 6 figures, accepted by APPT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22560 2026-06-23 cs.CR 新提交 89%

Evidence-Bound Gateway-Path Provenance for Third-Party LLM Inference

第三方LLM推理的证据绑定网关路径溯源

Fei Wang, Zebai Tian

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对第三方LLM网关中路由替换、隐藏回退等不可信问题,提出证据绑定架构,通过受信任执行环境分离控制面与执行面,实现可验证的路径溯源。

Comments 9 pages,2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22175 2026-06-23 cs.DC 新提交 89%

StickyInvoc: Rethinking Task Models for High-throughput Workflows in the LLM Era

StickyInvoc:重新思考LLM时代高通量工作流的任务模型

Thanh Son Phung, Douglas Thain

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对LLM推理在高通量工作流中因反复加载模型参数导致的性能瓶颈,提出StickyInvoc任务模型,通过分离状态创建与销毁,将状态持久化复用,实现3.6倍加速。

Comments arXiv admin note: substantial text overlap with arXiv:2510.14024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18851 2026-06-18 eess.SY cs.SY 新提交 89%

From Tokens to Energy Flexibility: Quantization-Enabled Demand Response for Data Centers with LLM Inference Workloads

从令牌到能量灵活性:面向LLM推理工作负载的数据中心量化使能需求响应

Bojun Du, Xiaoyi Fan, Ershun Du, Long Chen, Jianpei Han, Qingchun Hou, Ning Zhang, Chongqing Kang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一种量化使能的能量管理框架,通过建立量化-功率模型和两阶段需求响应模型,实现多园区协同优化,降低数据中心运营成本34.3%。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18600 2026-06-18 cs.DC 新提交 89%

ShuntServe: Cost-Efficient LLM Serving on Heterogeneous Spot GPU Clusters

ShuntServe: 异构竞价型GPU集群上的成本高效LLM服务

Seungwoo Jeong, Moohyun Song, Juhyun Park, Kyungyong Lee

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出ShuntServe系统,通过屋顶线模型估计性能和动态规划优化模型放置,在异构竞价型GPU集群上最大化吞吐量,结合输出保留迁移与共享张量存储实现容错,相比基线吞吐量提升1.42倍,成本效率提升31.9%以上。

Comments 18 pages, 16 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17949 2026-06-17 cs.DC 新提交 89%

RouteBalance: Fused Model Routing and Load Balancing for Heterogeneous LLM Serving

RouteBalance: 面向异构LLM服务的融合模型路由与负载均衡

Wei Da, Evangelia Kalyvianaki

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出RouteBalance,通过融合模型路由与负载均衡为异构LLM服务实现质量、延迟和成本的三维联合优化,在13实例28GPU集群上达到最优前沿。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16264 2026-06-16 cs.DC 新提交 89%

Tropical: Enhancing SLO Attainment in Disaggregated LLM Serving via SLO-Aware Multiplexing

Tropical: 通过SLO感知的多路复用提升解聚式LLM服务中的SLO达成率

Jinming Ma, Jiefei Chen, Xiuhong Li, Jiangfei Duan, Haojie Duanmu, Xingcheng Zhang, Chao Yang, Dahua Lin

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出Tropical系统,通过SLO感知的多路复用策略平衡排队时间和干扰,同时满足预填充和解码阶段的延迟约束,在真实数据集上相比现有系统提升高达2.09倍的请求数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12341 2026-06-11 cs.CR 新提交 89%

OCELOT: Inference-Leakage Budgets for Privacy-Preserving LLM Agents

OCELOT:面向隐私保护LLM代理的推理泄露预算

Jin Xie, Songze Li

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出OCELOT运行时中介,通过后验风险控制和证人验证降级机制,在代理轨迹中预算对手信念更新,平衡任务效用与隐私泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11700 2026-06-11 cs.IR 新提交 89%

CompRank: Efficient LLM Reranking via Token-Level Compression and Decoding-Free Scoring

CompRank: 通过令牌级压缩和无解码评分实现高效的LLM重排序

Xuan Lu, Haohang Huang, Yingqi Fan, Junlong Tong, Yuxuan Zhang, Ping Nie, Rui Meng, Xiaoyu Shen

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出CompRank框架,通过令牌级压缩和无解码注意力评分减少冗余计算,在BEIR数据集上仅保留10.2%文档令牌即达到接近全令牌的排序性能,并实现4.9-9.5倍端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11592 2026-06-11 cs.CR 新提交 89%

Defense Against Prompt Inversion Attacks: An Information-Theoretic Approach for LLM Collaborative Inference

对抗提示反转攻击:面向LLM协作推理的信息论方法

Sayedeh Leila Noorbakhsh, Hossein Khalili, Nader Sehatbakhsh

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出信息论防御框架,通过最小化中间激活与输入提示的互信息来学习隐私表示,实现隐私-效用-延迟权衡,攻击成功率降低35%。

Comments Preprint. 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10148 2026-06-10 cs.CR 新提交 89%

RadKey: An LLM-Guided RF Backscatter System for Through-Wall Keystroke Inference

RadKey: 一种基于LLM引导的RF反向散射系统用于穿墙击键推断

Qijun Wang, Chunqi Qian, Huacheng Zeng

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出RadKey系统,利用无源反向散射标签捕获击键振动和声音,通过RF信号远距离穿墙窃听,结合信号处理与LLM在线自适应,实现跨用户、跨键盘的准确击键推断。

Comments Accepted to the 47th IEEE Symposium on Security and Privacy (IEEE S&P), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09182 2026-06-09 cs.SE 新提交 89%

Understanding How Enterprises Adopt the Model Context Protocol for LLM-Driven Software Engineering

理解企业如何采用模型上下文协议进行基于LLM的软件工程

Kehui Chen, Yicheng Sun, Jacky Keung, Zhenyu Mao, Xiaoxue Ma

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 通过对20名从业者的访谈,研究企业采用模型上下文协议(MCP)的现状,发现MCP支持跨系统协作和任务解耦,但面临生态系统碎片化、协调困难等问题,并提出标准化和低代码等改进需求。

Comments 12pages, preliminary version accepted at the 26th International Conference on Quality, Reliability, and Security (QRS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08891 2026-06-09 cs.AR cs.ET 新提交 89%

PALUTE: Processing-In-Memory Acceleration via Lookup Table for Edge LLM Inference

PALUTE: 基于查找表的处理-内存加速用于边缘LLM推理

Runyang Tian, Yanru Chen, Weihong Xu, Tajana Šimunić Rosing

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出PALUTE,一种基于查找表的3D DRAM处理-内存加速器,通过垂直组织实现高并行度,降低面积开销,在0.16W功耗下达到1264 TPS吞吐量,能效比CHIME提升12.8倍。

Comments ISLPED 2026 IEEE/ACM International Symposium on Low Power Electronics and Design

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24615 2026-08-26 cs.CL 新提交 89%

Quantization Effects on Bangla Language Understanding in Large Language Models: A Systematic Evaluation

量化对大型语言模型孟加拉语理解能力的影响:一项系统评估

Ismail Hossain, Nafi Ullah Shafin, Mohammad Abdullah Al Mumin

机构 * Institute of Information and Communication Technology (IICT)(信息与通信技术研究所) Shahjalal University of Science and Technology (SUST)(沙赫贾拉勒科技大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 本研究首次系统评估了三种量化格式对Qwen-2.5-7B等三个模型家族在五个孟加拉语NLU基准上的影响,发现架构和量化方法比位宽更关键,量化可用于孟加拉语部署。

Comments 8 pages, 1 table, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21362 2026-08-25 cs.AI cs.DC 新提交 89%

KVBoost: Chunk-Level Key-Value Cache Reuse with Deviation-Guided Recomputation for Efficient Large Language Model Inference

KVBoost:用于高效大语言模型推理的、基于偏差引导重计算的分块级键值缓存复用方案

Srihari Unnikrishnan

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 KVBoost是适用于HuggingFace兼容解码器模型的分块级KV缓存复用系统,通过双哈希键方案与两类重计算策略等,在不损失准确率的前提下,将Qwen2.5-3B的首token生成时间缩短4.49倍,性能优于前缀缓存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26891 2026-07-30 cs.CL 新提交 89%

DIRECT: Direct Decoding for Efficient and Aligned Sequence Labeling with Large Language Models

DIRECT:基于大语言模型的高效对齐序列标注直接解码方法

Yilei Wang, Jiaxin Gan, Kexuan Zhang, Ling Li, Wentao Zhang, Peichao Lai

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 针对现有大语言模型序列标注方法的领域对齐不足与推理效率低问题,提出DIRECT框架,结合训练时优化与推理时校正,在8个数据集上实现性能与效率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20806 2026-07-24 cs.AI 新提交 89%

Profiling Lightweight Large Language Models

轻量级大语言模型剖析

Tomohiro Harada, Enrique Alba, Gabriel Luque

机构 * Graduate School of Science and Engineering, Saitama University(埼玉大学理工学研究科) ITIS, University of Malaga(马拉加大学信息技术与系统研究所)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究轻量级大语言模型在资源受限环境中的情况,提出基于PTME的实验框架,通过硬件级测量联合测量精度、时间、内存和能耗,对一组模型进行测试,发现代理描述符不足,揭示非主导配置,为不同资源下选模型提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10855 2026-07-14 cs.LG 新提交 89%

Reliability Scaling Laws for Quantized Large Language Models

量化大语言模型的可靠性缩放定律

Sirine Ayadi, Sándor Daróczi, Stephan Günnemann, Bertrand Charpentier

机构 * Technical University of Munich(慕尼黑工业大学) Munich Data Science Institute(慕尼黑数据科学研究所) Pruna AI(Pruna人工智能公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 研究量化大语言模型的可靠性缩放定律,通过对其不确定性、校准和鲁棒性进行全面评估,刻画可靠性与模型比特总数的关系,发现4比特量化模型有可靠性峰值,且量化增强了模型对自然输入扰动的鲁棒性。

Comments Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09713 2026-07-14 cs.AI cs.MA cs.RO 新提交 89%

Closed-Loop Control with Rule-Aligned Small Language Models and Multi-Agent Self-Correction

基于规则对齐的小语言模型和多智能体自我校正的闭环控制

Yuchen Wang, Javal Vyas, Tong Liu, Mehmet Mercangoz

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SLM(abstract);分类 cs.AI

AI总结 研究能否对紧凑型小语言模型再训练用于控制推理并嵌入验证器引导的校正循环,通过组相对策略优化对齐模型,结合多种智能体,在随机热控模拟中取得高准确率和低延迟,支持该架构用于边缘可重构自主控制。

Comments Accepted by IEEE CCTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09104 2026-07-13 cs.CV cs.AI 新提交 89%

Integrating Large Language Models and Graph Convolutional Networks for Semi-Supervised Image Classification

将大语言模型与图卷积网络集成用于半监督图像分类

Camila Piscioneri Magalhães, Lucas Pascotti Valem

机构 * Institute of Mathematics and Computer Science (ICMC)(数学与计算机科学研究所) University of São Paulo (USP)(圣保罗大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 针对图像分类中图构建难题,该研究将大语言模型与图卷积网络集成,利用视觉语言模型生成文本描述,经大语言模型处理得到语义相似性分数,指导kNN图边修剪,提升了半监督图像分类准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05055 2026-07-07 cs.AI 新提交 89%

Toward Trustworthy Large Language Model Agents in Healthcare

迈向医疗保健领域值得信赖的大语言模型智能体

Hadi Hasan, Safaa Salman, Adam Tai Abou Dargham, Ammar Mohanna, Ali Chehab

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 针对医疗预约调度瓶颈,提出CareConnect智能体,利用大语言模型函数调用等技术,协调工具支持预约操作,设安全护栏。经评估有高任务完成率、安全合规性及成本效益,能自动化复杂医疗工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04290 2026-07-07 cs.NI cs.AI 新提交 89%

Agentic-V2X: Small Language Model Agents for Deadline-Aware V2X Scheduling in 5G/6G Networks

Agentic-V2X:用于5G/6G网络中具有截止日期感知的V2X调度的小型语言模型代理

Gerasimos Papanikolaou-Ntais, Alexandros Kaloxylos, Athanasios Kanavos

机构 * Department of Informatics, University of Piraeus(比雷埃克斯大学信息学院) Department of Informatics and Telecommunications, University of Peloponnese(希腊佩拉索斯大学信息与电信学院)

专题命中 效率与部署 :language model(title,abstract);small language model(title);LLM(abstract);large language model(abstract)

AI总结 研究针对5G/6G网络中V2X调度,提出Agentic-V2X架构。小型本地部署语言模型生成策略,经验证后由轻量级控制器执行,评估多种策略,该架构能生成有效可执行策略,在多方面有竞争力,但非最佳。

Comments 20 pages 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02391 2026-07-03 cs.DC cs.LG 新提交 89%

WattGPU: Predicting Inference Power and Latency on Unseen GPUs and LLMs

WattGPU: 在未见过的GPU和LLM上预测推理功耗和延迟

Mauricio Fadel Argerich, Jonathan Fürst, Marta Patiño-Martínez

机构 * Universidad Politécnica de Madrid(马德里理工大学) Zurich University of Applied Sciences(苏黎世应用科学大学)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出WattGPU模型,利用公开的LLM元数据和GPU规格,无需硬件访问即可预测平均GPU功耗和令牌间延迟,在未见过的GPU和LLM上误差低至3.4%,优于基线方法。

Comments Accepted at 1st Workshop on Sustainability and Resource-Efficiency of Artificial Intelligence @ IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24077 2026-06-24 cs.CL 新提交 89%

Sentence-Level Contextual Entrainment in Large Language Models

大型语言模型中的句子级上下文嵌入

Yang Liu, Chenhui Chu

机构 * Kyoto University(京都大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 研究大型语言模型中句子级上下文嵌入现象,发现提示中的句子(包括反事实陈述)会显著增加其推理概率,且该现象随模型增大而减弱,通过关闭2%-4%的注意力头可缓解而不影响性能。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20590 2026-06-23 cs.NI cs.AI 新提交 89%

Optimization-as-a-Service via Multi-Agent Large Language Model for Radio Access Networks

通过多智能体大语言模型实现无线接入网的优化即服务

Chaoqun You, Yueyue Dai, Xingqiu He, Yue Gao, Rahim Tafazolli, Yong Liang Guan

机构 * Fudan University(复旦大学) Huazhong University of Science and Technology(华中科技大学) University of Surrey(Surrey大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 提出将物理资源块分配问题作为大语言模型多智能体系统提供的优化即服务,通过场景理解、目标生成、求解器和反思智能体实现上下文感知的自校正公式,并引入单次反思蒸馏机制降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14347 2026-06-15 cs.LG 新提交 89%

When Language Representations Interact: Separability and Cross-Lingual Effects in LLMs

当语言表示交互时:LLM中的可分离性与跨语言效应

Boris Marinov, Angira Sharma, Christian Schroeder de Witt, Philip Torr, Anisoara Calinescu, Jialin Yu

机构 * University of Oxford(牛津大学) Imperial College London(帝国理工学院) University of York(约克大学)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过因果几何分析,研究多语言LLM中语言表示的线性可分离性及跨语言结构依赖,发现语言概念在协方差调整内积下可分离,同语系语言呈现单纯形几何结构。

Comments Trustworthy AI for Good (AI4Good) Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18108 2026-08-20 cs.CL cs.AI cs.HC cs.MA 新提交 89%

Same Facts, Different Updates: Inference Setup Shapes LLM Behavior in Medical Allocation

相同事实,不同更新:推理设置塑造医疗分配场景下大语言模型的行为

Spencer Gibson, Tyler Crosse, Magnus Saebo, Achyutha Menon, Eyon Jang, Diogo Cruz

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现,在医疗资源分配场景中,大语言模型的推理设置会导致其对相同患者信息产生不同的资源分配概率,凸显了谨慎将LLM系统纳入决策的重要性。

Comments Accepted to the AI4GOOD Workshop at ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00501 2026-07-02 cs.CL cs.AI cs.PF 新提交 89%

BaseRT: Best-in-Class LLM Inference on Apple Silicon via Native Metal

BaseRT: 通过原生Metal在Apple Silicon上实现最佳LLM推理

Prabod Rathnayaka, Fabian Waschkowski, Lukas Wesemann

机构 * Base Compute, Melbourne, Australia(Base Compute,墨尔本,澳大利亚)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出基于原生Metal的推理运行时BaseRT,通过芯片特定内核融合、统一内存感知优化和自定义调度逻辑,在Apple Silicon上实现最高推理吞吐量,相比现有框架提升高达1.56倍解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏