arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22368 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22368 篇

2506.03296 2026-01-16 cs.DC 85%

APEX: Asynchronous Parallel CPU-GPU Execution for Online LLM Inference on Constrained GPUs

APEX:异步并行CPU-GPU执行用于受限GPU上的在线LLM推理

Jiakun Fan, Yanglin Zhang, Xiangchen Li, Dimitrios S. Nikolopoulos

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 APEX通过动态调度策略提升受限GPU上的LLM推理效率,提高吞吐量并保持延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15553 2026-01-15 cs.DC 85%

Efficient Routing of Inference Requests across LLM Instances in Cloud-Edge Computing

在云边计算环境中高效路由推理请求跨LLM实例

Shibo Yu, Mohammad Goudarzi, Adel Nadjaran Toosi

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于NSGA-II的路由算法,用于在云边计算环境中高效分配LLM推理请求,提升响应质量并降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24124 2026-01-13 cs.LG cs.AI cs.CL 85%

OptRot: Mitigating Weight Outliers via Data-Free Rotations for Post-Training Quantization

OptRot: 通过数据无关旋转缓解权重异常以实现训练后量化

Advait Gadhikar, Riccardo Grazzi, James Hensman

机构 * CISPA Helmholtz Center for Information Security, Germany(CISPA信息安全研究中心) Microsoft Research, Cambridge, UK(微软研究院)

专题命中 效率与部署 :post-training(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OptRot通过数据无关旋转技术提升训练后量化效果,优于现有方法并改进激活量化性能。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21199 2026-01-13 cs.CV eess.SP 85%

MedPrompt: LLM-CNN Fusion with Weight Routing for Medical Image Segmentation and Classification

MedPrompt: 基于权重路由的LLM-CNN融合用于医学图像分割与分类

Shadman Sobhan, Kazi Abrar Mahmud, Abduz Zami

机构 * 1 ,2 Department of Electrical Electronic Engineering,\ University of Engineering 3Department of Computer Science \& Engineering,\ University of Engineering \& Technology, Rajshahi-6204, Bangladesh

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 MedPrompt结合LLM和CNN实现医学图像分割与分类,通过权重路由提高可扩展性,实现高准确率和低延迟的实时应用。

Comments 40 pages, 8 Tables, 9 Figures

Journal ref Published at Biomedical Signal Processing and Control Volume 113, Part D, March 2026, 109251

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09713 2026-01-12 cs.SE 85%

A First Look at Bugs in LLM Inference Engines

对LLM推理引擎中bug的首次审视

Mugeng Liu, Siqi Zhong, Weichen Bi, Yixuan Zhang, Zhiyang Chen, Zhenpeng Chen, Xuanzhe Liu, Yun Ma

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文首次对LLM推理引擎中的bug进行实证研究,揭示了六种bug症状类型和28种根本原因,为研究人员和开发者提供了改进bug检测与修复的指导。

Comments Accepted by ACM Transactions on Software Engineering and Methodology

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02512 2026-01-07 cs.SE 85%

Green LLM Techniques in Action: How Effective Are Existing Techniques for Improving the Energy Efficiency of LLM-Based Applications in Industry?

绿色大语言模型技术实践:现有技术在工业中提升大语言模型应用能效的有效性如何?

Pelin Rabia Kuran, Rumbidzai Chitakunye, Vincenzo Stoico, Ilja Heitlager, Justus Bogner

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文评估了四种技术在工业应用中提升大语言模型能效的有效性,发现提示优化和量化可显著降低能耗,但会损害准确性,而小模型与大模型协作在不显著影响其他指标的情况下实现了显著节能。

Comments Accepted for publication at the 2026 International Conference on Software Engineering: Software Engineering in Practice (ICSE-SEIP'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09510 2026-01-07 cs.LG cs.AI cs.CL 85%

Communication Compression for Tensor Parallel LLM Inference

张量并行大语言模型推断中的通信压缩

Jan Hansen-Palmus, Michael Truong Le, Oliver Hausdörfer, Alok Verma

机构 * Recogni Technical University of Munich(慕尼黑技术大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过压缩加速器间通信来减少张量并行大语言模型推断的延迟,实现TTFT减少2倍且性能损失可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02021 2026-01-06 cs.NI 85%

AgentVNE: LLM-Augmented Graph Reinforcement Learning for Affinity-Aware Multi-Agent Placement in Edge Agentic AI

AgentVNE: 基于大语言模型的图强化学习用于面向亲和力的多智能体部署

Runze Zheng, Yuqing Zheng, Zhengyi Cheng, Long Luo, Haoxiang Luo, Gang Sun, Hongfang Yu, Dusit Niyato

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 AgentVNE通过结合大语言模型与图强化学习,解决边缘智能体部署中的动态资源分配与亲和力约束问题,提升服务效率与响应速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21408 2026-01-06 cs.CV 85%

VALLR: Visual ASR Language Model for Lip Reading

VALLR:基于唇语的视觉ASR语言模型

Marshall Thomas, Edward Fish, Richard Bowden

机构 * University of Surrey(萨里大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 VALLR提出了一种两阶段的视觉ASR语言模型,通过音素序列预测和语言模型重构实现高效率和高精度的唇语识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16037 2026-01-05 cs.AI cs.CL cs.LG math.OC stat.ML 85%

Causal LLM Routing: End-to-End Regret Minimization from Observational Data

因果大语言模型路由:从观测数据实现端到端的遗憾最小化

Asterios Tsiourvas, Wei Sun, Georgia Perakis

机构 * MIT(麻省理工学院) IBM Research(IBM研究院)

专题命中 效率与部署 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于因果推理的端到端框架,通过最小化决策遗憾从观测数据中学习大语言模型路由策略,实现高效优化和异质成本偏好的处理,实验显示优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04677 2026-01-05 cs.DS 85%

LLM Query Scheduling with Prefix Reuse and Latency Constraints

基于前缀重用和延迟约束的LLM查询调度

Gregory Dexter, Shao Tang, Ata Fatahi Baarzi, Qingquan Song, Tejas Dharamsi, Aman Gupta

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出k-LPM算法,通过平衡前缀重用与公平性,改进LLM查询调度的TTFT性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24750 2026-01-01 cs.NI 85%

Analyzing Communication Predictability in LLM Training

分析在LLM训练中的通信可预测性

Wenxue Li, Xiangzhou Liu, Yuxuan Li, Yilun Jin, Zhenghang Ren, Xudong Liao, Han Tian, Bo Ren, Zhizhen Zhong, Guyue Liu, Ying Zhang, Kai Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究系统分析了LLM训练中的通信可预测性,提出ConfigTuner工具,通过优化配置提升了训练吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22925 2025-12-30 cs.DC 85%

Argus: Token Aware Distributed LLM Inference Optimization

Argus:基于令牌的分布式大语言模型推理优化

Panlong Wu, Yifei Zhong, Danyang Chen, Ting Wang, Fangxin Wang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Argus是一种基于令牌的分布式大语言模型推理优化框架,通过长度感知语义模块和Lyapunov引导卸载优化模块,实现高效的任务卸载和动态异构环境下的高效率推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12018 2025-12-30 cs.CL cs.AI cs.LG 85%

Atom of Thoughts for Markov LLM Test-Time Scaling

思想原子用于马尔可夫LLM测试时间扩展

Fengwei Teng, Quan Shi, Zhaoyang Yu, Jiayi Zhang, Yuyu Luo, Chenglin Wu, Zhijiang Guo

机构 * HKUST(GZ)(香港科技大学(广州)) DeepWisdom(DeepWisdom公司) Renmin University of China(中国人民大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出思想原子(\our),通过马尔可夫链结构与树搜索等技术结合,实现高效推理,提升LLM测试时间扩展性能。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05347 2025-12-29 cs.NI 85%

A Queueing Theoretic Perspective on Low-Latency LLM Inference with Variable Token Length

从排队论角度探讨具有可变令牌长度的低延迟LLM推理

Yuqing Yang, Yuedong Xu, Lei Jiao

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文从排队论角度研究了LLM推理中可变令牌长度对低延迟的影响,提出数学模型优化最大令牌限制并分析不同批量策略的排队延迟。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21144 2025-12-25 cs.NI 85%

Encrypted Traffic Detection in Resource Constrained IoT Networks: A Diffusion Model and LLM Integrated Framework

资源受限物联网网络中加密流量检测:扩散模型与大语言模型集成框架

Hongjuan Li, Hui Kang, Chenbang Liu, Ruolin Wang, Jiahui Li, Geng Sun, Jiacheng Wang, Shuang Liang, Shiwen Mao

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 DMLITE通过结合扩散模型和大语言模型,有效提升资源受限物联网网络中加密流量检测的准确率和效率。

Comments This paper is accepted by IEEE Transactions on Network Science and Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20550 2025-12-24 cs.GR 85%

LLM-Based Authoring of Agent-Based Narratives through Scene Descriptions

基于大语言模型的通过场景描述生成基于代理的叙事

Vinayak Regmi, Christos Mousas

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于大语言模型生成基于代理的叙事的系统,通过场景描述自动生成代理行为并支持动态交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19004 2025-12-23 cs.CL cs.AI cs.LG 85%

Context-Aware Initialization for Reducing Generative Path Length in Diffusion Language Models

基于上下文的初始化以减少扩散语言模型中的生成路径长度

Tongyuan Miao, Gary Huang, Kai Jun Han, Annie Jiang

机构 * University of Michigan(密歇根大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于上下文的初始化方法,通过注入提示条件先验来减少扩散语言模型生成路径长度,提升解码效率并解决预热启动的准确性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18910 2025-12-23 cs.CV 85%

Delta-LLaVA: Base-then-Specialize Alignment for Token-Efficient Vision-Language Models

Delta-LLaVA: 基于令牌效率的视觉-语言模型对齐方法

Mohamad Zamini, Diksha Shukla

机构 * University of Wyoming(怀俄明大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);pretraining(abstract)

AI总结 Delta-LLaVA通过低秩Delta投影和轻量级Transformer块实现视觉-语言模型的高效对齐,提升推理速度和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04146 2025-12-16 cs.LG cs.AI cs.CL 85%

Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models

超越单个令牌预测:扩散模型与自回归语言模型性能的对比分析

Minseo Kim, Coleman Hooper, Aditya Tomar, Chenfeng Xu, Mehrdad Farajtabar, Michael W. Mahoney, Kurt Keutzer, Amir Gholami

机构 * Seoul National University(首尔国立大学) University of California, Berkeley(加州大学伯克利分校) ICSI LBNL(劳伦斯伯克利国家实验室) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文比较了扩散模型与自回归语言模型在性能上的差异,发现DLMs在算术强度上占优但难以扩展,而ARMs在批量推理中表现更优。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12801 2025-12-16 cs.DC cs.PF 85%

Fine-Grained Energy Prediction For Parallellized LLM Inference With PIE-P

细粒度并行LLM推理中的能量预测方法PIE-P

Anurag Dutt, Young Won Choi, Avirup Sil, Anshul Gandhi, Aruna Balasubramanian, Niranjan Balasubramanian

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 PIE-P是一种针对多GPU并行LLM推理的细粒度能耗预测框架,通过精确建模和采样解决通信非确定性和开销问题,实现高精度能耗预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12279 2025-12-16 eess.SP 85%

WATOS: Efficient LLM Training Strategies and Architecture Co-exploration for Wafer-scale Chip

WATOS: 为晶圆级芯片高效LLM训练策略和架构共探索

Huizheng Wang, Zichuan Wang, Hongbin Wang, Jingxiang Hou, Taiquan Wei, Chao Li, Yang Hu, Shouyi Yin

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 WATOS通过高效训练策略和晶圆级架构共探索,提升了LLM训练性能,实现平均吞吐量提升2.74倍。

Comments Accepted by HPCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11550 2025-12-15 cs.AR 85%

PD-Swap: Prefill-Decode Logic Swapping for End-to-End LLM Inference on Edge FPGAs via Dynamic Partial Reconfiguration

PD-Swap:通过动态部分重新配置实现端到端LLM推理的边缘FPGA预填解码逻辑交换

Yifan Zhang, Zhiheng Chen, Ye Qiao, Sitao Huang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 PD-Swap通过动态部分重新配置实现边缘FPGA上LLM推理的预填解码逻辑分离,提升吞吐量并优化资源利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11221 2025-12-15 cs.LG cs.AI cs.CL 85%

Adaptive Soft Rolling KV Freeze with Entropy-Guided Recovery: Sublinear Memory Growth for Efficient LLM Inference

自适应软滚动KV冻结与熵引导恢复:用于高效大语言模型推理的亚线性内存增长

Adilet Metinov, Gulida M. Kudakeeva, Bolotbek uulu Nursultan, Gulnara D. Kabaeva

机构 * Institute of Information Technology(信息技术研究所) Kyrgyz State Technical University named after I. Razzakov(伊·拉扎科夫命名的吉尔吉斯斯坦技术大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ASR-KF-EGR通过自适应软冻结与熵引导恢复,实现高效大语言模型推理的亚线性内存增长,减少KV缓存占用同时保持生成质量。

Comments 6 pages, 3 tables , 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08476 2025-12-10 cs.RO 85%

A Multi-Agent LLM Framework for Design Space Exploration in Autonomous Driving Systems

多智能体大语言模型框架用于自动驾驶系统的设计空间探索

Po-An Shih, Shao-Hua Wang, Yung-Che Li, Chia-Heng Tu, Chih-Han Chang

机构 * National Cheng Kung University(国立成功大学) Safeware Technology Inc.(Safeware技术公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于多智能体大语言模型的自动驾驶系统设计空间探索框架,通过多模态推理和3D模拟工具自动化解析执行输出,提升设计效率和成本效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16653 2025-12-09 cs.PF 85%

H2EAL: Hybrid-Bonding Architecture with Hybrid Sparse Attention for Efficient Long-Context LLM Inference

H2EAL:混合键值缓存架构与混合稀疏注意力机制用于高效长上下文LLM推理

Zizhuo Fu, Xiaotian Guo, Wenxuan Zeng, Shuzhang Zhong, Yadong Zhang, Peiyu Chen, Runsheng Wang, Le Ye, Meng Li

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 H2EAL通过混合稀疏注意力算法与硬件联合设计,实现高效边缘LLM推理,提升速度和能效,精度损失极小。

Comments International Conference on Computer-Aided Design (ICCAD) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04088 2025-12-05 cs.DC 85%

Toward Sustainability-Aware LLM Inference on Edge Clusters

迈向可持续的边缘集群大语言模型推理

Kolichala Rajashekar, Nafiseh Sharghivand, Radu Prodan, Reza Farahani

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种针对边缘集群的可持续大语言模型推理方法,通过碳和延迟感知的路由策略平衡推理延迟和碳足迹。

Comments 4 pages, 5 figures, 3 tables, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03644 2025-12-04 cs.DC 85%

FFTrainer: Fast Failover in Large-Language Model Training with Almost-Free State Management

FFTrainer: 大语言模型训练中的近免费状态管理快速故障转移

Bohan Zhao, Yuanhong Wang, Chenglin Liu, Jiagi Pan, Guang Yang, Ruitao Liu, Tingrui Zhang, Kai Luo, Wei Xu

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 FFTrainer通过利用多余网络容量实现快速故障转移,显著减少恢复时间和GPU利用率损失,提升大语言模型训练的效率和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03237 2025-12-04 cs.CV cs.GR 85%

LLM-Guided Material Inference for 3D Point Clouds

基于大语言模型的3D点云材料推断

Nafiseh Izadyar, Teseo Schneider

机构 * University of Victoria(维多利亚大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于大语言模型的3D点云材料推断方法,通过两阶段推理实现材料属性推断,验证了语言模型在连接几何推理与材料理解中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02895 2025-12-04 cs.CV 85%

MindGPT-4ov: An Enhanced MLLM via a Multi-Stage Post-Training Paradigm

MindGPT-4ov: 一种通过多阶段训练范式增强的多模态大语言模型

Wei Chen, Chaoqun Du, Feng Gu, Wei He, Qizhen Li, Zide Liu, Xuhao Pan, Chang Ren, Xudong Rao, Chenfeng Wang, Tao Wei, Chengjun Yu, Pengfei Yu, Yufei Zheng, Chunpeng Zhou, Pan Zhou, Xuhan Zhu

机构 * MindGPT-4o Team(MindGPT-4o 团队) Li Auto Inc.(利汽车公司)

专题命中 效率与部署 :post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 MindGPT-4ov通过多阶段训练范式提升多模态大语言模型的性能与泛化能力,实现低成本高效率的训练与部署。

Comments 33 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏