arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22368 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22368 篇

2602.12151 2026-02-13 cs.DC 85%

OServe: Accelerating LLM Serving via Spatial-Temporal Workload Orchestration

OServe: 通过空间-时间工作负载编排加速大语言模型服务

Youhe Jiang, Fangcheng Fu, Taiyi Wang, Guoliang He, Eiko Yoneki

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 OServe通过空间-时间工作负载编排优化大语言模型服务,提升性能2倍

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11521 2026-02-13 cs.AR cs.DC 85%

PAM: Processing Across Memory Hierarchy for Efficient KV-centric LLM Serving System

PAM:跨内存层次处理的高效键值中心LLM服务系统

Lian Liu, Shixin Zhao, Yutian Zhou, Yintao He, Mengdi Wang, Yinhe Han, Ying Wang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 PAM通过跨内存层次处理,优化键值中心LLM服务系统的带宽与容量,提升效率和可扩展性。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10729 2026-02-12 cs.DC 85%

BOute: Cost-Efficient LLM Serving with Heterogeneous LLMs and GPUs via Multi-Objective Bayesian Optimization

BOute: 通过多目标贝叶斯优化实现高效的LLM服务

Youhe Jiang, Fangcheng Fu, Eiko Yoneki

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 BOute通过多目标贝叶斯优化实现高效LLM服务,优化路由和部署策略以提升成本效率。

Comments MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10329 2026-02-12 cs.CL cs.AI cs.LG 85%

Are More Tokens Rational? Inference-Time Scaling in Language Models as Adaptive Resource Rationality

更多令牌是否理性?语言模型推理时的扩展作为适应性资源理性

Zhimin Hu, Riya Roshan, Sashank Varma

机构 * Georgia Tech(佐治亚理工学院)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过变量归因任务探讨语言模型在推理时扩展对资源理性的影响,发现模型能根据任务复杂性调整策略,即使无显式成本奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21204 2026-02-12 cs.CL cs.AI cs.LG 85%

Scaling Embeddings Outperforms Scaling Experts in Language Models

嵌入式扩展优于专家扩展在语言模型中

Hong Liu, Jiaqi Zhang, Chao Wang, Xing Hu, Linkun Lyu, Jiaqi Sun, Xurui Yang, Bo Wang, Fengcun Li, Yulei Qian, Lingtong Si, Yerui Sun, Rumei Li, Peng Pei, Yuchen Xie, Xunliang Cai

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出通过嵌入式扩展而非专家扩展来提升语言模型的稀疏性,展示了LongCat-Flash-Lite在推理速度上的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05413 2026-02-10 cs.OS 85%

Flare: Anomaly Diagnostics for Divergent LLM Training in GPU Clusters of Thousand-Plus Scale

Flare:用于千级规模GPU集群中发散式LLM训练的异常诊断

Weihao Cui, Ji Zhang, Han Zhao, Chao Liu, Jian Sha, Bingsheng He, Minyi Guo, Quan Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Flare是一种用于千级规模GPU集群中大规模分布式LLM训练的异常诊断框架,通过轻量级跟踪守护进程和自动诊断引擎提升异常检测与性能退化分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07899 2026-02-10 cs.CV 85%

Rethinking Practical and Efficient Quantization Calibration for Vision-Language Models

重新思考视觉-语言模型的实用且高效的量化校准

Zhenhao Shang, Haizhao Jing, Guoting Wei, Haokui Zhang, Rong Xiao, Jianqing Gao, Peng Wang

机构 * Northwestern Polytechnical University, Xi'an, China(西北工业大学,西安,中国) Nanjing University of Science and Technology, Nanjing, China(南京理工大学,南京,中国)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);post-training(abstract)

AI总结 TLQ通过标记级重要性整合和多GPU层级校准,提升视觉-语言模型的量化稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14489 2026-02-10 cs.OS 85%

Towards High-Goodput LLM Serving with Prefill-decode Multiplexing

面向高吞吐量LLM服务的预填解码多路复用

Yukang Chen, Weihao Cui, Han Zhao, Ziyi Xu, Xiaoze Fan, Xusheng Chen, Yangjie Zhou, Shixuan Sun, Bingsheng He, Quan Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 MuxWise通过引入GPU内预填解码多路复用范式,实现了LLM服务在满足SLO要求的同时提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04278 2026-02-05 cs.IR 85%

MiniRec: Data-Efficient Reinforcement Learning for LLM-based Recommendation

MiniRec: 用于基于大语言模型推荐系统的高效强化学习

Lin Wang, Yang Zhang, Jingfan Chen, Xiaoyan Zhao, Fengbin Zhu, Qing Li, Tat-Seng Chua

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 MiniRec通过奖励对齐和轨迹导向的数据选择方法,有效降低基于LLM的推荐系统训练成本,同时保持高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17360 2026-02-04 cs.DC 85%

Cortex: Achieving Low-Latency, Cost-Efficient Remote Data Access For LLM via Semantic-Aware Knowledge Caching

Cortex: 通过语义感知的知识缓存实现低延迟、低成本的远程数据访问用于大语言模型

Chaoyi Ruan, Chao Bi, Kaiwen Zheng, Ziji Shi, Xinyi Wan, Jialin Li

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Cortex通过语义感知的知识缓存架构,实现LLM代理在远程数据访问中的低延迟和低成本,提升吞吐量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03422 2026-02-04 cs.IR 85%

RankSteer: Activation Steering for Pointwise LLM Ranking

RankSteer: 激活引导用于点wise LLM 排序

Yumeng Wang, Catherine Chen, Suzan Verberne

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 RankSteer 通过激活引导框架提升零样本点wise LLM 排序性能,利用三个解耦方向校准排序行为,无需修改模型权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01792 2026-02-03 cs.DC 85%

Efficient LLM Inference with Activation Checkpointing and Hybrid Caching

高效LLM推理与混合缓存激活检查点

Sanghyeon Lee, Hongbeen Kim, Soojin Hwang, Guseul Heo, Minwoo Noh, Jaehyuk Huh

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 HybridServe通过激活检查点和混合缓存方案,实现高效LLM推理,提升吞吐量2.19倍。

Comments 14 pages, 15 figures

Journal ref The 43rd IEEE International Conference on Computer Design, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00715 2026-02-03 cs.SE 85%

Beyond Basic Specifications? A Systematic Study of Logical Constructs in LLM-based Specification Generation

超越基本规范?基于LLM的规范生成中逻辑构造的系统研究

Zehan Chen, Long Zhang, Zhiwei Zhang, JingJing Zhang, Ruoyu Zhou, Yulong Shen, JianFeng Ma, Lin Yang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了基于LLM的规范生成中逻辑构造的应用,通过实验证明LLMs能生成有效逻辑构造,并提升验证能力与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00632 2026-02-03 cs.IR 85%

Towards Sample-Efficient and Stable Reinforcement Learning for LLM-based Recommendation

面向LLM推荐的高效稳定强化学习

Hongxun Ding, Keqin Bao, Jizhi Zhang, Yi Fang, Wenxin Xu, Fuli Feng, Xiangnan He

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出RISER框架,通过强化学习提升LLM推荐的效率和稳定性,有效解决样本效率低和训练不稳定问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22996 2026-02-02 cs.DS 85%

Competitive Non-Clairvoyant KV-Cache Scheduling for LLM Inference

竞争性非clairvoyant KV缓存调度用于LLM推理

Yiding Feng, Zonghan Yang, Yuhao Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出非clairvoyant的几何切片算法(GSA)和clairvoyant的几何批处理算法(GBA),在LLM推理中实现首个常数竞争比,显著提升性能界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22791 2026-02-02 cs.SE 85%

Understanding on the Edge: LLM-generated Boundary Test Explanations

对边界的理解:LLM生成的边界测试解释

Sabinakhon Akbarova, Felix Dobslaw, Robert Feldt

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究LLM生成的边界解释在软件测试中的有效性,通过调查和访谈发现,清晰结构、权威来源引用和可操作示例能提升解释质量,提出七项要求的检查表以指导未来工具设计。

Comments This is the author's accepted manuscript of a paper accepted for publication at AST 2026. The final version will appear in the ACM Digital Library

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18220 2026-02-02 cs.SD eess.AS 85%

LLM-ForcedAligner: A Non-Autoregressive and Accurate LLM-Based Forced Aligner for Multilingual and Long-Form Speech

LLM-ForcedAligner: 一种非自回归且准确的基于大语言模型的强制对齐器,适用于多语言和长文本语音

Bingshen Mu, Xian Shi, Xiong Wang, Hexin Liu, Jin Xu, Lei Xie

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 LLM-ForcedAligner通过非自回归方法实现多语言和长文本语音的准确强制对齐,显著减少时间偏移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20755 2026-01-30 cs.SE 85%

ProfInfer: An eBPF-based Fine-Grained LLM Inference Profiler

ProfInfer: 基于eBPF的细粒度LLM推理分析器

Bohua Zou, Debayan Roy, Dhimankumar Yogesh Airao, Weihao Xu, Binqi Sun, Yutao Liu, Haibo Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 ProfInfer基于eBPF技术,为LLM推理引擎提供细粒度性能分析,通过动态探针实现非侵入式监控,帮助优化调度和资源管理。

Comments Accepted in the 9th Annual Conference on Machine Learning and Systems (MLSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20802 2026-01-30 eess.AS cs.SD 85%

SPADE: Structured Pruning and Adaptive Distillation for Efficient LLM-TTS

SPADE:结构剪枝与自适应知识蒸馏用于高效的LLM-TTS

Tan Dat Nguyen, Jaehun Kim, Ji-Hoon Kim, Shukjae Choi, Youshin Lim, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) dot Inc.(42dot公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 SPADE通过结构剪枝和自适应知识蒸馏,实现高效LLM-TTS模型,减半Transformer深度并提升实时生成速度,同时保持高质量语音输出。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19260 2026-01-28 cs.SE 85%

"ENERGY STAR" LLM-Enabled Software Engineering Tools

ENERGY STAR LLM赋能的软件工程工具

Himon Thakur, Armin Moin

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究LLM赋能的软件工程工具的能效,通过结合RAG与PETs提升代码生成的质量和效率,验证核心理念并提供未来分析的证明。

Comments CAIN 2026 - 5th International Conference on AI Engineering - Software Engineering for AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21313 2026-01-28 cs.IR 85%

Towards On-Device Personalization: Cloud-device Collaborative Data Augmentation for Efficient On-device Language Model

面向设备端个性化:云-设备协同数据增强用于高效设备端语言模型

Zhaofeng Zhong, Wei Yuan, Liang Qu, Tong Chen, Hao Wang, Xiangyu Zhao, Hongzhi Yin

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 提出CDCDA-PLM框架,通过云-设备协同数据增强实现高效设备端个性化语言模型部署,解决数据稀缺和网络依赖问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16495 2026-01-27 cs.DC 85%

Shift Parallelism: Low-Latency, High-Throughput LLM Inference for Dynamic Workloads

Shift Parallelism:低延迟、高吞吐量的LLM推理用于动态工作负载

Mert Hidayetoglu, Aurick Qiao, Michael Wyatt, Jeff Rasley, Yuxiong He, Samyam Rajbhandari

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Shift Parallelism通过结合张量并行和序列并行,实现动态工作负载下的低延迟和高吞吐量LLM推理。

Comments Revised

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17902 2026-01-27 cs.SD eess.AS 85%

dLLM-ASR: A Faster Diffusion LLM-based Framework for Speech Recognition

dLLM-ASR:一种更高效的基于扩散大语言模型的语音识别框架

Wenjie Tian, Bingshen Mu, Guobin Ma, Xuelong Geng, Zhixian Zhao, Lei Xie

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 dLLM-ASR通过将扩散大语言模型的解码过程转化为先验引导的去噪流程,实现高效的语音识别,达到与自回归模型相当的准确率并提升4.44倍推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17818 2026-01-27 cs.CV 85%

ViTCoP: Accelerating Large Vision-Language Models via Visual and Textual Semantic Collaborative Pruning

ViTCoP: 通过视觉和文本语义协同剪枝加速大型视觉-语言模型

Wen Luo, Peng Chen, Xiaotao Huang, LiQun Huang

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 ViTCoP通过结合视觉和文本语义协同剪枝,有效降低大型视觉-语言模型的计算成本,提升推理效率和内存利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15528 2026-01-23 cs.DC cs.CR 85%

Securing LLM-as-a-Service for Small Businesses: An Industry Case Study of a Distributed Chatbot Deployment Platform

为中小企业保障LLM即服务的安全性:一个分布式聊天机器人部署平台的行业案例研究

Jiazhu Xie, Bowen Li, Heyu Fu, Chong Gao, Ziqi Xu, Fengling Han

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一个开源多租户平台,帮助中小企业低成本安全部署定制LLM聊天机器人,通过分布式集群和加密网络实现资源池化与隔离,同时集成防提示注入攻击机制。

Comments Accepted by AISC 2026

Journal ref Australasian Information Security Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07526 2026-01-23 cs.SD cs.AI cs.CL cs.LG 85%

Competitive Audio-Language Models with Data-Efficient Single-Stage Training on Public Data

竞争性音频-语言模型:基于公共数据的高效单阶段训练

Gokul Karthik Kumar, Rishabh Saraf, Ludovick Lepauloux, Abdul Muneer, Billel Mokeddem, Hakim Hacid

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Falcon3-Audio基于少量公共数据实现高效单阶段训练,其1B模型在MMAU基准测试中表现优异,优于其他大型模型。

Comments Accepted at ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15287 2026-01-22 cs.CV 85%

Towards Understanding Best Practices for Quantization of Vision-Language Models

朝着理解视觉-语言模型量化最佳实践

Gautom Das, Vincent La, Ethan Lau, Abhinav Shrivastava, Matthew Gwilliam

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本研究探讨了视觉-语言模型量化方法对多模态流水线性能的影响,发现LLM低位量化在减少bpw时仍保持高精度,为高效部署MLLMs提供实践指导。

Comments 15 pages, 12 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11546 2026-01-21 cs.DB 85%

RelServe: Fast LLM Inference Serving on Relational Data

RelServe: 在关系数据上实现快速大语言模型推理服务

Xin Zhang, Shihong Gao, Yanyan Shen, Haoyang Li, Lei Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 RelServe通过动态优先级更新和自适应批处理优化,显著提升了关系数据查询的LLM推理效率,降低了延迟。

Comments Paper Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11464 2026-01-19 cs.CV cs.AI cs.CL cs.LG 85%

MHA2MLA-VLM: Enabling DeepSeek's Economical Multi-Head Latent Attention across Vision-Language Models

MHA2MLA-VLM: 使DeepSeek的经济型多头潜在注意力在视觉-语言模型中生效

Xiaoran Fan, Zhichao Sun, Tao Ji, Lixing Shen, Tao Gui

机构 * DeepSeek

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MHA2MLA-VLM通过参数高效的方法将现有视觉-语言模型转换为多头潜在注意力架构,减少缓存足迹并提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10953 2026-01-19 cs.AR 85%

SwiftKV: An Edge-Oriented Attention Algorithm and Multi-Head Accelerator for Fast, Efficient LLM Decoding

SwiftKV:一种面向边界的注意力算法和多头加速器,用于快速高效的LLM解码

Junming Zhang, Qinyan Zhang, Huajun Sun, Feiyang Gao, Sheng Hu, Rui Nie, Xiangshui Miao

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 SwiftKV提出了一种面向边界的注意力算法和多头加速器,通过高效流水线化和统一处理实现快速高效的LLM解码,显著提升性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏