arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22405 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22405 篇

2311.03687 2023-12-04 cs.PF cs.CL cs.LG 90%

Dissecting the Runtime Performance of the Training, Fine-tuning, and Inference of Large Language Models

Longteng Zhang, Xiang Liu, Zeyu Li, Xinglin Pan, Peijie Dong, Ruibo Fan, Rui Guo, Xin Wang, Qiong Luo, Shaohuai Shi, Xiaowen Chu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15566 2023-11-28 cs.DC cs.CL cs.LG 90%

SpotServe: Serving Generative Large Language Models on Preemptible Instances

Xupeng Miao, Chunan Shi, Jiangfei Duan, Xiaoli Xi, Dahua Lin, Bin Cui, Zhihao Jia

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments ASPLOS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08692 2023-11-16 cs.CL cs.LG 90%

Routing to the Expert: Efficient Reward-guided Ensemble of Large Language Models

Keming Lu, Hongyi Yuan, Runji Lin, Junyang Lin, Zheng Yuan, Chang Zhou, Jingren Zhou

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01786 2023-11-06 cs.CL cs.AI 90%

TCM-GPT: Efficient Pre-training of Large Language Models for Domain Adaptation in Traditional Chinese Medicine

Guoxing Yang, Jianyu Shi, Zan Wang, Xiaohong Liu, Guangyu Wang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14152 2023-10-31 cs.LG cs.AI 90%

Memory-Efficient Fine-Tuning of Compressed Large Language Models via sub-4-bit Integer Quantization

Jeonghoon Kim, Jung Hyun Lee, Sungdong Kim, Joonsuk Park, Kang Min Yoo, Se Jung Kwon, Dongsoo Lee

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Comments Published at NeurIPS 2023. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13012 2023-10-24 cs.CL cs.AI 90%

H2O Open Ecosystem for State-of-the-art Large Language Models

Arno Candel, Jon McKinney, Philipp Singer, Pascal Pfeiffer, Maximilian Jeblick, Chun Ming Lee, Marcos V. Conde

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2023 Demo - ACL Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04564 2023-10-10 cs.LG cs.AI 90%

ReLU Strikes Back: Exploiting Activation Sparsity in Large Language Models

Iman Mirzadeh, Keivan Alizadeh, Sachin Mehta, Carlo C Del Mundo, Oncel Tuzel, Golnoosh Samei, Mohammad Rastegari, Mehrdad Farajtabar

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.11042 2023-09-21 cs.CL cs.AI 90%

Making Small Language Models Better Multi-task Learners with Mixture-of-Task-Adapters

Yukang Xie, Chengyu Wang, Junbing Yan, Jiyong Zhou, Feiqi Deng, Jun Huang

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.00964 2023-09-15 cs.LG cs.AI 90%

eDKM: An Efficient and Accurate Train-time Weight Clustering for Large Language Models

Minsik Cho, Keivan A. Vahid, Qichen Fu, Saurabh Adya, Carlo C Del Mundo, Mohammad Rastegari, Devang Naik, Peter Zatloukal

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04646 2023-09-12 cs.CL cs.AI 90%

Efficient Finetuning Large Language Models For Vietnamese Chatbot

Vu-Thuan Doan, Quoc-Truong Truong, Duc-Vu Nguyen, Vinh-Tiep Nguyen, Thuy-Ngan Nguyen Luu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

Comments arXiv admin note: text overlap with arXiv:2304.08177, arXiv:2303.16199 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.13067 2023-08-28 cs.AI cs.CL 90%

Causal Parrots: Large Language Models May Talk Causality But Are Not Causal

Matej Zečević, Moritz Willig, Devendra Singh Dhami, Kristian Kersting

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Published in Transactions in Machine Learning Research (TMLR) (08/2023). Main paper: 17 pages, References: 3 pages, Appendix: 7 pages. Figures: 5 main, 3 appendix. Tables: 3 main

Journal ref Transactions in Machine Learning Research (08/2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08072 2023-07-27 cs.CL cs.AI 90%

Do Emergent Abilities Exist in Quantized Large Language Models: An Empirical Study

Peiyu Liu, Zikang Liu, Ze-Feng Gao, Dawei Gao, Wayne Xin Zhao, Yaliang Li, Bolin Ding, Ji-Rong Wen

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);small language model(abstract);分类 cs.CL、cs.AI

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07171 2023-07-17 cs.CL cs.LG 90%

Certified Robustness for Large Language Models with Self-Denoising

Zhen Zhang, Guanhua Zhang, Bairu Hou, Wenqi Fan, Qing Li, Sijia Liu, Yang Zhang, Shiyu Chang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07402 2023-06-14 cs.CL cs.AI 90%

The economic trade-offs of large language models: A case study

Kristen Howell, Gwen Christian, Pavel Fomitchov, Gitit Kehat, Julianne Marzulla, Leanne Rolston, Jadin Tredup, Ilana Zimmerman, Ethan Selfridge, Joseph Bradley

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Paper to be published at the Association for Computational Linguistics in the Industry Track 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06865 2023-06-13 cs.LG cs.AI cs.PF 90%

FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU

Ying Sheng, Lianmin Zheng, Binhang Yuan, Zhuohan Li, Max Ryabinin, Daniel Y. Fu, Zhiqiang Xie, Beidi Chen, Clark Barrett, Joseph E. Gonzalez, Percy Liang, Christopher Ré, Ion Stoica, Ce Zhang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02295 2023-06-06 cs.CL cs.LG 90%

A Mathematical Abstraction for Balancing the Trade-off Between Creativity and Reality in Large Language Models

Ritwik Sinha, Zhao Song, Tianyi Zhou

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15594 2023-05-26 cs.LG cs.CL cs.CR 90%

Flocks of Stochastic Parrots: Differentially Private Prompt Learning for Large Language Models

Haonan Duan, Adam Dziedzic, Nicolas Papernot, Franziska Boenisch

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12356 2023-05-23 cs.LG cs.AI 90%

Integer or Floating Point? New Outlooks for Low-Bit Quantization on Large Language Models

Yijia Zhang, Lingran Zhao, Shijie Cao, Wenqiang Wang, Ting Cao, Fan Yang, Mao Yang, Shanghang Zhang, Ningyi Xu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05027 2023-05-11 cs.LG cs.CL cs.IR 90%

Web Content Filtering through knowledge distillation of Large Language Models

Tamás Vörös, Sean Paul Bergeron, Konstantin Berlin

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04487 2023-04-11 cs.CL cs.AI 90%

Inference with Reference: Lossless Acceleration of Large Language Models

Nan Yang, Tao Ge, Liang Wang, Binxing Jiao, Daxin Jiang, Linjun Yang, Rangan Majumder, Furu Wei

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00612 2023-04-04 cs.CL cs.AI 90%

Eight Things to Know about Large Language Models

Samuel R. Bowman

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.08917 2023-02-20 cs.CL cs.LG 90%

Massively Multilingual Shallow Fusion with Large Language Models

Ke Hu, Tara N. Sainath, Bo Li, Nan Du, Yanping Huang, Andrew M. Dai, Yu Zhang, Rodrigo Cabrera, Zhifeng Chen, Trevor Strohman

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments Accepted to IEEE ICASSP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17593 2025-11-25 cs.LG cs.DC cs.PF 90%

Comparative Analysis of Large Language Model Inference Serving Systems: A Performance Study of vLLM and HuggingFace TGI

大语言模型推理服务系统的比较分析:vLLM和HuggingFace TGI的性能研究

Saicharan Kolluru

机构 * Baltimore, MD, USA(美国马里兰州巴尔的摩)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.LG

AI总结 本文比较了vLLM和HuggingFace TGI在大语言模型推理服务中的性能,发现vLLM在高并发场景下吞吐量更高,而TGI在交互式应用中延迟更低。

Comments 10 pages, benchmarking study of LLM inference systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11837 2025-10-15 cs.CR cs.AI 90%

Countermind: A Multi-Layered Security Architecture for Large Language Models

Dominik Schwarz

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.AI

Comments 33 pages, 3 figures, 6 tables. Keywords: LLM security; defense-in-depth; prompt injection; activation steering; multimodal sandbox; threat modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04466 2025-06-16 cs.AR cs.LG 90%

Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective

Jinhao Li, Jiaming Xu, Shan Huang, Yonghua Chen, Wen Li, Jun Liu, Yaoxiu Lian, Jiayi Pan, Li Ding, Hao Zhou, Yu Wang, Guohao Dai

机构 * Shanghai Jiao Tong University(上海交通大学) SII(上海创新研究院) Infinigence-AI

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.LG

Comments Collect and update results in recent half year. 54 pages. Github link: https://github.com/Kimho666/LLM_Hardware_Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07841 2024-09-17 cs.CL 90%

Do Membership Inference Attacks Work on Large Language Models?

Michael Duan, Anshuman Suri, Niloofar Mireshghallah, Sewon Min, Weijia Shi, Luke Zettlemoyer, Yulia Tsvetkov, Yejin Choi, David Evans, Hannaneh Hajishirzi

专题命中 效率与部署 :language model(title,abstract);large language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted at Conference on Language Modeling (COLM), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19803 2026-08-25 cs.LG cs.AI cs.CL 版本更新 89%

MileGPO: Milestone Inference with Local Evidence for Graph-Based Policy Optimization of Long-Horizon LLM Agents

MileGPO:面向长 horizon LLM 智能体的基于图策略优化的里程碑推理

Bo Qian, Yuting Wu, Shuang Zeng, Huaiyu Wan, Dalin Zhang, Jiqiang Liu

机构 * Beijing Jiaotong University(北京交通大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对长 horizon LLM 智能体强化学习的信用分配难题,提出 MileGPO 方法,通过里程碑发现、RCS、PCC 三项设计提升性能,在 ALFWorld 和 WebShop 上达 SOTA 且分布差距小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10186 2026-08-25 cs.AR 版本更新 89%

FlashAccel: Leveraging High-Bandwidth Flash (HBF) for High-Throughput LLM Inference

FlashAccel:利用高带宽闪存实现高吞吐量语言模型推理

Xinyu Wang, Yalong Xue, Xiaotian Sun, Xiaoyu Zhang, Xinjiang Zhang, Chunmeng Dou, Xueqi Li, Xiaoming Chen

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM推理受HBM容量限制问题,提出FlashAccel系统,将HBF集成到基于HBM的GPU中,通过架构支持、特殊数据布局及引入新管理层和编程模型,在100ms延迟约束下,提升了每GPU吞吐量和能源效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25098 2026-08-25 cs.AI cs.CL cs.LG 版本更新 89%

Revisiting the Effectiveness of LLM Pruning for Test-Time Scaling

重新审视LLM剪枝对测试时缩放的有效性

Ocean Monjur, Shahriar Kabir Nahin, Anshuman Chhabra

机构 * Bellini College of AI, Cybersecurity, and Computing(人工智能、网络安全与计算学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究非结构化剪枝对推理型大语言模型测试时缩放性能的影响,发现其优于结构化剪枝甚至有时超过未剪枝模型,并探讨了层间稀疏分配策略的作用。

Comments Accepted to EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18586 2026-08-24 cs.DC 版本更新 89%

TokenCake: A KV-Cache-centric Serving Framework for LLM-based Multi-Agent Applications

TokenCake: 一种面向基于LLM的多智能体应用的KV缓存中心化服务框架

Zhuohang Bian, Feiyang Wu, Zhuoran Li, Teng Ma, Youwei Zhuo

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出TokenCake,一种面向基于LLM的多智能体应用的KV缓存中心化服务框架,通过智能体感知设计共同优化调度和内存管理,以解决KV缓存中的空间竞争和时间利用率问题,实验表明其显著降低了端到端延迟并提高了GPU内存利用率。

Comments 14 pages, 17 figures, 3 tables, 2 algorithms. Accepted at EuroSys '27

详情

展开后加载摘要…

URL PDF HTML 收藏