arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2410.18146 2024-10-25 cs.CL cs.AI cs.PL 86%

Meaning Typed Prompting: A Technique for Efficient, Reliable Structured Output Generation

Chandra Irugalbandara

专题命中 效率与部署 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12320 2024-10-25 cs.AI cs.LG 86%

TensorOpera Router: A Multi-Model Router for Efficient LLM Inference

Dimitris Stripelis, Zijian Hu, Jipeng Zhang, Zhaozhuo Xu, Alay Dilipbhai Shah, Han Jin, Yuhang Yao, Salman Avestimehr, Chaoyang He

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 14 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14687 2024-10-24 cs.NE cs.CL cs.LG 86%

BrainTransformers: SNN-LLM

Zhengzheng Tang, Eva Zhu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06626 2024-10-24 cs.LG cs.CL 86%

Characterizing the Accuracy -- Efficiency Trade-off of Low-rank Decomposition in Language Models

Chakshu Moar, Faraz Tahmasebi, Michael Pellauer, Hyoukjun Kwon

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12187 2024-10-18 cs.LG cs.AI 86%

DAQ: Density-Aware Post-Training Weight-Only Quantization For LLMs

Yingsong Luo, Ling Chen

专题命中 效率与部署 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10714 2024-10-17 cs.LG cs.AI 86%

SeedLM: Compressing LLM Weights into Seeds of Pseudo-Random Generators

Rasoul Shafipour, David Harrison, Maxwell Horton, Jeffrey Marker, Houman Bedayat, Sachin Mehta, Mohammad Rastegari, Mahyar Najibi, Saman Naderiparizi

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05913 2024-10-15 cs.CL cs.LG 86%

Efficient Stagewise Pretraining via Progressive Subnetworks

Abhishek Panigrahi, Nikunj Saunshi, Kaifeng Lyu, Sobhan Miryoosefi, Sashank Reddi, Satyen Kale, Sanjiv Kumar

专题命中 效率与部署 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04793 2024-10-11 cs.LG cs.CL 86%

SqueezeAttention: 2D Management of KV-Cache in LLM Inference via Layer-wise Optimal Budget

Zihao Wang, Bin Cui, Shaoduo Gan

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15153 2024-10-10 cs.CL cs.AI cs.PF 86%

Performance Characterization of Expert Router for Scalable LLM Inference

Josef Pichlmeier, Philipp Ross, Andre Luckow

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05292 2024-10-10 cs.LG cs.AI q-bio.QM 86%

CaLMFlow: Volterra Flow Matching using Causal Language Models

Sizhuang He, Daniel Levine, Ivan Vrkic, Marco Francesco Bressana, David Zhang, Syed Asad Rizvi, Yangtian Zhang, Emanuele Zappala, David van Dijk

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03953 2024-10-08 cs.CL cs.LG 86%

LLM-TOPLA: Efficient LLM Ensemble by Maximising Diversity

Selim Furkan Tekin, Fatih Ilhan, Tiansheng Huang, Sihao Hu, Ling Liu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03752 2024-10-08 cs.SD cs.AI cs.CL eess.AS 86%

Efficient Streaming LLM for Speech Recognition

Junteng Jia, Gil Keren, Wei Zhou, Egor Lakomkin, Xiaohui Zhang, Chunyang Wu, Frank Seide, Jay Mahadeokar, Ozlem Kalinli

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02425 2024-10-04 cs.DC cs.CL cs.LG 86%

LLM-Pilot: Characterize and Optimize Performance of your LLM Inference Services

Małgorzata Łazuka, Andreea Anghel, Thomas Parnell

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Accepted to the International Conference for High Performance Computing, Networking, Storage and Analysis (SC '24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01724 2024-10-03 cs.CL cs.AI 86%

Auto-Demo Prompting: Leveraging Generated Outputs as Demonstrations for Enhanced Batch Prompting

Longyu Feng, Mengze Hong, Chen Jason Zhang

专题命中 效率与部署 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09111 2024-10-02 cs.AI cs.LG 86%

Inference Optimization of Foundation Models on AI Accelerators

Youngsuk Park, Kailash Budhathoki, Liangfu Chen, Jonas Kübler, Jiaji Huang, Matthäus Kleindessner, Jun Huan, Volkan Cevher, Yida Wang, George Karypis

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments [v2] Tutorial website added [v1] Tutorial published at KDD 2024. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09794 2024-10-01 cs.AI cs.CL 86%

AutoML-guided Fusion of Entity and LLM-based Representations for Document Classification

Boshko Koloski, Senja Pollak, Roberto Navigli, Blaž Škrlj

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at the 2024 Discovery Science Conference, oral presentation track

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09785 2024-10-01 cs.AI cs.CL cs.SE 86%

GoNoGo: An Efficient LLM-based Multi-Agent System for Streamlining Automotive Software Release Decision-Making

Arsham Gholamzadeh Khoee, Yinan Yu, Robert Feldt, Andris Freimanis, Patrick Andersson Rhodin, Dhasarathy Parthasarathy

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04281 2024-10-01 cs.CL cs.AI 86%

Similar Data Points Identification with LLM: A Human-in-the-loop Strategy Using Summarization and Hidden State Insights

Xianlong Zeng, Yijing Gao, Fanghao Song, Ang Liu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10712 2024-09-27 cs.CL cs.AI 86%

An Empirical Study on Cross-lingual Vocabulary Adaptation for Efficient Language Model Inference

Atsuki Yamaguchi, Aline Villavicencio, Nikolaos Aletras

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11155 2024-09-18 cs.DC cs.CL cs.LG cs.PF 86%

ISO: Overlap of Computation and Communication within Seqenence For LLM Inference

Bin Xiao, Lei Su

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02616 2024-09-12 cs.LG cs.AI 86%

Adaptive Layer Splitting for Wireless LLM Inference in Edge Computing: A Model-Based Reinforcement Learning Approach

Yuxuan Chen, Rongpeng Li, Xiaoxue Yu, Zhifeng Zhao, Honggang Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03637 2024-09-09 cs.LG cs.CL 86%

QET: Enhancing Quantized LLM Parameters and KV cache Compression through Element Substitution and Residual Clustering

Yanshu Wang, Wang Li, Zhaoqian Yao, Tong Yang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01483 2024-09-04 cs.LG cs.CL 86%

Revisiting SMoE Language Models by Evaluating Inefficiencies with Task Specific Expert Pruning

Soumajyoti Sarkar, Leonard Lausen, Volkan Cevher, Sheng Zha, Thomas Brox, George Karypis

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);post-training(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10774 2024-08-28 cs.CL cs.LG 86%

Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference

Jiaming Tang, Yilong Zhao, Kan Zhu, Guangxuan Xiao, Baris Kasikci, Song Han

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11849 2024-08-23 cs.CL cs.AI eess.AS 86%

Style-Talker: Finetuning Audio Language Model and Style-Based Text-to-Speech Model for Fast Spoken Dialogue Generation

Yinghao Aaron Li, Xilin Jiang, Jordan Darefsky, Ge Zhu, Nima Mesgarani

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments CoLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00952 2024-08-09 cs.CL cs.LG 86%

MediSwift: Efficient Sparse Pre-trained Biomedical Language Models

Vithursan Thangarasa, Mahmoud Salem, Shreyas Saxena, Kevin Leong, Joel Hestness, Sean Lie

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

Comments 14 pages, 2 Figures, 5 Tables (Main Paper) + 3 pages (Supplementary Material). Published at ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03561 2024-08-08 cs.CR cs.AI cs.LG 86%

MPC-Minimized Secure LLM Inference

Deevashwer Rathee, Dacheng Li, Ion Stoica, Hao Zhang, Raluca Popa

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01935 2024-08-06 cs.CL cs.AI 86%

Defining and Evaluating Decision and Composite Risk in Language Models Applied to Natural Language Inference

Ke Shen, Mayank Kejriwal

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments arXiv admin note: text overlap with arXiv:2310.03283

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01453 2024-08-06 cs.CY cs.AI cs.CL 86%

Reporting and Analysing the Environmental Impact of Language Models on the Example of Commonsense Question Answering with External Knowledge

Aida Usmanova, Junbo Huang, Debayan Banerjee, Ricardo Usbeck

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments Presented at Bonn Sustainable AI 2023 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05908 2024-07-30 cs.CL cs.LG 86%

Predictive Pipelined Decoding: A Compute-Latency Trade-off for Exact LLM Decoding

Seongjun Yang, Gibbeum Lee, Jaewoong Cho, Dimitris Papailiopoulos, Kangwook Lee

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments ES-FoMo Workshop at ICML 2023 / Published in TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏